Saltar al contenido
Matemáticas para Economía40 temas · 7 asignaturas · 42 ECTS
Tema 31 de 40

Variables dummy y formas funcionales (log-log, log-lin)

11 h estimadas21.418 Introducción a la econometría + 21.432 EconometríaGretl

1. La pregunta

Dos preguntas que el modelo lineal, tal como está, no puede responder.

La primera: ¿cuánto influye ser mujer en el salario? «Ser mujer» no es un número: no se puede tener 2,3 unidades de mujer. Hace falta traducir una característica cualitativa a algo que la regresión pueda usar.

La segunda: el efecto de un año más de estudios, ¿son 1200 € o un 8 %? No es lo mismo: 1200 € significan mucho más para quien gana 18 000 que para quien gana 60 000. La forma funcional decide cuál de las dos cosas se está estimando, y elegirla mal cambia por completo la lectura del resultado.

2. Intuición

Variables dummy: interruptores. Una variable que vale 0 o 1 es un interruptor. Su coeficiente mide cuánto se desplaza la recta cuando el interruptor está encendido: mismo efecto de todas las demás variables, distinto punto de partida.

Con eso ya se pueden meter en el modelo el sexo, la comunidad autónoma, el sector, si la empresa exporta, si el año fue de crisis. Cualquier característica cualitativa.

La trampa que todo el mundo pisa una vez. Si se crea una dummy para «hombre» y otra para «mujer», su suma es siempre 1… que es exactamente la columna de la constante. Las tres columnas son linealmente dependientes, es singular y el modelo no se puede estimar (tema 30). La solución es omitir una categoría, que pasa a ser la referencia.

Formas funcionales: elegir en qué unidades se mide el efecto. Tomar logaritmos convierte diferencias absolutas en diferencias relativas. Y esa transformación no es un truco estadístico: es lo que hace que el coeficiente sea directamente una elasticidad, el concepto del tema 4.

La razón por la que casi todos los salarios se modelan en logaritmos es que los efectos salariales son porcentuales, no absolutos: un ascenso «sube el sueldo un 15 %», no «sube el sueldo 4000 €».

3. Formalización

Variables dummy

Una variable ficticia o dummy toma el valor 1 si se cumple una condición y 0 si no.

En el modelo

el coeficiente mide la diferencia de nivel entre los dos grupos, con la misma educación:

Dos rectas paralelas: misma pendiente, distinta ordenada. El grupo con la dummy a 0 es la categoría de referencia.

Variables cualitativas con más de dos categorías

Con categorías se crean dummies. Para la variable «sector» con tres valores (industria, servicios, construcción), tomando industria como referencia:

  • : diferencia de servicios respecto de industria.
  • : diferencia de construcción respecto de industria.
  • La diferencia entre servicios y construcción es , y contrastar si es cero requiere un contraste de restricción lineal del tema 30.

Trampa de las variables dummy. Incluir las dummies y la constante genera multicolinealidad perfecta, porque las dummies suman exactamente la columna de unos. Hay dos salidas: omitir una dummy (lo habitual) o omitir la constante (menos frecuente, cambia la interpretación).

La elección de la referencia no cambia el modelo, solo la lectura de los coeficientes. El ajuste, los residuos y las predicciones son idénticos.

Interacciones

Una dummy sola desplaza la recta. Multiplicada por una variable continua, cambia la pendiente:

  • Hombres: .
  • Mujeres: .

es la diferencia de nivel; , la diferencia de rendimiento de la educación entre ambos grupos. Contrastar es contrastar que los dos grupos tienen la misma ecuación salarial: es el contraste de Chow.

Las cuatro formas funcionales

ModeloEcuación mideSe lee
Nivel-niveluna unidad más de unidades de
Log-niveluna unidad más de de
Nivel-log1 % más de unidades de
Log-log1 % más de de

El log-log estima directamente elasticidades. Es la conexión exacta con el tema 4, donde se demostró que .

Deducción del caso log-nivel. Derivando respecto de con la regla de la cadena del tema 3:

es decir, el cambio relativo en por unidad de .

Cuándo usar logaritmos

A favor:

  • La variable es siempre positiva y muy asimétrica (salarios, ventas, precios, patrimonio).
  • Se espera que los efectos sean proporcionales, no absolutos.
  • Reduce el impacto de valores extremos y suele atenuar la heterocedasticidad del tema 32.
  • Los coeficientes se interpretan sin unidades y son comparables entre estudios.

En contra o imposible:

  • La variable puede ser cero o negativa. no existe (tema 2). Sumar 1 antes de tomar el logaritmo es un parche frecuente y cuestionable: cambia la interpretación y depende de las unidades.
  • La variable ya está en porcentaje o es una proporción (tasa de paro, cuota de mercado): tomar logaritmos de un porcentaje complica la lectura sin ganar nada.
  • Variables que pueden ser cero por naturaleza económica, como el gasto en I+D de empresas que no investigan.

Coeficientes grandes: la corrección exacta

La lectura « por ciento» es una aproximación de primer orden, válida para coeficientes pequeños. El efecto exacto de una dummy en un modelo log-nivel es

AproximadoExacto
0,055,0 %5,1 %
0,2020,0 %22,1 %
0,5050,0 %64,9 %
1,00100,0 %171,8 %

Hasta 0,10 la aproximación es aceptable; a partir de 0,20 conviene usar la fórmula exacta. El error siempre va en el mismo sentido: la aproximación subestima los efectos positivos.

Términos cuadráticos

El efecto marginal depende del nivel de . Con y , hay un máximo en

que es la condición de primer orden del tema 5. Es la forma habitual de modelar la relación entre experiencia y salario, o entre tamaño de empresa y productividad.

El modelo sigue siendo lineal en parámetros, así que MCO es válido.

4. Ejemplo económico resuelto

Problema. Con datos de 600 asalariados se estima

VariableCoeficienteError estándar
Constante1,9210,082
educ (años)0,08470,0061
exper (años)0,04120,0053
exper²0,00011
mujer0,0743
mujer × educ0,0055

con y .

  1. Interpreta el coeficiente de la educación para hombres y para mujeres.
  2. Calcula la brecha salarial de género con 10 y con 16 años de estudios.
  3. ¿A cuántos años de experiencia se alcanza el salario máximo?
  4. Contrasta si la interacción es significativa e interpreta.

Paso 1. Rendimiento de la educación.

Para hombres (mujer = 0):

Un año más de estudios sube el salario un 8,47 % (exacto: ).

Para mujeres (mujer = 1):

Un 7,08 % por año de estudios.

Primera conclusión: la educación rinde menos a las mujeres, 1,4 puntos porcentuales menos por año.

Paso 2. Brecha salarial según el nivel educativo. La diferencia entre mujer y hombre, con la misma experiencia, es

Con 10 años de estudios:

Con 16 años:

La brecha crece con el nivel educativo: del 30 % al 35,7 %.

Nótese la importancia de usar la fórmula exacta. La aproximación daría y : sobreestimaría la brecha en 6 y 8 puntos. Con coeficientes de esta magnitud, la aproximación lineal ya no sirve.

Paso 3. Máximo de la experiencia. El efecto marginal es

Se anula en

Comprobación de segundo orden: , luego es un máximo (tema 5).

Interpretación. El salario crece con la experiencia hasta los 26 años de carrera y a partir de ahí decrece ligeramente. Es el perfil salarial típico, y el modelo cuadrático lo captura; un modelo lineal habría impuesto crecimiento indefinido.

Cuantificando: el primer año de experiencia añade un 4,1 %; el año 20, un ; el año 30, un .

Paso 4. Contraste de la interacción.

Con grados de libertad, .

Valor p .

Conclusión. Hay evidencia de que el rendimiento de la educación es significativamente menor para las mujeres. No solo cobran menos en general (efecto ): además cada año de formación les compensa menos.

Advertencia obligada sobre la interpretación. Este coeficiente no demuestra discriminación. Podría reflejar diferencias no observadas en el tipo de estudios elegidos, en las interrupciones de carrera, en la jornada, o en el sector de destino. Para hablar de discriminación haría falta controlar por todo eso —y aun así quedaría el problema de que algunas de esas variables son ellas mismas consecuencia de la discriminación, y por tanto malos controles, como se vio en el ejercicio 4 del tema 30—.

Lo que el modelo establece es un hecho descriptivo robusto: con la misma educación y experiencia medidas, las mujeres de esta muestra ganan entre un 30 % y un 36 % menos, y la diferencia se ensancha con el nivel educativo.

5. Errores típicos

La trampa de las dummies. Incluir todas las categorías más la constante hace singular a . Siempre dummies para categorías.

Olvidar cuál es la categoría de referencia. Un coeficiente de dummy no tiene sentido absoluto: siempre es «respecto a la categoría omitida». Sin decir cuál es, el número no significa nada.

Usar la aproximación porcentual con coeficientes grandes. A partir de 0,2 hay que usar . El error llega a 70 puntos con .

Interpretar el coeficiente de ignorando el término cuadrático. Con y en el modelo, el efecto marginal es , no . El coeficiente lineal solo es el efecto marginal en .

Interpretar el coeficiente de una variable que aparece en una interacción. En el ejemplo, es el rendimiento de la educación para hombres, no para el conjunto. Y es la brecha con cero años de estudios, un valor que puede no existir en los datos.

Tomar logaritmos de variables con ceros. Devuelve infinito o error. Sumar 1 es un parche que cambia la interpretación y depende de las unidades: en euros, ln(x+1) no es lo mismo que en miles de euros.

Comparar entre un modelo en niveles y otro en logaritmos. No son comparables: la variable dependiente es distinta y la variabilidad total también.

Elegir la forma funcional por el . Se elige por la teoría económica y por la interpretación deseada. Si lo que interesa es una elasticidad, log-log; si un efecto absoluto, niveles.

6. Ejercicios

Ejercicio 1 · Interpretar formas funcionales

básico

Interpreta el coeficiente 0,15 en cada uno de estos modelos:

  1. (ambas en miles de €)
Ver solución

1. Nivel-nivel. Mil euros más de publicidad se asocian con 150 € más de ventas.

(Un retorno pésimo: gastar 1000 para ganar 150. Los números importan tanto como la interpretación.)

2. Log-nivel. Mil euros más de publicidad se asocian con un 15 % más de ventas (exacto: ).

3. Nivel-log. Un 1 % más de publicidad se asocia con miles de € más de ventas, es decir, 1,50 € más.

4. Log-log. Un 1 % más de publicidad se asocia con un 0,15 % más de ventas. El coeficiente es la elasticidad.

Cuál usar. Para publicidad y ventas, la 4 suele ser la más razonable: los efectos publicitarios son proporcionales al tamaño del negocio, y una elasticidad de 0,15 es directamente comparable con la de otros estudios y otros sectores.

Ejercicio 2 · Dummies con varias categorías

básico

Se estima con datos de 200 viviendas:

donde la categoría de referencia es «zona intermedia».

  1. Interpreta las dos dummies.
  2. ¿Cuál es la diferencia entre centro y periferia?
  3. ¿Qué habría pasado incluyendo también una dummy para «intermedia»?
Ver solución

1.

  • Centro (0,18): una vivienda del centro cuesta un más que una de zona intermedia de los mismos metros cuadrados.
  • Periferia (): una vivienda de periferia cuesta un , es decir, un 22,1 % menos que una intermedia equivalente.

2. Diferencia centro-periferia.

Una vivienda del centro cuesta un 53,7 % más que una de periferia de igual superficie.

Cuidado con la inferencia. Para contrastar si esa diferencia es significativa no basta con mirar los dos por separado: hay que contrastar , que es una restricción lineal del tema 30. En Gretl se escribe directamente como b[centro] - b[periferia] = 0.

3. Incluyendo las tres dummies. Sería la trampa de las variables dummy: como toda vivienda está en una de las tres zonas,

para toda observación, y esa suma coincide exactamente con la columna de la constante. Habría multicolinealidad perfecta, sería singular y el modelo no se podría estimar. Gretl (y cualquier software) devolvería un error o eliminaría una variable por su cuenta.

Ejercicio 3 · Interacción y efecto marginal

medio

Se estima el efecto de la formación sobre la productividad de una plantilla:

  1. Calcula el efecto de una hora más de formación para titulados y no titulados.
  2. ¿A partir de cuántas horas de formación un no titulado alcanzaría la productividad de un titulado con cero horas?
  3. ¿Qué recomendarías a la empresa sobre a quién formar?
Ver solución

1. Efectos marginales.

Para no titulados (titulado = 0):

Para titulados (titulado = 1):

La formación rinde un 46 % más a los titulados (). Es un patrón habitual: la formación previa hace más productiva la formación adicional.

2. Horas necesarias para igualar. Se busca el número de horas tal que un no titulado con horas iguale a un titulado con 0 horas:

Apenas 2 horas de formación bastan para compensar la ventaja inicial de la titulación.

3. Recomendación, con matices.

El argumento directo: formar titulados rinde más por hora (6 % frente a 4,1 %), así que si el presupuesto de formación es limitado y solo mide productividad, hay que dirigirlo a los titulados.

Pero hay tres matices que cambian la respuesta:

  • El punto de partida importa. Un 4,1 % sobre una base baja puede ser un aumento absoluto mayor que un 6 % sobre una base alta. Con el modelo en logaritmos, el efecto absoluto es , así que depende del nivel de productividad de cada grupo. Si los titulados ya producen mucho más, la comparación en porcentajes no basta para decidir.
  • Los rendimientos decrecientes no están en el modelo. Este modelo es lineal en horas: predice que 200 horas de formación multiplicarían la productividad por . Absurdo. La linealidad solo vale en el rango observado, y para decidir sobre programas intensivos habría que añadir un término cuadrático.
  • Causalidad. ¿Se asignó la formación al azar? Si la empresa forma a quien ya destaca, el coeficiente recoge esa selección y no el efecto de formar.

Recomendación prudente: dentro del rango de horas observado, priorizar a los titulados, pero sin extrapolar y comprobando antes cómo se asignó la formación en los datos.

Ejercicio 4 · Elegir la forma funcional

avanzado

Un analista dispone de datos de 400 empresas sobre ventas, empleo, gasto en I+D (que es cero en el 35 % de las empresas) y antigüedad.

Debe estimar el efecto del empleo y del I+D sobre las ventas.

  1. ¿Qué forma funcional propone para cada variable y por qué?
  2. ¿Cómo trata el problema de los ceros en I+D?
  3. Escribe el modelo final e interpreta cada coeficiente.
Ver solución

1. Forma funcional.

Ventas (dependiente): logaritmo. Es una variable positiva, muy asimétrica —unas pocas empresas enormes y muchas pequeñas—, y los efectos sobre ella son proporcionales. Tomar logaritmos además suele atenuar la heterocedasticidad que aparece cuando la dispersión crece con el nivel (tema 32).

Empleo: logaritmo. Positivo, asimétrico, y el coeficiente resultante será directamente la elasticidad ventas-empleo, que es el parámetro con contenido económico y comparable con la literatura.

Antigüedad: nivel, y probablemente con término cuadrático. Está acotada, no es asimétrica, y su efecto es plausiblemente no monótono: las empresas jóvenes crecen deprisa, las maduras se estancan.

I+D: aquí está el problema, y lo trata el apartado siguiente.

2. El problema de los ceros. No se puede tomar . Hay tres salidas y conviene conocer sus costes:

(a) . Es el parche más común y el peor justificado. Depende de las unidades: si el I+D está en euros, sumar 1 es despreciable; si está en millones, es enorme. Y la interpretación del coeficiente deja de ser una elasticidad limpia. No recomendado salvo como comprobación de robustez.

(b) Descartar las empresas sin I+D. Se pierde el 35 % de la muestra y se introduce sesgo de selección: las empresas que no investigan no son un subconjunto aleatorio. No recomendado.

(c) Dummy más intensidad. Es la solución estándar y la que se propone:

y para las que investigan, la intensidad en logaritmos. Formalmente se incluye y , con la convención de que el segundo término es 0 cuando no hay I+D.

Así se separan dos efectos distintos: el de investigar o no (el margen extensivo) y el de investigar más (el margen intensivo). Son preguntas económicas diferentes y merecen coeficientes diferentes.

3. Modelo final.

Interpretación de cada coeficiente:

  • : elasticidad ventas-empleo. Un 1 % más de plantilla se asocia con más de ventas, con lo demás constante.

  • y : el efecto marginal de la antigüedad es , expresado en tanto por uno de ventas por año. Si , el máximo está en años.

  • : diferencia de ventas entre una empresa que investiga con (es decir, I+D de una unidad monetaria) y una que no investiga nada. Su interpretación depende de las unidades del I+D, y por eso conviene centrar la variable: usar hace que sea la diferencia respecto de una empresa con I+D medio, que sí es interpretable.

  • : elasticidad ventas-I+D entre las empresas que investigan. Un 1 % más de gasto en I+D se asocia con más de ventas.

Contrastes de interés:

  • (el I+D no importa en absoluto): contraste conjunto.
  • (rendimientos constantes del empleo): restricción lineal.

Nota metodológica final. Nada de esto resuelve la causalidad: las empresas que más venden pueden ser las que pueden permitirse investigar, exactamente el problema del ejercicio 4 del tema 29. La forma funcional decide qué se está midiendo; no convierte una correlación en un efecto.

7. Qué desbloquea

Necesitas antes:

Te abre la puerta a:

8. Recursos externos

  • OCW UPV/EHU — «Análisis de Regresión con Gretl». Variables ficticias, interacciones y contraste de Chow, todo desarrollado con datos reales en Gretl.
  • Wooldridge. Su capítulo sobre variables cualitativas es el estándar, y trata con cuidado la corrección exacta y el problema de los ceros en logaritmos.
  • Curso de Econometría — Hugo Maul. Formas funcionales y su interpretación.
  • Gretl. Crear dummies es inmediato con Añadir → Variables ficticias, y las interacciones con Añadir → Definir nueva variable escribiendo el producto. Al estimar, Gretl avisa si detecta colinealidad perfecta.