Saltar al contenido
Matemáticas para Economía40 temas · 7 asignaturas · 42 ECTS
Tema 29 de 40

Modelo estadístico, correlación frente a causalidad y regresión simple por MCO

12 h estimadas21.418 Introducción a la econometríaGretl

1. La pregunta

Los datos dicen que cada año adicional de estudios se asocia con un 8 % más de salario. ¿Significa eso que estudiar un año más te subirá el sueldo un 8 %?

No necesariamente. Quien estudia más puede ser también más capaz, tener mejores contactos o venir de una familia con más recursos —y todo eso sube el salario por su cuenta—. El 8 % mezcla el efecto de estudiar con el de todo lo demás que va junto con estudiar.

Este tema hace dos cosas: enseña a calcular ese 8 % (mínimos cuadrados) y enseña a desconfiar de él. La segunda es la más importante, y es lo que separa la econometría de dibujar una recta entre puntos.

2. Intuición

El modelo. Se sospecha que una variable, , depende de otra, . Pero no de forma exacta: dos personas con los mismos años de estudio ganan cosas distintas. El modelo separa lo sistemático de lo demás:

Ese «todo lo demás» es la perturbación, y no es un residuo molesto: es donde vive todo lo que no se ha medido. Casi todos los problemas de la econometría vienen de ahí.

Mínimos cuadrados. Entre todas las rectas posibles, se elige la que deja los puntos más cerca. ¿Cerca en qué sentido? Se suman los cuadrados de las distancias verticales y se minimiza esa suma.

Por qué al cuadrado. Porque si se sumaran las distancias con signo, se cancelarían. Y porque el cuadrado es derivable, lo que permite resolver el problema con las herramientas del tema 5 en lugar de por tanteo.

Por qué distancias verticales. Porque lo que se quiere es predecir a partir de , y el error de predicción es vertical. Si se midieran perpendiculares, la recta cambiaría, y la de « sobre » no coincide con la de « sobre ».

Y la advertencia central. La recta describe una asociación. Para que el coeficiente sea un efecto causal hace falta que la perturbación no tenga nada que ver con : que los años de estudio no vengan acompañados sistemáticamente de otras ventajas. Casi nunca es así, y la econometría de los temas siguientes trata en el fondo de eso.

3. Formalización

El modelo de regresión lineal simple

SímboloNombreQué es
variable dependiente o endógenalo que se quiere explicar
variable independiente, regresor o explicativalo que explica
término constante o interceptovalor esperado de cuando
pendienteefecto de una unidad más de sobre
perturbacióntodo lo demás que afecta a

y son parámetros poblacionales: constantes desconocidas. es no observable.

El objeto de interés es casi siempre , y su lectura es marginal: . Es la derivada del tema 3 en versión estadística.

Estimación por mínimos cuadrados ordinarios

Se minimiza la suma de cuadrados de los residuos:

Condiciones de primer orden (derivando respecto de cada parámetro e igualando a cero):

Resolviendo el sistema —las ecuaciones normales— se obtiene:

Es un problema de optimización del bloque 1, y la condición de segundo orden se cumple porque es una función cuadrática convexa: el punto crítico es el mínimo global (tema 13).

Dos propiedades que salen de las ecuaciones normales:

  • : los residuos suman cero.
  • : los residuos son ortogonales al regresor.
  • La recta pasa siempre por el punto .

Estas propiedades se cumplen por construcción, siempre, aunque el modelo sea absurdo. No son evidencia de nada.

Los supuestos clásicos

Para que tenga buenas propiedades hacen falta:

SupuestoEnunciadoSi falla
1. Linealidad en parámetrosmala especificación
2. Muestreo aleatorioobservaciones i.i.d.sesgo de selección
3. Variación en no se puede estimar
4. Media condicional nulasesgo, no hay causalidad
5. Homocedasticidadtema 32

El supuesto 4 es el decisivo y el que casi nunca se cumple. Dice que lo no observado no está relacionado con . Si las personas con más estudios tienen además más capacidad, y la capacidad está en , entonces y no mide el efecto causal de estudiar.

Propiedades del estimador

Bajo los supuestos 1 a 4, MCO es insesgado:

Añadiendo el 5, su varianza es

Tres lecturas de esta fórmula, todas útiles en la práctica:

  • Más varianza en estimación más precisa. Si todos los individuos tienen estudios parecidos, no se puede aprender nada del efecto de estudiar.
  • Más ruido menos precisión.
  • Más observaciones el sumatorio crece y la varianza baja.

Como es desconocida, se estima con

El divisor son los grados de libertad: se han estimado dos parámetros, por la misma lógica del del tema 25.

Teorema de Gauss-Markov. Bajo los supuestos 1 a 5, MCO es el estimador lineal insesgado óptimo (ELIO, o BLUE en inglés): de mínima varianza entre todos los lineales e insesgados. Se demuestra en el tema 30 para el caso general.

Bondad del ajuste

Descomposición de la variabilidad, análoga a la del ANOVA del tema 28:

Es la proporción de la variabilidad de explicada por el modelo, entre 0 y 1.

En regresión simple, , el cuadrado del coeficiente de correlación del tema 20.

Lo que NO dice:

  • No dice que el modelo sea correcto. Un modelo mal especificado puede tener alto.
  • No dice que haya causalidad.
  • No permite comparar modelos con distinta variable dependiente.

Un bajo es normal en datos de sección cruzada —las personas son muy heterogéneas— y no invalida el modelo. Un altísimo en series temporales suele ser sospechoso, y el tema 38 explicará por qué.

Inferencia sobre los coeficientes

donde es el error estándar, la raíz de la varianza estimada. El contraste habitual es no influye»), y es exactamente el contraste del tema 27 aplicado a un coeficiente.

Intervalo de confianza:

Correlación frente a causalidad

Que e estén correlacionadas admite cuatro explicaciones, y los datos por sí solos no distinguen entre ellas:

  1. causa . Lo que se busca.
  2. causa (causalidad inversa). Las ciudades con más policías tienen más delitos: los policías no causan el delito, se destinan donde lo hay.
  3. Una tercera variable causa ambas (variable omitida). El helado y los ahogamientos suben juntos: los causa el calor.
  4. Casualidad, sobre todo si se han probado muchas relaciones.

Sesgo por variable omitida. Si el modelo verdadero es y se omite :

donde es la pendiente de regresar sobre . El sesgo tiene el signo del producto :

Correlación -Sesgo
al alza
a la baja
a la baja
al alza

En el ejemplo del salario: la capacidad sube el salario () y está correlacionada positivamente con los estudios (), luego el coeficiente de educación está sesgado al alza. El 8 % es un techo, no una estimación del efecto causal.

Saber el signo del sesgo es casi tan útil como corregirlo, porque permite acotar la conclusión.

4. Ejemplo económico resuelto

Problema. Se estudia la relación entre gasto en publicidad (, miles de €) y ventas (, miles de €) en 8 tiendas de una cadena:

Tienda12345678
101512208181411
85110951307512010590
  1. Estima la recta de regresión.
  2. Interpreta los coeficientes.
  3. Calcula y contrasta la significación de la pendiente.
  4. Discute si el coeficiente mide el efecto causal de la publicidad.

Paso 1. Cálculos previos.

Desviaciones y productos:

producto
156,87512,25264,06
21,58,7513,1252,2576,56
39,3752,2539,06
46,528,75186,87542,25826,56
5144,37530,25689,06
64,518,7584,37520,25351,56
70,53,751,8750,2514,06
828,1256,25126,56
Σ00525,00116,002387,50

Paso 2. Coeficientes.

Paso 3. Interpretación.

  • : cada mil euros adicionales de publicidad se asocian con 4526 € más de ventas.
  • : una tienda sin publicidad vendería 40 150 €. Cuidado con esta lectura: el rango observado de va de 8 a 20, así que está fuera de los datos y la extrapolación no está respaldada por nada. En muchos modelos el intercepto no tiene interpretación útil.

Paso 4. Bondad del ajuste. Calculamos usando :

Un del 99,5 %: la publicidad explica casi toda la variabilidad de las ventas entre tiendas.

Paso 5. Inferencia sobre la pendiente.

Con , se rechaza con muchísimo margen ().

Intervalo de confianza al 95 %:

Paso 6. La pregunta que importa: ¿es causal?

Probablemente no, o no del todo. Tres razones:

(a) Causalidad inversa. ¿Las tiendas gastan más en publicidad porque venden más? Si el presupuesto publicitario se asigna en proporción a las ventas del año anterior —práctica habitual—, la relación va en sentido contrario al supuesto, y el coeficiente no mide nada interpretable como efecto.

(b) Variable omitida: el tamaño de la tienda. Las tiendas grandes venden más y gastan más en publicidad. El modelo verdadero sería

Con (más superficie, más ventas) y (más superficie, más presupuesto publicitario), el sesgo es al alza:

El efecto real de la publicidad es menor que 4,53. Saber el signo del sesgo ya permite acotar: la publicidad rinde como mucho 4,53 € por euro, probablemente bastante menos.

(c) El del 99,5 % es una señal de alarma, no de calidad. Un ajuste casi perfecto entre dos variables económicas con ocho observaciones sugiere que ambas están medidas sobre la misma escala subyacente —el tamaño de la tienda—, no que se haya descubierto una ley.

Cómo se resolvería. Añadiendo el tamaño como regresor, que es la regresión múltiple del tema 30; o, si la causalidad inversa persiste, con variables instrumentales (tema 34). La solución no es recoger más datos: el sesgo por variable omitida no desaparece con .

5. Errores típicos

Interpretar el coeficiente como efecto causal sin justificarlo. Es el error central de la econometría aplicada. Un coeficiente significativo mide asociación; para que mida causalidad hace falta argumentar que .

Extrapolar fuera del rango de los datos. La recta se ha estimado entre y . Predecir para no está respaldado por nada.

Interpretar el intercepto sin comprobar que tiene sentido. En muchos modelos, es imposible o está fuera de los datos.

Usar como criterio de calidad. Un alto no valida el modelo, y uno bajo no lo invalida. Lo que importa es si los supuestos se sostienen.

Confundir significación con magnitud. Con muchos datos, un coeficiente de 0,001 puede ser significativo. Hay que mirar si el efecto es económicamente relevante, como en el tema 27.

Olvidar que los residuos suman cero por construcción. No es evidencia de que el modelo esté bien: se cumple siempre, incluso con un modelo absurdo.

Regresar sobre cuando la teoría dice lo contrario. La recta de sobre es distinta. Hay que decidir cuál es la variable dependiente por razones económicas, no estadísticas.

Creer que más datos corrigen el sesgo por variable omitida. No lo hacen: el estimador converge, pero al valor equivocado. Más datos dan más precisión sobre un número sesgado.

6. Ejercicios

Ejercicio 1 · Estimar una recta

básico

Con los datos siguientes de renta (, miles de €) y consumo (, miles de €) de 5 hogares:

2030254035
1825223228

Estima la recta de regresión e interpreta la pendiente.

Ver solución
producto
70100
0000
1525
10770100
531525
170250

Interpretación. Cada 1000 € adicionales de renta se asocian con 680 € más de consumo. En términos macroeconómicos, es la propensión marginal a consumir, y 0,68 es un valor perfectamente plausible.

El intercepto, 4600 €, sería el consumo autónomo: lo que se consume sin renta, financiado con ahorro o transferencias. Aquí sí tiene interpretación económica, aunque esté fuera del rango observado.

Ejercicio 2 · Bondad del ajuste e inferencia

básico

Con los resultados del ejercicio 1, calcula y contrasta si la pendiente es significativa al 5 %. Se sabe que .

Ver solución

Inferencia:

Con : se rechaza ampliamente.

Intervalo de confianza al 95 %:

La propensión marginal a consumir está entre 0,61 y 0,75.

Advertencia sobre el . Un 99,7 % con cinco hogares no es prueba de nada: con tan pocos datos es fácil que una recta se ajuste bien por casualidad. Los grados de libertad son solo 3.

Ejercicio 3 · Signo del sesgo por variable omitida

medio

Se estima y sale €/año. Un colega señala que falta la variable «formación continua», que:

  • aumenta el salario;
  • está negativamente correlacionada con la experiencia (los empleados veteranos se forman menos).
  1. Determina el signo del sesgo.
  2. ¿El efecto real de la experiencia es mayor o menor que 850?
  3. ¿Qué pasaría si en vez de eso faltara «antigüedad en la empresa», positivamente correlacionada con la experiencia y que también sube el salario?
Ver solución

1. El modelo verdadero es , y

donde es la pendiente de regresar formación sobre experiencia.

  • : la formación sube el salario.
  • : más experiencia, menos formación.

2. Como , se tiene :

El efecto real de la experiencia es MAYOR que el estimado. La estimación está contaminada por el hecho de que los más experimentados se forman menos, lo que resta salario y enmascara parte del efecto de la experiencia.

3. Con «antigüedad en la empresa»: y .

Aquí el coeficiente estimado sobreestima el efecto de la experiencia, porque está recogiendo también el efecto de llevar más tiempo en la misma empresa.

La lección práctica. No hace falta observar la variable omitida para saber en qué dirección se equivoca la estimación: basta con conocer los dos signos. Y eso permite acotar la conclusión de forma honesta: «el efecto de la experiencia es de al menos 850 €/año» en el primer caso, «de como mucho 850 €/año» en el segundo.

Un caso especial útil. Si la variable omitida no está correlacionada con el regresor (), no hay sesgo aunque la variable importe mucho. Omitirla solo aumenta la varianza residual y, con ella, los errores estándar.

Ejercicio 4 · Cuatro explicaciones para la misma correlación

avanzado

Un estudio encuentra que las empresas con más gasto en I+D tienen un 3,2 % más de productividad, con y .

  1. Formula las cuatro explicaciones posibles de esa correlación, con un ejemplo concreto de cada una.
  2. Para cada una, di qué datos o diseño harían falta para descartarla.
  3. Un directivo propone: «invirtamos un 10 % más en I+D y ganaremos un 0,32 % de productividad». Evalúa la propuesta.
Ver solución

1. Las cuatro explicaciones.

(a) I+D causa productividad. La hipótesis deseada: investigar genera procesos y productos mejores. Plausible y probablemente cierta en parte.

(b) Causalidad inversa: la productividad causa el I+D. Las empresas más productivas generan más beneficios y pueden permitirse investigar. La flecha va del beneficio al gasto, no al revés. Muy plausible, porque el I+D es un gasto discrecional que se recorta primero en las empresas con problemas.

(c) Variable omitida. Por ejemplo, la calidad de la dirección: una empresa bien gestionada invierte en I+D y es productiva, sin que lo uno cause lo otro. Otras candidatas: el sector (farmacia investiga mucho y tiene márgenes altos), el tamaño, la antigüedad, el acceso a financiación.

(d) Casualidad. Menos probable con , pero relevante si el estudio probó muchas variables y publicó la que salió. Es el problema de comparaciones múltiples del tema 28 trasladado a la investigación aplicada.

2. Cómo descartar cada una.

(b) Causalidad inversa. Usar datos desfasados: relacionar el I+D del año con la productividad del año . La productividad futura no puede causar el gasto pasado. No es una solución perfecta —si la empresa era ya productiva en , el problema persiste— pero ayuda mucho.

(c) Variable omitida. Dos vías:

  • Regresión múltiple (tema 30): incluir sector, tamaño, antigüedad y todo lo observable. Limitación: la calidad de la dirección no se observa.
  • Datos de panel con efectos fijos: seguir a las mismas empresas en el tiempo y explotar solo la variación dentro de cada empresa. Así se eliminan todas las características que no cambian, incluida la calidad de la dirección si es estable.

(d) Casualidad. Preregistrar la hipótesis antes de mirar los datos, y replicar el estudio en otra muestra o país.

El caso ideal sería un experimento: asignar al azar subvenciones de I+D a unas empresas y no a otras. Existen evaluaciones así con programas públicos, y son la evidencia más creíble. Cuando no es posible, el tema 34 ofrece las variables instrumentales, que buscan una fuente de variación en el I+D ajena a la productividad —por ejemplo, un cambio normativo en las deducciones fiscales que afectó a unas empresas y no a otras—.

3. Evaluación de la propuesta del directivo. Es injustificada por tres motivos distintos, y conviene separarlos:

Primero, la causalidad. El 3,2 % es una asociación. Si buena parte viene de causalidad inversa o de la calidad de la dirección, aumentar el gasto en I+D no producirá ese retorno. Una empresa mal gestionada que gaste más en I+D no se convierte en una empresa bien gestionada.

Segundo, la interpretación numérica. Si el coeficiente es 3,2 % por unidad de gasto (y no una elasticidad), multiplicarlo por el 10 % es un error de lectura. Y aunque fuera una elasticidad, aplicarla a un salto del 10 % supone linealidad en un rango que quizá no se ha observado.

Tercero, y aunque el efecto fuera causal: el 41 % de significa que el 59 % de la variabilidad de la productividad viene de otras cosas. Una ganancia del 0,32 % es diminuta comparada con esa variabilidad, y perfectamente puede quedar enterrada bajo el ruido de un año cualquiera.

Recomendación. Si la empresa quiere saber si el I+D le rinde, lo que necesita es variación propia y exógena: por ejemplo, aumentar el presupuesto en unas divisiones y no en otras, elegidas al azar, y comparar. Eso es un experimento y contesta la pregunta. Extrapolar de una regresión de sección cruzada, no.

7. Qué desbloquea

Necesitas antes:

Te abre la puerta a:

8. Recursos externos

  • OCW UPV/EHU — «Análisis de Regresión con Gretl» (Mª Victoria Esteban). El mejor recurso de todo el plan. Curso abierto en español, totalmente aplicado: los conceptos estadístico-econométricos se introducen a partir de los ejemplos prácticos. PDF completo descargable, y todo el desarrollo va con Gretl.
  • Curso de Econometría — Hugo Maul (Universidad Francisco Marroquín). Vídeos ordenados por temas; los de MCO y modelo lineal general encajan aquí.
  • Wooldridge, Introducción a la econometría: un enfoque moderno. Su capítulo de regresión simple es el que mejor explica el supuesto de media condicional nula y el sesgo por variable omitida.
  • Gretl. Trae cargadas las bases de datos de los manuales de introducción a la econometría, incluidas las de Wooldridge. Modelo → Mínimos cuadrados ordinarios con cualquiera de ellas reproduce los ejemplos de los libros en segundos.