Saltar al contenido
Matemáticas para Economía40 temas · 7 asignaturas · 42 ECTS
Tema 33 de 40

Autocorrelación y multicolinealidad

12 h estimadas21.432 EconometríaGretl

1. La pregunta

Dos problemas distintos que se estudian juntos porque los dos afectan a los errores estándar sin sesgar los coeficientes, y porque los dos se diagnostican mal.

El primero. Si un trimestre las ventas quedan por encima de lo que el modelo predice, ¿qué pasará el trimestre siguiente? En datos temporales, casi siempre lo mismo: los errores se arrastran. Eso rompe el supuesto de que las perturbaciones son independientes entre sí.

El segundo. Un modelo incluye «renta» y «gasto en consumo», que van casi siempre juntos. El es del 92 %, el conjunto es enorme, y sin embargo ningún coeficiente es significativo. No hay error de cálculo: es que los datos no contienen información suficiente para separar los dos efectos.

2. Intuición

Autocorrelación

La perturbación recoge todo lo no observado. Si eso incluye el ciclo económico, una huelga que dura tres meses o un cambio de gustos que se instala, entonces lo que afectó a este periodo afectará al siguiente. Los errores no son sorpresas independientes: tienen memoria.

Consecuencia menos obvia de lo que parece. MCO sigue apuntando al blanco: los coeficientes son insesgados. Lo que falla es la contabilidad de la información. Con errores correlacionados, cien observaciones contienen menos información que cien observaciones independientes —muchas repiten en parte lo que ya decían las anteriores—, y MCO no lo sabe: calcula los errores estándar como si toda la muestra fuera nueva. Por eso los subestima y las variables parecen más significativas de lo que son.

Es el mismo problema que si se encuestara diez veces a las mismas cien personas y se tratara el resultado como mil encuestas.

Y una causa que hay que descartar antes que ninguna otra: una autocorrelación fuerte suele deberse a que falta un regresor con inercia o a que la forma funcional es incorrecta, no a que las perturbaciones tengan una dinámica propia. Corregirla sin mirar eso es tapar un aviso.

Multicolinealidad

El tema 30 explicaba que el coeficiente de usa solo la variación de que no comparten las demás variables. Si y se mueven casi siempre juntas, esa variación propia es minúscula, y estimar su efecto por separado es como pedir que distingas el efecto de dos interruptores que siempre se accionan a la vez.

No es un error del modelo ni un incumplimiento de supuestos. Gauss-Markov sigue cumpliéndose y MCO sigue siendo ELIO. Es un problema de los datos: no traen la información necesaria. Por eso no hay «solución» estadística, solo formas de convivir con ello o de conseguir mejores datos.

3. Formalización

Autocorrelación

Definición

En forma matricial, la matriz de varianzas deja de ser diagonal:

La heterocedasticidad del tema 32 cambiaba la diagonal; la autocorrelación llena los elementos de fuera de la diagonal.

El esquema más habitual es el autorregresivo de primer orden, AR(1):

con lo que

La correlación decae geométricamente con la distancia temporal. La condición es la de estacionariedad, y se estudia a fondo en el tema 38.

  • : autocorrelación positiva. Los errores persisten. Es lo habitual en economía.
  • : negativa. Los errores alternan de signo. Aparece con datos sobrediferenciados o efectos de ajuste excesivo.

Consecuencias

Idénticas a las de la heterocedasticidad:

Propiedad¿Se mantiene?
Insesgadez
ConsistenciaSí, si los regresores son estrictamente exógenos
EficienciaNo
Errores estándar de MCONo válidos

Con , los errores estándar de MCO están sesgados a la baja, los inflados y el artificialmente alto. Es la receta para creer que se ha encontrado una relación que no existe.

Caso grave: variable dependiente retardada. Si el modelo incluye como regresor y hay autocorrelación, MCO deja de ser insesgado y deja de ser consistente, porque está correlacionada con y por tanto con . Ahí el problema ya no es de eficiencia sino de sesgo, y se resuelve con los métodos del tema 34.

Detección

Gráfico de residuos frente al tiempo. Siempre primero. Con se ven rachas largas del mismo signo; con , un serrucho.

Contraste de Durbin-Watson. El clásico, para AR(1):

Interpretación
autocorrelación positiva fuerte
sin autocorrelación
autocorrelación negativa fuerte

Se compara con dos valores tabulados, y , y hay una zona de indecisión entre ellos donde el contraste no concluye.

Limitaciones importantes: solo detecta AR(1), exige término constante, y no es válido si el modelo incluye la variable dependiente retardada —justo el caso más frecuente en series temporales—. Para ese caso existe la de Durbin.

Contraste de Breusch-Godfrey. El recomendable, y el que se usa hoy. Contrasta autocorrelación de orden y sí admite variables dependientes retardadas.

  1. Estimar el modelo por MCO y guardar .
  2. Regresar sobre todos los regresores originales y sobre .
  3. bajo de no autocorrelación.

Incluir los regresores originales en la auxiliar es lo que lo hace válido con retardos de .

Soluciones

1. Revisar la especificación. Antes que nada. Autocorrelación fuerte suele significar que falta dinámica: un retardo de , un retardo de , una tendencia, una estacionalidad. Añadirlos suele hacerla desaparecer, y además mejora el modelo.

2. Errores estándar HAC (Newey-West). Análogos a los de White, pero robustos a heterocedasticidad y autocorrelación. Se mantiene MCO y se corrige solo la inferencia. Es la opción por defecto cuando la autocorrelación es residual y no se quiere modelar.

3. MCG con transformación de Cochrane-Orcutt. Si el esquema es AR(1) con conocido, se transforma el modelo restando veces la ecuación retardada:

La nueva perturbación es ruido blanco. Como no se conoce, se estima de los residuos y se itera (Cochrane-Orcutt) o se estima conjuntamente (Prais-Winsten, que además conserva la primera observación).

4. Modelar la dinámica explícitamente. Es lo que hará el bloque 8.

Multicolinealidad

Definición

Perfecta: una columna de es combinación lineal exacta de otras. Entonces , la matriz es singular y el estimador no existe (tema 7). Es un error de especificación —la trampa de las dummies del tema 31— y el software lo detecta.

Aproximada o alta: las columnas están muy correlacionadas pero no son exactamente dependientes. El determinante de es casi cero, la inversa tiene elementos enormes, y con ella la varianza de los coeficientes.

Esto no viola ningún supuesto de Gauss-Markov. MCO sigue siendo insesgado y ELIO. El problema es que «el mejor posible» sigue siendo malo cuando los datos no informan.

Consecuencias

  • Varianzas y errores estándar muy grandes, luego pequeños y coeficientes no significativos.
  • Coeficientes inestables: cambian mucho al añadir o quitar unas pocas observaciones o una variable.
  • Signos contrarios a lo esperado.
  • alto y significativo con todos los no significativos. Es la firma característica.
  • Las predicciones siguen siendo buenas, siempre que se mantenga la misma relación entre las variables.

Esa última línea es clave: si el objetivo es predecir, la multicolinealidad no es un problema. Si es interpretar coeficientes, sí.

Detección

Matriz de correlaciones. Correlaciones por encima de 0,8 entre regresores son sospechosas. Pero es insuficiente: puede haber multicolinealidad entre tres variables sin que ninguna pareja esté muy correlacionada.

Factor de inflación de la varianza (VIF). El indicador estándar:

donde es el de regresar sobre todos los demás regresores.

Lectura
10sin colinealidad
50,80atención
100,90problema serio

El nombre es literal: la varianza del coeficiente es veces mayor de lo que sería si fuera ortogonal a las demás. Un de 10 significa que el error estándar es veces mayor.

El umbral de 10 es convencional, no una ley. Lo relevante es si los intervalos de confianza resultantes son lo bastante estrechos para responder a la pregunta.

Soluciones

1. No hacer nada. Es una respuesta legítima y a menudo la mejor. Si las variables con alto son controles y el coeficiente de interés está bien estimado, el problema no afecta a la pregunta.

2. Conseguir más datos, o datos con más variación independiente. Es la única solución real, porque el problema es de información.

3. Eliminar una variable. Tentador y peligroso: si la variable pertenece al modelo, quitarla introduce sesgo por variable omitida (tema 29). Se cambia varianza por sesgo.

Es un caso del dilema del error cuadrático medio del tema 25: a veces compensa, a veces no.

4. Combinar variables. Si «renta del padre» y «renta de la madre» son colineales, usar «renta familiar». Se pierde el detalle pero se gana precisión, y muchas veces la pregunta económica no necesitaba el detalle.

5. Contrastar conjuntamente. Si no se puede separar el efecto de y , al menos se puede contrastar con un (tema 30), que será concluyente.

Lo que NO hay que hacer: eliminar variables una a una hasta que todos los salgan significativos. Eso produce un modelo que parece bueno y cuyos coeficientes están sesgados.

4. Ejemplo económico resuelto

Problema. Se modela el consumo agregado trimestral de un país con 60 trimestres:

Los resultados por MCO:

VariableCoef.ee
Constante42,318,72,26
renta0,4120,2871,44
riqueza0,0380,0311,23
tipo1,09

Los VIF son: renta 12,4; riqueza 11,8; tipo 1,3.

  1. Diagnostica los problemas.
  2. ¿Por qué el es enorme y ningún significativo?
  3. ¿Qué hacer con cada problema?

Paso 1. Diagnóstico.

Autocorrelación. , muy lejos de 2.

Autocorrelación positiva fuerte. Con y , los valores tabulados son aproximadamente y ; como , se rechaza la ausencia de autocorrelación sin ambigüedad.

Multicolinealidad. Renta y riqueza tienen VIF por encima de 10: problema serio. Se entiende económicamente —renta y riqueza crecen juntas con el ciclo— y se refleja en que para ambas. El tipo de interés, con VIF 1,3, está limpio.

Paso 2. El enorme con todos los pequeños.

Rechaza abrumadoramente que los tres coeficientes sean cero. Y sin embargo ninguno supera (el del tipo se queda en 1,96, rozándolo).

No es contradicción. Los datos dicen con enorme claridad que el conjunto de variables explica el consumo; lo que no pueden decir es cuál de ellas. Renta y riqueza llevan casi la misma información, y el modelo no puede repartir el mérito entre las dos.

Es exactamente la firma de la multicolinealidad, y aquí aparece agravada porque la autocorrelación debería haber inflado los y aun así son bajos: sin ella serían aún menores.

Paso 3. Qué hacer, en orden.

Primero, la autocorrelación, porque puede ser un síntoma de especificación.

Con y datos trimestrales de consumo, la explicación más probable es que falta la dinámica: el consumo tiene una fuerte inercia (hábitos, contratos, ajuste lento). El modelo estático ignora eso, y la inercia se refugia en la perturbación.

La corrección adecuada no es Cochrane-Orcutt sino especificar bien el modelo:

Este es un modelo dinámico con multiplicador de impacto y multiplicador total, a largo plazo,

(Esta distinción entre multiplicador de impacto y total es uno de los contenidos que los exámenes de Econometría de la UOC preguntan.)

Advertencia: con en el modelo, el Durbin-Watson deja de ser válido. Hay que usar Breusch-Godfrey. Y si aún quedara autocorrelación, MCO sería inconsistente, no solo ineficiente, y habría que ir a variables instrumentales.

Si tras especificar bien queda autocorrelación residual: errores estándar HAC de Newey-West.

Segundo, la multicolinealidad. Aquí hay que decidir según el objetivo.

Si el objetivo es predecir el consumo: no hacer nada. Con el modelo predice bien, y la multicolinealidad no afecta a las predicciones mientras renta y riqueza sigan moviéndose juntas.

Si el objetivo es estimar la propensión marginal a consumir (), hay tres vías:

  • Contrastar conjuntamente . Dará un rechazo claro y permite afirmar que renta y riqueza importan, aunque no repartir el efecto.
  • Imponer una restricción teórica, si la teoría la aporta. Por ejemplo, si un modelo de ciclo vital sugiere una relación fija entre las propensiones a consumir renta y riqueza, se impone y se contrasta con un de restricciones.
  • Buscar más variación: datos de panel por regiones u hogares, donde renta y riqueza no van tan de la mano como en el agregado nacional. Esta es la única solución de fondo.

Lo que NO hay que hacer: eliminar «riqueza» porque su es el más bajo. Si la riqueza afecta al consumo —y la teoría dice que sí, es el efecto riqueza—, quitarla sesga al alza, porque riqueza y renta están positivamente correlacionadas y ambas elevan el consumo (tema 29). Se ganaría un bonito y se perdería la insesgadez.

5. Errores típicos

Creer que la autocorrelación sesga los coeficientes. No los sesga, salvo que haya variable dependiente retardada. Afecta a eficiencia y errores estándar.

Aplicar Durbin-Watson con en el modelo. No es válido: está sesgado hacia 2 y no detecta la autocorrelación aunque exista. Hay que usar Breusch-Godfrey o la de Durbin.

Corregir la autocorrelación sin revisar la especificación. Cochrane-Orcutt sobre un modelo al que le falta un retardo es tapar el aviso. La autocorrelación es, la mayoría de las veces, un síntoma de dinámica omitida.

Confundir autocorrelación con heterocedasticidad. La primera afecta a los elementos de fuera de la diagonal de ; la segunda, a los de dentro. Los contrastes y las correcciones son distintos.

Tratar la multicolinealidad como un incumplimiento de supuestos. No lo es. Gauss-Markov se cumple y MCO es ELIO. Es un problema de información en los datos.

Eliminar variables hasta que los salgan bien. Produce coeficientes sesgados con apariencia de solidez. El criterio para incluir una variable es la teoría, no su .

Interpretar un VIF alto como prueba de que hay que hacer algo. Si la variable con VIF alto es un control y el coeficiente de interés está bien estimado, no pasa nada.

Olvidar que la multicolinealidad no afecta a la predicción. Si el objetivo es predecir y la estructura de correlación se mantiene, el modelo funciona perfectamente.

6. Ejercicios

Ejercicio 1 · Interpretar el Durbin-Watson

básico

Cuatro modelos con series temporales dan de 0,42; 1,95; 2,08 y 3,60.

Estima en cada caso e interpreta.

Ver solución

Usando :

Interpretación
0,42autocorrelación positiva muy fuerte
1,95prácticamente sin autocorrelación
2,08sin autocorrelación apreciable
3,60autocorrelación negativa fuerte

El primer caso es el típico de un modelo estático sobre series con inercia: casi con seguridad falta dinámica.

El cuarto caso es menos común y suele indicar sobrediferenciación: se ha diferenciado una serie que no lo necesitaba, y la transformación ha introducido correlación negativa artificial. Es un fenómeno que reaparece en el tema 36.

Los casos 2 y 3 son los deseables. Nótese que nunca sale exactamente 2, y no hace falta: lo relevante es si cae dentro de la zona de no rechazo tabulada.

Ejercicio 2 · Calcular e interpretar VIF

básico

En un modelo con tres regresores, al regresar cada uno sobre los otros dos se obtiene , , .

  1. Calcula los VIF.
  2. ¿Cuánto se inflan los errores estándar?
  3. ¿Qué recomiendas?
Ver solución

1.

2. El error estándar se infla en :

VariableVIFInflación del ee
1,33
8,33
16,67

El error estándar de es cuatro veces mayor de lo que sería si no compartiera variación con las otras. Su intervalo de confianza es cuatro veces más ancho.

3. Recomendación. Depende de para qué es el modelo:

  • Si es la variable de interés y , son controles: no hacer nada. El coeficiente que importa está bien estimado (VIF 1,33).
  • Si es la variable de interés: hay un problema real. Con un intervalo cuatro veces más ancho, probablemente no se pueda concluir nada útil sobre su efecto. Opciones: conseguir datos con más variación independiente, combinar y en un índice si miden lo mismo, o al menos contrastar conjuntamente .
  • Si el modelo es para predecir: no hacer nada, la multicolinealidad no afecta.

Lo que no procede es eliminar solo porque su VIF sea alto. Si pertenece al modelo, quitarla sesga los demás coeficientes.

Ejercicio 3 · Breusch-Godfrey y modelo dinámico

medio

Se estima con 80 trimestres

y se obtiene . Al añadir , el nuevo modelo da y un contraste de Breusch-Godfrey de orden 1 con .

  1. ¿Por qué no se puede usar en el segundo modelo?
  2. Interpreta el resultado de Breusch-Godfrey.
  3. Si en el modelo dinámico, calcula el efecto a largo plazo de las ventas sobre la inversión.
Ver solución

1. Porque el modelo incluye la variable dependiente retardada. El estadístico de Durbin-Watson está sesgado hacia 2 en ese caso: tiende a no detectar autocorrelación aunque exista, y su tabla de valores críticos deja de ser válida.

Además, con presente, la autocorrelación tiene una consecuencia mucho más grave: estaría correlacionada con y MCO sería inconsistente. Detectarla bien es por tanto más importante, no menos.

2. Breusch-Godfrey.

La autocorrelación ha desaparecido al añadir el retardo. Eso confirma el diagnóstico: el problema del primer modelo no era una dinámica propia de las perturbaciones, sino que faltaba la inercia de la inversión, que se había refugiado en el error.

Es el caso ideal: se ha resuelto especificando mejor, no aplicando una corrección mecánica. Y el modelo resultante es además económicamente más informativo.

3. Efecto a largo plazo. En el modelo

el multiplicador de impacto es : el efecto en el mismo trimestre.

Para el largo plazo se busca el equilibrio, donde la inversión se estabiliza en un valor y las ventas en :

El multiplicador total es 0,474, más del doble del de impacto.

Interpretación. Un aumento permanente de las ventas de 1 unidad eleva la inversión 0,18 unidades el primer trimestre, y va acumulando hasta llegar a 0,474 en el equilibrio de largo plazo. La diferencia es el efecto de la inercia: la inversión de hoy arrastra la de mañana.

Cuánto tarda. El ajuste es geométrico con razón . Tras trimestres se ha completado una fracción del ajuste total:

La distinción entre multiplicador de impacto y total es exactamente lo que un modelo estático no puede dar, y es una de las razones de fondo para especificar la dinámica en lugar de corregir la autocorrelación.

Ejercicio 4 · Decidir qué hacer con la multicolinealidad

avanzado

Un economista laboral estima el efecto de la formación sobre el salario:

Obtiene : formación 2,1; educación 3,4; experiencia 14,8; antigüedad 13,9. Y .

Los resultados: (ee 0,019), (ee 0,014), (ee 0,013).

  1. ¿Hay un problema de multicolinealidad? ¿Afecta a la pregunta de investigación?
  2. ¿Qué explica la colinealidad entre experiencia y antigüedad?
  3. Propón tres actuaciones y evalúalas.
Ver solución

1. ¿Hay problema y a quién afecta?

Sí lo hay, pero no donde importa.

  • Formación, la variable de interés, tiene : bajísimo. Su error estándar está inflado solo un , y el coeficiente es claramente significativo:

El intervalo al 95 % es , es decir, entre un 2,5 % y un 10 % más de salario. Es un intervalo ancho pero informativo: el efecto es positivo con seguridad.

  • Experiencia y antigüedad tienen y ninguna es significativa ( y ).

Conclusión: la multicolinealidad afecta a dos controles, no a la variable de interés. La pregunta de investigación se puede responder.

2. Por qué son colineales. Porque son casi lo mismo para buena parte de la muestra. Quien lleva 20 años trabajando y nunca ha cambiado de empresa tiene 20 de experiencia y 20 de antigüedad. La variación independiente entre ambas viene solo de quienes han cambiado de empleo, que es un subconjunto de la muestra.

Eso explica el : el 93 % de la variación de la experiencia se explica por la antigüedad y las demás variables.

3. Tres actuaciones y su evaluación.

(a) No hacer nada. — Recomendada.

La variable de interés está bien estimada. Experiencia y antigüedad cumplen su función de controles: absorben la variación salarial ligada a la trayectoria laboral, que es lo que se necesita para que no la recoja. Que sus coeficientes individuales sean imprecisos no importa, porque no se van a interpretar.

Es importante, eso sí, no interpretarlos: sería incorrecto escribir «la experiencia no afecta al salario» a partir de .

(b) Sustituir por «experiencia» y «experiencia en otras empresas». — Buena alternativa.

Definiendo

se obtienen dos variables mucho menos correlacionadas —una es el tiempo en la empresa actual, la otra el tiempo antes de llegar— y con interpretación económica más clara: el capital humano específico de la empresa frente al general.

El modelo es algebraicamente equivalente al original —se ha hecho un cambio de base lineal— así que el ajuste, los residuos y no cambian. Lo único que cambia es la lectura de los coeficientes, que pasa a ser interpretable.

Es la mejor opción si además interesan esos efectos.

(c) Eliminar la antigüedad. — No recomendada.

Reduciría el VIF de la experiencia, pero introduce sesgo por variable omitida. La antigüedad afecta al salario (, aunque imprecisa) y está muy correlacionada con la experiencia, así que quedaría sesgado al alza.

Y más importante: podría contaminar también si la formación está correlacionada con la antigüedad —las empresas forman a quien lleva tiempo—. Se comprometería la variable de interés para arreglar un problema que no afectaba a la variable de interés.

Conclusión. La opción (b) es la más elegante: resuelve la colinealidad sin coste, porque es una reparametrización, no una eliminación de información. La (a) es perfectamente defendible. La (c) es el error clásico.

Lección general. Ante multicolinealidad, la primera pregunta no es «¿cómo la elimino?» sino «¿afecta al coeficiente que me interesa?». Muy a menudo la respuesta es no, y entonces la actuación correcta es ninguna.

7. Qué desbloquea

Necesitas antes:

Te abre la puerta a:

8. Recursos externos

  • OCW UPV/EHU — «Análisis de Regresión con Gretl». Autocorrelación, Durbin-Watson, Breusch-Godfrey y modelos dinámicos, con la distinción entre multiplicador de impacto y total que preguntan los exámenes de la UOC.
  • Wooldridge. Su capítulo de series temporales trata con cuidado el caso de la variable dependiente retardada, y el de regresión múltiple explica por qué la multicolinealidad no viola ningún supuesto.
  • Gretl. Tras estimar, Contrastes → Autocorrelación ejecuta Breusch-Godfrey del orden que se pida; los VIF están en Análisis → Colinealidad; los errores HAC se activan en las opciones de estimación con datos de series temporales.