Heterocedasticidad, mínimos cuadrados generalizados y normalidad
1. La pregunta
Se modela el gasto en ocio de los hogares en función de su renta. Los hogares que ingresan 1200 € gastan todos entre 40 y 90 €: poco margen para variar. Los que ingresan 8000 € gastan entre 200 y 2500 €: unos viajan, otros ahorran.
El error de predicción no es igual de grande en todos los tramos, y eso incumple el supuesto 5 de Gauss-Markov del tema 30. La pregunta es qué consecuencias tiene: si invalida la estimación entera, si solo afecta a los contrastes, y qué se puede hacer.
La respuesta importa porque este incumplimiento es la norma, no la excepción, en datos de sección cruzada. Y es uno de los temas que los exámenes de Econometría de la UOC preguntan de forma recurrente.
2. Intuición
Qué es la homocedasticidad. Que la dispersión del error sea la misma para todos los valores de las variables explicativas. Dibujando los residuos contra los valores ajustados, debe verse una banda de anchura constante. Si se ve un embudo que se abre, hay heterocedasticidad.
Por qué MCO sigue siendo insesgado. Porque la insesgadez depende del supuesto 4 ——, que dice que el error está centrado en cero. La heterocedasticidad afecta a su dispersión, no a su centro. El estimador sigue apuntando al blanco; lo que pasa es que ya no es el más preciso posible.
Por qué sí rompe la inferencia. La fórmula se dedujo suponiendo varianza constante. Con heterocedasticidad esa fórmula calcula mal la varianza, y con ella los errores estándar, los estadísticos y los valores p. Normalmente los subestima, de modo que las variables parecen más significativas de lo que son.
La solución intuitiva. Si unas observaciones son más ruidosas que otras, no tiene sentido darles a todas el mismo peso. Las fiables deben pesar más. Eso es mínimos cuadrados ponderados, y su generalización son los mínimos cuadrados generalizados (MCG).
Y la solución pragmática. Si no se sabe cómo varía la varianza —lo habitual—, se puede dejar el estimador MCO como está y corregir solo los errores estándar. Es lo que hacen los errores robustos de White, y es lo que se usa por defecto en la práctica moderna.
3. Formalización
Definición
Homocedasticidad:
Heterocedasticidad:
En forma matricial, el supuesto 5 del tema 30 era . Ahora
Sigue siendo diagonal —no hay autocorrelación, eso es el tema 33— pero con elementos distintos.
Consecuencias
| Propiedad | ¿Se mantiene? |
|---|---|
| Insesgadez de | Sí |
| Consistencia | Sí |
| Eficiencia (ELIO) | No |
| Validez de | No |
| Validez de los contrastes y | No |
Lo esencial en una frase: los coeficientes siguen siendo correctos en promedio; la inferencia deja de serlo. Y como en la práctica lo que se publica son los y los valores p, el problema es serio.
La varianza correcta bajo heterocedasticidad es
expresión conocida como forma de sándwich, y que solo coincide con cuando .
Detección
Gráfico de residuos. El primer paso, siempre. Se dibujan (o ) frente a o frente a cada regresor. Un patrón de embudo delata el problema.
Contraste de Breusch-Pagan. Contrasta si la varianza depende linealmente de los regresores.
- Estimar el modelo por MCO y guardar los residuos .
- Regresar sobre todos los regresores.
- El estadístico es bajo de homocedasticidad.
Contraste de White. Más general: incluye también los cuadrados y los productos cruzados de los regresores. Detecta cualquier forma de heterocedasticidad y también algunos errores de especificación, lo que es a la vez su virtud y su defecto: un rechazo no dice necesariamente que el problema sea la varianza.
con el número de regresores de la auxiliar.
Contraste de Goldfeld-Quandt. Ordena las observaciones por la variable sospechosa, descarta el tercio central, estima el modelo en cada extremo y compara las varianzas residuales con un estadístico . Sencillo de entender, menos usado hoy.
Solución 1: errores estándar robustos
Se mantiene de MCO y se estima la matriz de sándwich sustituyendo por :
Son los errores estándar de White o robustos a heterocedasticidad.
Ventajas: no exige conocer la forma de la heterocedasticidad, es válido asintóticamente sea cual sea, y no cambia los coeficientes.
Inconveniente: solo corrige la inferencia, no recupera la eficiencia. Y en muestras pequeñas la corrección funciona regular.
En la práctica moderna es la opción por defecto. El coste de usarlos cuando no hacían falta es pequeño; el de no usarlos cuando hacían falta, grande.
Solución 2: mínimos cuadrados generalizados
Si se conoce , existe una matriz tal que . Premultiplicando el modelo por se obtiene uno transformado con perturbaciones homocedásticas, y aplicando MCO ahí:
Teorema de Aitken: MCG es ELIO bajo heterocedasticidad. Recupera la eficiencia que MCO pierde.
Caso particular: mínimos cuadrados ponderados. Si con conocido, basta con dividir toda la ecuación por :
La nueva perturbación tiene varianza constante: .
Equivale a ponderar cada observación por : las observaciones más ruidosas pesan menos. Nótese que también hay que dividir la constante, y por eso el modelo transformado no tiene término independiente en el sentido habitual.
MCG factibles. Como nunca se conoce, se estima. Un procedimiento habitual supone , estima regresando sobre , y usa los valores ajustados como pesos.
Riesgo: si la forma supuesta para es incorrecta, los MCG factibles pueden ser peores que MCO con errores robustos. Es la razón práctica de que estos últimos se hayan impuesto.
El supuesto de normalidad
Es el supuesto 6, y conviene situarlo con precisión porque es otra de las preguntas recurrentes de los exámenes de la UOC.
Para qué hace falta:
- Para que tenga distribución exactamente normal y los contrastes y sean exactos en muestras pequeñas.
Para qué NO hace falta:
- No es necesaria para la insesgadez ni la consistencia.
- No forma parte de Gauss-Markov: MCO es ELIO sin ella.
- Con muestras grandes, el teorema central del límite del tema 24 hace que los contrastes sean válidos asintóticamente aunque los errores no sean normales.
Contraste de Jarque-Bera. Compara la asimetría y la curtosis de los residuos con las de una normal:
con el coeficiente de asimetría y el exceso de curtosis del tema 20.
Qué hacer si se rechaza. Con grande, casi nada: la inferencia sigue siendo válida. Con pequeño, hay que sospechar: puede haber valores atípicos, una forma funcional equivocada o variables omitidas. La no normalidad suele ser un síntoma más que una enfermedad.
4. Ejemplo económico resuelto
Problema. Con 250 hogares se estima
Los resultados por MCO y con errores robustos son:
| Variable | Coeficiente | ee (MCO) | ee (robusto) |
|---|---|---|---|
| Constante | 18,63 | 24,15 | |
| renta | 0,0834 | 0,0071 | 0,0128 |
| miembros | 14,72 | 6,84 | 7,03 |
El contraste de White da con 5 grados de libertad.
- Contrasta la heterocedasticidad.
- Compara la inferencia con y sin errores robustos.
- Aplica mínimos cuadrados ponderados suponiendo .
- ¿Qué habría pasado con el modelo en logaritmos?
Paso 1. Contraste de White.
Valor p . Hay heterocedasticidad, como cabía esperar en un modelo de gasto frente a renta.
Paso 2. Comparación de la inferencia.
El estadístico se reduce casi a la mitad. Con 247 grados de libertad ambos siguen siendo ampliamente significativos, así que la conclusión cualitativa no cambia.
Pero el intervalo de confianza sí:
El intervalo robusto es un 80 % más ancho. La propensión marginal a gastar en ocio está entre 5,8 y 10,9 céntimos por euro, no entre 6,9 y 9,7. Usar los errores de MCO habría transmitido una precisión inexistente.
Nótese el patrón: los errores estándar de MCO son menores que los robustos, que es lo habitual con heterocedasticidad creciente. MCO exagera la significación.
Para «miembros», en cambio, los dos errores estándar son casi iguales (6,84 y 7,03): la heterocedasticidad está ligada a la renta, no al tamaño del hogar.
Paso 3. Mínimos cuadrados ponderados. Suponemos , es decir, y .
Se divide toda la ecuación por la renta:
Tres cosas que hay que notar:
- La nueva variable dependiente es la proporción de renta gastada en ocio, que además tiene sentido económico propio.
- El antiguo pasa a ser la constante del modelo transformado.
- El antiguo pasa a ser el coeficiente de , y el modelo transformado no lleva término constante propio.
La perturbación transformada tiene varianza
constante: el modelo transformado es homocedástico y MCO sobre él es ELIO.
Cuándo compensa. Si el supuesto sobre la forma de la varianza es correcto, MCP da estimaciones más precisas que MCO robusto. Si es incorrecto, puede dar peores. Por eso conviene comprobar el resultado con el contraste de White aplicado al modelo transformado: si sigue rechazando, la ponderación elegida no era la buena.
Paso 4. El modelo en logaritmos.
Muy probablemente la heterocedasticidad desaparecería o se reduciría mucho. La razón es que el problema venía de que la dispersión absoluta crece con la renta; si la dispersión relativa es aproximadamente constante —los hogares ricos varían un ±40 % y los pobres también—, entonces en logaritmos la varianza sí es constante.
Y hay un beneficio añadido: pasa a ser la elasticidad renta del gasto en ocio, un parámetro con interpretación económica directa (tema 31). Si sale mayor que 1, el ocio es un bien de lujo.
La lección práctica. Antes de recurrir a MCG o a errores robustos, conviene preguntarse si la heterocedasticidad no es un síntoma de forma funcional equivocada. Muy a menudo lo es, y cambiar a logaritmos resuelve el problema y mejora la interpretación a la vez.
5. Errores típicos
Creer que la heterocedasticidad sesga los coeficientes. No los sesga. Afecta a la eficiencia y, sobre todo, a los errores estándar. Es el punto que más se confunde con el tema 34, donde el problema sí es de sesgo.
Publicar contrastes de MCO tras detectar heterocedasticidad. Los valores p son incorrectos, normalmente demasiado pequeños. O se usan errores robustos, o MCG.
Interpretar un rechazo de White como prueba de heterocedasticidad pura. White también detecta formas funcionales mal especificadas. Conviene mirar antes los gráficos de residuos y plantearse si falta un término cuadrático o unos logaritmos.
Aplicar MCP con una forma de varianza inventada. Si el supuesto sobre es falso, el resultado puede ser peor que MCO. Hay que justificar la ponderación y comprobarla después.
Olvidar transformar la constante en MCP. Al dividir por hay que dividir toda la ecuación, incluida la columna de unos. Si no, el modelo transformado está mal.
Confundir normalidad con homocedasticidad. Son supuestos distintos. Jarque-Bera contrasta normalidad; White y Breusch-Pagan, homocedasticidad. Rechazar uno no dice nada del otro.
Preocuparse por la normalidad con muestras grandes. Con grande la inferencia es válida asintóticamente aunque los errores no sean normales. La no normalidad importa sobre todo como síntoma de otros problemas.
Usar errores robustos con muestras muy pequeñas sin corrección. La corrección de White es asintótica; con conviene usar las variantes con corrección por grados de libertad (HC2, HC3), que Gretl ofrece.
6. Ejercicios
Ejercicio 1 · Contraste de Breusch-Pagan
básicoUn modelo con 3 regresores y 120 observaciones da unos residuos cuya regresión auxiliar — sobre los tres regresores— tiene .
Contrasta la homocedasticidad al 5 %.
Ver solución
Grados de libertad: el número de regresores de la auxiliar, .
Valor p .
Conclusión. Hay evidencia de heterocedasticidad al 5 %. Los errores estándar de MCO no son válidos, y hay que usar errores robustos o investigar la fuente.
Siguiente paso recomendado: mirar qué regresor de la auxiliar es significativo. Eso indica de qué variable depende la varianza, e informa tanto de una posible ponderación para MCP como de si el problema es realmente de forma funcional.
Ejercicio 2 · Efecto sobre la inferencia
básicoUn coeficiente vale , con error estándar de MCO igual a 0,98 y robusto igual a 1,42. La muestra tiene 80 observaciones y 4 regresores.
Contrasta con ambos y comenta.
Ver solución
Grados de libertad: . Valor crítico .
Con errores de MCO:
.
Con errores robustos:
.
Comentario. La conclusión se invierte. Con los errores de MCO la variable parecería relevante al 5 %; con los robustos, no lo es.
Si hay heterocedasticidad —y la discrepancia entre los dos errores estándar es en sí misma un indicio—, la conclusión válida es la robusta: no hay evidencia suficiente al 5 %.
Este es exactamente el daño que hace la heterocedasticidad: no cambia el coeficiente (2,45 en ambos casos) pero puede convertir un hallazgo en un espejismo. Y como el sesgo de los errores de MCO suele ser a la baja, el error va sistemáticamente en la dirección de publicar efectos que no están ahí.
Ejercicio 3 · Mínimos cuadrados ponderados
medioSe estima con datos de 30 comunidades el modelo
Se sospecha que , porque el gasto de una comunidad grande es la suma de más unidades individuales.
- Escribe el modelo transformado.
- Comprueba que es homocedástico.
- ¿Por qué esa forma de la varianza es razonable?
Ver solución
1. Con , se divide toda la ecuación por :
y simplificando el término de , ya que :
Sin término constante. Los dos regresores son y , y sus coeficientes son los parámetros originales.
2. Homocedasticidad del modelo transformado.
Constante. Se ha usado del tema 22, con , que es una constante conocida para cada observación.
3. Por qué la varianza proporcional a la población es razonable.
El gasto sanitario de una comunidad es la suma del gasto de sus habitantes:
Si los gastos individuales son independientes con varianza , entonces por la propiedad de la varianza de una suma (tema 22):
La varianza es proporcional al número de habitantes, que es exactamente el supuesto.
Esta es la situación en que MCP está mejor justificado: cuando la heterocedasticidad tiene un origen estructural conocido —datos agregados con distinto número de unidades subyacentes— y no es una conjetura. En esos casos, MCP domina claramente a los errores robustos, porque además de corregir la inferencia recupera la eficiencia.
Comprobación posterior obligada: aplicar el contraste de White al modelo transformado. Si sigue rechazando, el supuesto sobre la varianza era incompleto.
Ejercicio 4 · Diagnóstico completo
avanzadoUn investigador estima el gasto de las familias en educación privada:
con . Obtiene:
- Contraste de White: , 9 g.l.
- Jarque-Bera sobre los residuos:
- El gráfico de residuos frente a muestra un embudo claro que se abre.
- El 28 % de las familias tiene gasto cero.
- Diagnostica los problemas.
- Ordena las soluciones por prioridad.
- ¿Es la heterocedasticidad el problema principal?
Ver solución
1. Diagnóstico.
(a) Heterocedasticidad confirmada. y : se rechaza con contundencia. El embudo lo confirma visualmente.
(b) No normalidad severa. y es enorme. Con la inferencia sería válida asintóticamente, así que por sí sola no sería preocupante. Pero un de esa magnitud apunta a algo estructural.
(c) El 28 % de ceros: este es el hallazgo importante. No es un detalle del enunciado: es una censura en la variable dependiente. El gasto no puede ser negativo, y hay una masa de probabilidad concentrada exactamente en cero.
2. Diagnóstico jerarquizado. Los tres síntomas tienen una misma causa, y por eso el orden importa.
Con el 28 % de observaciones en cero:
- Los residuos no pueden ser normales: hay un montón de puntos apilados en el mismo sitio. De ahí el disparado.
- La varianza no puede ser constante: para familias con renta baja, casi todas gastan cero y la dispersión es mínima; para las de renta alta, el gasto varía mucho. De ahí el embudo.
- Y lo más grave: MCO está sesgado, no solo es ineficiente. El modelo lineal predice gastos negativos para las familias de renta baja, que es imposible, y al no poder ajustar esa parte distorsiona todos los coeficientes.
3. ¿Es la heterocedasticidad el problema principal? No.
Es un síntoma. Aplicar errores robustos corregiría los errores estándar de un estimador que está sesgado, lo que da intervalos de confianza correctos alrededor de un número equivocado. Es el equivalente a ajustar cuidadosamente el margen de error de una medición mal hecha.
Soluciones por orden de prioridad:
1º. Cambiar el modelo, no el estimador. Con una variable dependiente censurada en cero, el modelo adecuado es un Tobit, estimado por máxima verosimilitud (tema 25), que modela explícitamente la censura. Alternativamente, un modelo en dos partes: primero un logit o probit para «gasta o no gasta» (tema 34), y luego una regresión del importe entre quienes gastan.
2º. Revisar la forma funcional. Aun sin censura, es muy probable que el efecto de la renta sea proporcional y no absoluto. Un modelo log-log —para las familias con gasto positivo— sería más razonable y probablemente atenuaría la heterocedasticidad restante.
3º. Solo entonces, errores robustos. Una vez el modelo esté bien especificado, quedará heterocedasticidad residual y se corrige con errores de White.
La lección general del ejercicio. Los contrastes de diagnóstico —White, Jarque-Bera, Durbin-Watson— detectan síntomas, no diagnostican enfermedades. Un rechazo obliga a preguntarse qué está mal en el modelo, no a aplicar mecánicamente la corrección asociada a ese contraste. Corregir el síntoma y dejar la causa es el error más común del análisis econométrico aplicado.
7. Qué desbloquea
Necesitas antes:
Te abre la puerta a:
- Autocorrelación y multicolinealidad — tema 33
8. Recursos externos
- OCW UPV/EHU — «Análisis de Regresión con Gretl». Heterocedasticidad, contrastes de detección y MCG/MCP, todo con datos reales y salidas de Gretl.
- Wooldridge. El capítulo de heterocedasticidad es la referencia para los errores robustos y para la discusión de cuándo compensa MCP.
- Curso de Econometría — Hugo Maul. Vídeos sobre incumplimiento de los supuestos clásicos.
- Gretl.
Contrastes → Heterocedasticidadofrece White y Breusch-Pagan; los errores robustos se activan marcando «Desviaciones típicas robustas» al estimar, y MCP está enModelo → Otros modelos lineales → Mínimos cuadrados ponderados. - Exámenes de la UOC. Este tema y el 34 cubren dos de los contenidos que más se preguntan: heterocedasticidad y MCG, y la normalidad en el MRLM.