Saltar al contenido
Matemáticas para Economía40 temas · 7 asignaturas · 42 ECTS
Tema 25 de 40

Estimación puntual: sesgo, eficiencia y consistencia

11 h estimadas71.607 Inferencia estadística (Estadística aplicada)Gretl

1. La pregunta

El INE quiere estimar la tasa de paro. Tiene una muestra de 60 000 personas. Podría usar la proporción de parados en la muestra. O podría usar la proporción entre los menores de 55 años, o una media ponderada por comunidades, o la mediana de las proporciones provinciales.

Todas son fórmulas legítimas y todas dan números distintos. ¿Con qué criterio se elige una? Este tema da los tres criterios que usa toda la estadística —insesgadez, eficiencia y consistencia— y explica por qué la media muestral no es la respuesta obvia sino la respuesta demostrablemente buena.

2. Intuición

Un estimador es como una diana en la que no ves dónde has dado: solo puedes evaluar tu puntería por las propiedades del método, no por el resultado de un tiro.

Insesgadez: apuntar al centro. Si repitieras el muestreo infinitas veces, ¿el promedio de tus estimaciones daría en el blanco? Un estimador sesgado desvía sistemáticamente hacia un lado: por muchos datos que acumules, no se corrige. Es el error de método, no de suerte.

Eficiencia: agrupar los tiros. Entre dos estimadores que apuntan al centro, el mejor es el que menos se dispersa. Uno con varianza grande puede dar muy lejos del blanco en una muestra concreta, aunque en promedio acierte. Y solo tienes una muestra: te juegas todo a un tiro.

Consistencia: mejorar con más datos. Un estimador consistente se acerca al valor real cuando la muestra crece. Es un mínimo exigible: si añadir datos no ayuda, algo va mal.

El compromiso. A veces un estimador con un pequeño sesgo tiene mucha menos varianza que uno insesgado. En ese caso puede ser preferible, y por eso existe una medida que combina las dos cosas: el error cuadrático medio. Es el mismo dilema que reaparecerá en el tema 33 al decidir si conviene omitir una variable.

3. Formalización

Planteamiento

Se quiere conocer un parámetro poblacional —puede ser , , o cualquier otra constante desconocida—.

Un estimador es una función de la muestra, y por tanto una variable aleatoria con su propia distribución. Una estimación es el valor concreto que toma en una muestra dada.

La distinción importa: es aleatorio y tiene propiedades; la estimación es un número y no las tiene.

Sesgo

es insesgado si su sesgo es cero, es decir, si .

Resultados que hay que conocer:

De ahí sale el . No es una convención: al usar en lugar del verdadero , las desviaciones salen artificialmente pequeñas — es, por construcción, el punto que minimiza — y dividir por corrige exactamente ese defecto. El son los grados de libertad: una vez conocida y desviaciones, la última queda determinada porque suman cero.

Aviso. es insesgado para , pero no lo es para , porque la raíz cuadrada es cóncava y la desigualdad de Jensen del tema 22 hace que . El sesgo es pequeño y suele ignorarse.

Eficiencia

Entre dos estimadores insesgados, es más eficiente el de menor varianza.

Eficiencia relativa:

Un valor mayor que 1 indica que el primero es mejor.

Cota de Cramér-Rao. Bajo condiciones de regularidad, existe una cota inferior para la varianza de cualquier estimador insesgado. Un estimador que la alcanza se llama eficiente en sentido absoluto, y no puede mejorarse. La media muestral la alcanza cuando la población es normal.

Error cuadrático medio

Permite comparar estimadores aunque no sean insesgados:

Descompone el error en dos fuentes: la variabilidad y la desviación sistemática. Un estimador ligeramente sesgado pero mucho más estable puede tener menor ECM, y en la práctica ser preferible.

Consistencia

es consistente si converge en probabilidad a :

Condición suficiente práctica: si el sesgo tiende a cero y la varianza tiende a cero, el estimador es consistente. Equivalentemente, si .

es consistente porque es insesgado y .

Un estimador puede ser sesgado y consistente (el sesgo desaparece con ), o insesgado e inconsistente (si su varianza no baja). La consistencia es una propiedad asintótica; la insesgadez vale para cualquier .

Métodos de construcción

Método de los momentos. Se igualan los momentos muestrales a los poblacionales y se despeja. Sencillo, siempre aplicable, pero no siempre eficiente.

Máxima verosimilitud. Se elige el valor del parámetro que hace más probable haber observado la muestra que se observó. Se maximiza la función de verosimilitud

o, más cómodo, su logaritmo , que convierte el producto en suma y se deriva con las herramientas del tema 5. Sus estimadores son consistentes y asintóticamente eficientes, y es el método que sustenta los modelos logit y probit del tema 34.

Mínimos cuadrados. Se minimiza la suma de cuadrados de las discrepancias. Es el método de toda la econometría del bloque 7.

4. Ejemplo económico resuelto

Problema. Se quiere estimar el gasto medio en I+D de las empresas de un sector. Se toma una muestra aleatoria de empresas y se proponen tres estimadores:

Se sabe que la población tiene media y varianza . Analiza los tres con y (miles de €).

Paso 1. Insesgadez.

Sorpresa parcial: el segundo estimador —usar una sola empresa e ignorar las otras 24— es insesgado. La insesgadez, por sí sola, no basta para elegir.

Paso 2. Varianzas.

Paso 3. Eficiencia relativa entre los insesgados.

La media muestral es 25 veces más eficiente que usar una sola observación, que es exactamente . Tiene sentido: es el efecto del tema 24.

Paso 4. Comparar con el sesgado, vía ECM. Supongamos mil € para poner números.

El tercero es mucho peor, pese a tener menor varianza: el sesgo, al elevarse al cuadrado, domina completamente.

Paso 5. ¿Cuándo compensaría un estimador sesgado? El tercero sería mejor si

Con , la condición se reduce a para el sesgo al cuadrado, es decir,

Solo si la media fuera muy pequeña en relación con compensaría. Con y , ni de lejos.

Paso 6. Consistencia.

El caso más instructivo es el segundo: es insesgado pero no consistente. Por muchos datos que se recojan, si solo se mira la primera empresa la estimación no mejora nunca. La insesgadez no garantiza nada sobre la calidad práctica.

Conclusión. El ganador es : insesgado, el más eficiente de los insesgados, y consistente. No es la elección obvia por costumbre, sino la elección demostrablemente mejor. Y bajo normalidad alcanza la cota de Cramér-Rao, de modo que ningún estimador insesgado puede superarla.

5. Errores típicos

Confundir estimador y estimación. El estimador es la fórmula, es aleatoria y tiene propiedades. La estimación es el número que sale de una muestra concreta y no tiene propiedades: no se puede decir «esta estimación es insesgada».

Creer que insesgado implica bueno. El ejemplo lo desmonta: es insesgado y es malísimo. Hay que mirar también la varianza.

Creer que insesgado implica consistente, o al revés. Son propiedades independientes. es insesgado e inconsistente; es sesgado y consistente.

Dividir la varianza muestral por en inferencia. El divisor es lo que la hace insesgada. Con grande da casi igual; con , la subestimación es del 12,5 %.

Olvidar elevar el sesgo al cuadrado en el ECM. La fórmula es . Sumar el sesgo sin elevar da unidades incoherentes.

Juzgar un estimador por lo que dio en una muestra. No se puede: no se conoce . Se juzga por sus propiedades bajo muestreo repetido, que son teóricas.

Suponer que máxima verosimilitud da estimadores insesgados. Son consistentes y asintóticamente eficientes, pero pueden tener sesgo con muestras pequeñas. El estimador máximo-verosímil de es precisamente el que divide por : sesgado.

6. Ejercicios

Ejercicio 1 · Comprobar insesgadez

básico

De una población con media y varianza se toma una muestra de 3 observaciones. Se propone

Comprueba si son insesgados y cuál es más eficiente.

Ver solución

Insesgadez.

Los dos son insesgados. Lo son porque en ambos los coeficientes suman 1, que es la condición general: es insesgado si y solo si .

Eficiencia. Con observaciones independientes, :

es más eficiente, con una eficiencia relativa de .

El resultado general. Entre todos los estimadores lineales insesgados, el de mínima varianza es el que reparte los pesos por igual: minimizar sujeto a da para todo . Es un problema de Lagrange del tema 14, y su solución es exactamente la media muestral.

Ejercicio 2 · Por qué n menos 1

básico

Una muestra de 5 datos da: .

  1. Calcula la varianza dividiendo por y por .
  2. Si la varianza poblacional real fuera , ¿cuál estaría más cerca en promedio?
Ver solución

1.

2. El estimador con divisor tiene esperanza

Subestima sistemáticamente en un 20 %. El de divisor tiene esperanza exactamente .

En esta muestra concreta los valores coinciden con las esperanzas, lo cual es casualidad. Lo que no es casualidad es que en promedio sobre muchas muestras el primero se quede corto y el segundo acierte.

Por qué ocurre. Las desviaciones se calculan respecto de , no del verdadero . Y es, por construcción, el valor que minimiza : la suma de cuadrados respecto de la media muestral es siempre menor o igual que respecto de cualquier otro punto, incluido . Dividir por en lugar de compensa exactamente esa reducción.

Ejercicio 3 · Estimador sesgado que gana

medio

Para estimar la varianza de una población normal se comparan

Se sabe que, con población normal, .

Calcula el ECM de cada uno con y di cuál es preferible.

Ver solución

Sea , con y . Con : y .

Estimador A ():

Estimador B ():

Comparación:

SesgoVarianzaECM
A (insesgado, )00,22220,2222
B (sesgado, )0,14880,1818

El estimador sesgado tiene menor ECM: 0,182 frente a 0,222, un 18 % mejor.

Interpretación. B subestima sistemáticamente la varianza, pero lo hace de forma tan estable que su error total es menor. Si el criterio es «acercarse lo más posible a en una muestra concreta», B es preferible.

Por qué se usa A de todas formas. Tres razones:

  • La insesgadez tiene valor cuando se agregan muchas estimaciones: los errores se cancelan si no hay sesgo, y se acumulan si lo hay.
  • Toda la teoría de intervalos de confianza y contrastes del bloque 6 está construida sobre , y cambiar de estimador obligaría a rehacerla.
  • La ventaja de B se desvanece con grande: con la diferencia de ECM baja al 2 %.

Y el aviso importante: la elección de B depende de conocer la distribución (normal) y la forma del sesgo. Con datos reales que no sean normales, esa ventaja puede evaporarse. Este ejercicio muestra que el dilema sesgo-varianza es real, no que haya que abandonar el .

Ejercicio 4 · Máxima verosimilitud

avanzado

El tiempo entre averías de una máquina sigue una distribución exponencial de parámetro , con densidad para y media .

Se observan 5 tiempos: (en meses).

  1. Obtén el estimador de máxima verosimilitud de .
  2. Aplícalo a los datos.
  3. ¿Es insesgado?
Ver solución

1. Función de verosimilitud. Al ser las observaciones independientes, la densidad conjunta es el producto:

Logaritmo —que convierte el producto en suma y no cambia dónde está el máximo, porque es creciente—:

Condición de primer orden, con las herramientas del tema 5:

Condición de segundo orden:

Negativa para todo : la log-verosimilitud es estrictamente cóncava y el punto crítico es el máximo global (tema 13).

El estimador máximo-verosímil es el inverso de la media muestral. Tiene sentido: como , es natural estimar por .

2. Aplicación.

Una avería cada tres meses de media, o cuatro al año.

3. ¿Es insesgado? No.

sí es insesgado para , porque . Pero el estimador es , y la función es convexa para . Por la desigualdad de Jensen del tema 22:

El estimador sobreestima sistemáticamente.

De hecho, se puede demostrar que para la exponencial

Con , sobreestima un 25 %. El estimador insesgado sería .

Pero es consistente, porque el factor : el sesgo desaparece al crecer la muestra. Con sería solo del 1 %.

La moraleja. Máxima verosimilitud garantiza consistencia y eficiencia asintótica, no insesgadez en muestras pequeñas. Es la razón de que en econometría se distinga cuidadosamente entre propiedades de muestras finitas y propiedades asintóticas, distinción que reaparece en el tema 34 con las variables instrumentales.

7. Qué desbloquea

Necesitas antes:

Te abre la puerta a:

8. Recursos externos

  • Inferencia Estadística — Luis Rincón (UNAM). A partir de aquí sí procede: los vídeos del canal LuisRinconUNAM cubren estimación puntual con el rigor de un curso universitario. Exigían el cálculo de probabilidades del bloque 5, que ya está hecho.
  • Sanabria, Comprendiendo la Estadística Inferencial (PDF libre). Presenta las propiedades de los estimadores con intuición antes que con demostraciones.
  • Apuntes UGR — Estadística II, tema 4. Compacto y bien organizado para repasar sesgo, eficiencia y consistencia.
  • Gretl. Simular muestras repetidas de una población conocida y ver el histograma de las estimaciones es la forma más directa de entender qué significa «insesgado»: el histograma se centra en el valor real.