Teorema central del límite y distribuciones muestrales
1. La pregunta
Un instituto encuesta a 1000 personas y afirma que el paro es del 12,4 %, con un margen de error de ±2 puntos. Hay 24 millones de activos. ¿Cómo se puede decir algo fiable sobre 24 millones preguntando a mil?
Y una pregunta más incómoda: ¿por qué el tamaño de la población no aparece en ningún sitio? El margen de error de una encuesta a 1000 personas es el mismo en España que en China. Eso parece absurdo y no lo es.
Este tema contiene el resultado que hace posible toda la estadística inferencial, y con él se cierra el bloque 5 y se abre el 6.
2. Intuición
El experimento mental clave. Coge una población cualquiera —rentas, por ejemplo, con su cola larga a la derecha— y extrae una muestra de 100 personas. Calcula su media. Anótala. Repite el proceso mil veces, con mil muestras distintas.
Ahora dibuja el histograma de esas mil medias. Ocurren tres cosas, y las tres son sorprendentes:
- Se agrupan alrededor de la media real de la población.
- Se dispersan mucho menos que los datos individuales.
- Forman una campana, aunque la población original no tuviera forma de campana en absoluto.
La tercera es el teorema central del límite, y es el motivo de que la normal aparezca en todas partes: casi todo lo que se mide en estadística es un promedio o una suma, y los promedios se vuelven normales aunque los datos no lo sean.
Por qué la dispersión baja. Al promediar, los valores altos y bajos se compensan. Con una muestra grande es muy improbable que salgan todos altos, igual que es muy improbable sacar cien caras seguidas. La compensación es lo que reduce la varianza, y lo hace a razón de : para reducir el error a la mitad hace falta cuadruplicar la muestra.
Por qué no importa el tamaño de la población. Porque lo que reduce la incertidumbre es la compensación entre los elementos de la muestra, no qué fracción de la población representan. Una cucharada basta para saber si la sopa está salada, tanto si la olla tiene un litro como cien —siempre que esté bien removida—. Lo que importa es que la muestra sea aleatoria, no que sea grande en proporción.
3. Formalización
Población, muestra y estadístico
- Población: todos los elementos de interés. Sus características son parámetros: , , . Son constantes desconocidas.
- Muestra aleatoria simple de tamaño : variables aleatorias independientes y con la misma distribución que la población.
- Estadístico: cualquier función de la muestra, como o . Al depender de la muestra, es una variable aleatoria y tiene su propia distribución, llamada distribución muestral.
La distinción es el corazón del bloque 6: es un número fijo que no conocemos; es aleatorio y cambia con cada muestra.
Distribución de la media muestral
Sea con la población de media y varianza . Entonces, sea cual sea la distribución de la población:
La demostración usa las propiedades del tema 22: la esperanza es lineal, y la varianza de una suma de independientes es la suma de varianzas, que al dividir por queda dividida por .
A se le llama error típico o error estándar de la media. No es la desviación típica de los datos: es la de las medias muestrales, y es mucho menor.
Teorema central del límite
Si son independientes e idénticamente distribuidas con media y varianza finita, entonces cuando crece:
o, tipificando,
Lo asombroso es lo que NO exige: no exige que la población sea normal. Solo pide independencia, igual distribución y varianza finita.
¿Cuánto es « grande»? Depende de cuán asimétrica sea la población:
| Población | suficiente |
|---|---|
| Ya normal | cualquiera |
| Simétrica | |
| Moderadamente asimétrica | |
| Muy asimétrica (rentas, siniestros) | o más |
La regla popular «» es una simplificación razonable, no una ley.
Cuando la varianza no es finita el teorema no se aplica. Ocurre con algunas distribuciones de colas muy pesadas usadas en finanzas, y es una de las razones de que los modelos de riesgo basados en la normal fallen en las crisis.
Si la población ya es normal
Entonces es exactamente normal para cualquier , sin necesidad del teorema:
Distribución de la proporción muestral
Si es la proporción de éxitos en una muestra de tamaño de una población con proporción :
y por el teorema central del límite, para y :
Es un caso particular: la proporción es la media de variables de Bernoulli.
Margen de error de una encuesta. Con nivel de confianza del 95 %:
Como es máximo en y vale 0,25, el peor caso es
Con da , el famoso «±3 %». Y no aparece el tamaño de la población por ningún sitio.
Distribuciones asociadas a la normal
Tres distribuciones que aparecerán constantemente en el bloque 6:
Chi-cuadrado. Si son independientes, entonces , con grados de libertad. Es asimétrica y solo toma valores positivos. Aparece al estudiar varianzas: si la población es normal,
de Student. Si y son independientes:
Su papel es central: cuando es desconocida y se sustituye por ,
La es como la normal pero con colas más pesadas, porque incorpora la incertidumbre extra de haber estimado también . Con grande converge a la normal: a partir de unos 30 grados de libertad la diferencia es despreciable.
de Snedecor. Cociente de dos chi-cuadrado divididas por sus grados de libertad. Se usa para comparar varianzas y en los contrastes conjuntos de la regresión múltiple del tema 30.
4. Ejemplo económico resuelto
Problema. El gasto mensual de los hogares en un municipio tiene media € y desviación típica €. La distribución es claramente asimétrica a la derecha: unos pocos hogares gastan muchísimo.
- ¿Probabilidad de que un hogar concreto gaste más de 1900 €?
- Se toma una muestra de 100 hogares. ¿Probabilidad de que su gasto medio supere 1900 €?
- ¿Qué tamaño de muestra haría falta para que el error de la media no supere 50 € con un 95 % de confianza?
- ¿Cambia algo si el municipio tiene 5000 hogares en vez de 500 000?
Paso 1. Un hogar concreto. Aquí no se puede aplicar la normal: la distribución poblacional es asimétrica y el teorema central del límite se refiere a medias, no a observaciones individuales.
Lo único que se puede afirmar sin conocer la forma exacta es una cota de Chebyshev, del tema 22:
que es menos de una desviación típica, así que Chebyshev no dice nada útil ().
La respuesta honesta es que no se puede calcular sin conocer la distribución. Ese reconocimiento es parte del ejercicio: la tentación de tipificar y mirar la tabla es justamente el error que este tema tiene que evitar.
Paso 2. Media de 100 hogares. Ahora sí. Con , y aunque la población sea asimétrica, el teorema central del límite se aplica:
El error típico es 60 €, diez veces menor que la desviación típica individual.
Un 4,8 %.
Contraste que conviene apreciar. Que un hogar gaste 100 € por encima de la media es de lo más normal. Que la media de cien hogares se desvíe 100 € es raro: pasa menos de una vez de cada veinte. La media es mucho más estable que el dato individual, y esa es toda la razón de ser del muestreo.
Paso 3. Tamaño de muestra. Queremos que el margen de error al 95 % no supere 50 €:
Coste de la precisión. Para un margen de 25 € —la mitad— haría falta : cuatro veces más muestra para el doble de precisión. Es la consecuencia directa del en el denominador, y explica por qué las encuestas no se hacen mucho más grandes: duplicar la precisión cuadruplica el coste.
Paso 4. El tamaño de la población. No cambia nada.
En las fórmulas de este tema el tamaño poblacional no aparece. El error típico depende solo de y de .
Matiz técnico. Si el muestreo es sin reemplazamiento y la muestra representa una fracción apreciable de la población, se aplica el factor de corrección para poblaciones finitas:
Con y , el factor vale : irrelevante. Con y , vale : reduce el error típico un 1 %, tampoco significativo.
La corrección solo importa cuando supera aproximadamente el 5 %. Con las proporciones habituales de una encuesta, el tamaño de la población es irrelevante, y esa es la respuesta a la pregunta del principio.
5. Errores típicos
Aplicar el teorema central del límite a observaciones individuales. Se refiere a medias y sumas. Que la media de las rentas sea normal no hace normales a las rentas.
Confundir con . La primera describe la dispersión de los datos; la segunda, la de las medias muestrales. Usar una por otra da márgenes de error absurdos.
Creer que hace falta que la población sea normal. No hace falta. Esa es precisamente la potencia del teorema.
Pensar que el margen de error depende del tamaño de la población. No depende, salvo que la muestra sea una fracción grande del total.
Usar la normal cuando es desconocida y es pequeño. Ahí toca la de Student con grados de libertad. Con grande da casi igual, pero con la diferencia es apreciable.
Suponer independencia sin comprobarla. Si la muestra está agrupada —vecinos del mismo barrio, empleados de la misma empresa— las observaciones no son independientes, el error típico real es mayor que y todos los cálculos quedan optimistas.
Aplicar el teorema con varianza infinita. Distribuciones de colas muy pesadas lo incumplen. Es raro en variables económicas ordinarias, no tanto en rentabilidades financieras extremas.
Olvidar los grados de libertad. La , la chi-cuadrado y la no son una distribución sino una familia: sin especificar los grados de libertad no se puede buscar ningún valor crítico.
6. Ejercicios
Ejercicio 1 · Error típico y probabilidad
básicoLos salarios de un sector tienen € y €. Se toma una muestra de 64 trabajadores.
- ¿Cuál es el error típico de la media muestral?
- ¿Probabilidad de que la media muestral esté entre 2300 y 2500 €?
Ver solución
1.
2. Con , aplicamos el teorema central del límite: .
Un 89 %.
Comparación reveladora. Ese mismo intervalo, aplicado a un trabajador individual, cubriría solo , es decir, un 15,9 % de los casos. La media de 64 trabajadores está mucho más concentrada que un trabajador cualquiera.
Ejercicio 2 · Margen de error de una encuesta
básicoUna encuesta a 1200 personas estima que el 38 % apoya una medida.
- Calcula el error típico de la proporción.
- Calcula el margen de error al 95 %.
- ¿Cuántas personas habría que encuestar para reducir el margen a 1,5 puntos?
Ver solución
1.
2.
El resultado se comunica como 38 % ± 2,7 puntos, o equivalentemente, el apoyo real está entre el 35,3 % y el 40,7 % con un 95 % de confianza.
3. Imponemos margen :
Harían falta unas 4023 personas, más del triple.
El coste de la precisión. Reducir el margen de 2,75 a 1,5 puntos —un factor de 1,83— exige multiplicar la muestra por . Es la ley del : la precisión es cara y cada vez más cara.
Por eso casi todas las encuestas publicadas rondan las 1000-1500 entrevistas: es donde el margen baja del 3 % sin que el coste se dispare.
Ejercicio 3 · Cuándo el teorema aún no ha actuado
medioUna aseguradora tiene siniestros cuyo importe sigue una distribución muy asimétrica, con € y €.
- ¿Es razonable aplicar el teorema central del límite con una muestra de 10 siniestros?
- ¿Y con 200?
- Con , calcula la probabilidad de que el coste medio supere los 1000 €.
Ver solución
1. Con : no. La distribución tiene un coeficiente de variación , que indica asimetría extrema: la desviación típica triplica la media, lo que solo es posible con una cola muy larga a la derecha.
Con , la distribución de seguirá siendo claramente asimétrica: un solo siniestro catastrófico arrastra la media de diez. Usar la normal aquí daría probabilidades equivocadas, sobre todo en las colas, que es donde importa.
2. Con : sí, con reservas. Doscientas observaciones suelen bastar incluso para poblaciones muy asimétricas. La aproximación será buena en el centro; en las colas extremas seguirá siendo optimista, porque la distribución real conserva algo de asimetría.
Regla práctica: cuanto mayor es el coeficiente de variación, mayor debe ser . Con , doscientas es un mínimo razonable.
3. Cálculo con .
Un 11,9 %.
Aviso sobre la interpretación. Este número es una aproximación. Como la distribución real conserva cola derecha, la probabilidad verdadera de superar 1000 € es probablemente algo mayor que el 11,9 % calculado.
En seguros, donde lo que importa son precisamente las colas, esa diferencia no es académica: es la razón de que se trabaje con distribuciones de colas pesadas específicamente, en lugar de confiar en la aproximación normal.
Ejercicio 4 · Diseñar un plan de muestreo
avanzadoUna consultora debe estimar el gasto medio anual en formación de las empresas de un sector. Un estudio piloto con 40 empresas dio € y €.
- Estima el tamaño de muestra necesario para un margen de error de 1000 € al 95 %.
- El cliente solo paga 150 encuestas. ¿Qué margen de error se obtiene?
- El cliente propone «encuestar al 10 % de las empresas del sector, que son 900». Evalúa la propuesta.
- ¿Qué pasaría si las empresas se eligiesen por comodidad —las que contesten al teléfono— en lugar de al azar?
Ver solución
1. Tamaño necesario. Se usa del piloto como estimación de :
2. Con 150 encuestas.
El margen sería de ±1440 €, un 12 % del gasto medio estimado. Hay que decirle al cliente con claridad qué precisión está comprando: no la que pidió, sino un 44 % peor.
3. La propuesta del 10 %. Encuestar el 10 % de 900 son 90 empresas.
Peor todavía: ±1860 €.
El error conceptual de la propuesta. Razonar en porcentaje de la población es equivocado: lo que determina la precisión es el número absoluto de encuestas, no la fracción. Un 10 % suena a mucho, pero 90 empresas son pocas.
Aquí sí conviene aplicar el factor de corrección, porque :
La corrección mejora algo el margen, pero sigue siendo mucho peor que con 150 encuestas.
Recomendación. Con 900 empresas en el sector y 312 necesarias, quizá convenga plantear un censo parcial de las empresas grandes —que concentran la mayor parte del gasto— y muestreo aleatorio entre las pequeñas. Un muestreo estratificado de este tipo da mucha más precisión que el aleatorio simple cuando la variable está muy dispersa, que es exactamente el caso ().
4. Muestreo por comodidad. Sería un error mucho más grave que cualquier problema de tamaño.
Todo lo calculado en este tema supone muestreo aleatorio. Sin él:
- : aparece un sesgo de selección que ninguna fórmula corrige.
- Las empresas que contestan al teléfono no son como las que no contestan: probablemente son más pequeñas, o tienen más tiempo, o están más interesadas en la formación —justo la variable que se quiere medir—.
- Aumentar no arregla nada. El error típico baja, así que el resultado parece más preciso, pero está igual de sesgado. Se estima con gran exactitud un número equivocado.
Es el punto más importante del tema. El teorema central del límite garantiza que la media muestral se concentra alrededor de si la muestra es aleatoria. Con una muestra mal seleccionada, toda la maquinaria de inferencia del bloque 6 se aplica sobre una base falsa y produce conclusiones falsas con apariencia de rigor.
7. Qué desbloquea
Necesitas antes:
Te abre la puerta a:
- Estimación puntual: sesgo, eficiencia y consistencia — tema 25
- Modelo estadístico, correlación frente a causalidad y regresión simple por MCO — tema 29
8. Recursos externos
- Sanabria, Comprendiendo la Estadística Inferencial (PDF libre). Aquí es donde el libro brilla: explica qué significa realmente la confianza de un intervalo y por qué el teorema central del límite funciona, sin quedarse en el enunciado.
- Apuntes UGR — Estadística II. Distribuciones muestrales y las distribuciones , y con sus relaciones.
- Gretl. Merece la pena hacer la simulación de la sección 2: generar una población asimétrica, extraer muchas muestras y ver cómo el histograma de las medias se vuelve una campana. Ver ocurrir el teorema convence mucho más que leerlo.
- Aviso de orden. A partir de aquí ya se pueden ver los vídeos de Inferencia Estadística de Luis Rincón (UNAM), que empiezan en el tema 25: exigían precisamente el cálculo de probabilidades que cierra este bloque.