Saltar al contenido
Matemáticas para Economía40 temas · 7 asignaturas · 42 ECTS
Tema 20 de 40

Estadística descriptiva: centro, dispersión y forma

8 h estimadas21.405 Fundamentos de estadísticaGretl

1. La pregunta

El INE publica que la renta media por hogar en España es de unos 35 000 € al año. Un titular concluye que «el español medio vive bien». Otro medio, con los mismos datos, dice que la mitad de los hogares ingresa menos de 30 000 €.

Los dos números son correctos. La diferencia entre ellos —media y mediana— es la desigualdad. Este tema enseña a describir un conjunto de datos con tres preguntas: dónde está el centro, cuánto se dispersan alrededor, y qué forma tiene el reparto. Sin eso, todo lo que venga después —inferencia, regresión, series— se construye sobre datos que no se han mirado.

2. Intuición

Tienes 40 millones de números y no puedes mirarlos uno a uno. Necesitas resumirlos, y todo resumen pierde información: la cuestión es qué pierdes con cada resumen.

El centro. La media es el punto de equilibrio: si pusieras los datos como pesos sobre una regla, es donde se apoya sin caer. Por eso un solo dato muy alejado la arrastra: un multimillonario en la muestra desplaza la media de todo el barrio. La mediana es el dato que deja la mitad a cada lado; no le importa cuán rico sea el más rico, solo que esté por encima. Por eso en rentas siempre se dan las dos.

La dispersión. Dos países con la misma renta media pueden ser muy distintos: en uno todos ganan lo mismo, en otro hay ricos y pobres. La desviación típica mide cuánto se alejan los datos del centro, en promedio.

La forma. ¿El reparto es simétrico o tiene una cola larga hacia un lado? Casi todas las variables económicas —renta, patrimonio, tamaño de empresa— tienen cola larga a la derecha: muchos valores pequeños y unos pocos enormes. Eso hace que la media sea mayor que la mediana, y es la razón matemática de que los promedios de renta engañen.

3. Formalización

Notación

Se dispone de observaciones de una variable. En este bloque se describe una muestra; a partir del tema 25 importará la distinción entre estadísticos muestrales y parámetros poblacionales, y por eso conviene fijar ya la notación de NOTACION.md: , para la muestra; , para la población.

Medidas de posición

Media aritmética:

Propiedad que se usará mucho: . Las desviaciones respecto de la media se cancelan, y por eso hay que elevarlas al cuadrado para medir dispersión.

Mediana (): valor que ocupa la posición central con los datos ordenados. Con impar es el dato ; con par, la media de los dos centrales.

Moda: el valor más frecuente. Útil en variables cualitativas, poco informativa en continuas.

Cuantiles. El cuantil de orden deja por debajo una fracción de los datos. Los cuartiles , , dividen en cuatro partes; los percentiles, en cien. El percentil 90 de la renta es el umbral del 10 % más rico, y es una cifra que aparece en todo informe de desigualdad.

Medias para otros contextos. La media geométrica, , es la correcta para promediar tasas de crecimiento: si una economía crece un 10 % un año y un 20 % otro, el crecimiento medio anual no es el 15 % sino . Es la misma idea del tema 1: las tasas se multiplican, no se suman.

Medidas de dispersión

Recorrido: . Muy sensible a valores extremos.

Recorrido intercuartílico: . Contiene el 50 % central y es robusto.

Varianza muestral. Aquí hay dos definiciones y conviene no confundirlas:

La primera describe la muestra; la segunda es la que se usa para estimar la varianza poblacional, porque es insesgada (tema 25). En este sitio, siguiendo NOTACION.md, es siempre la cuasivarianza (divisor ), que es lo que calculan Gretl, Excel y R por defecto.

Desviación típica: . Tiene las mismas unidades que los datos, y por eso es la medida de dispersión que se interpreta.

Fórmula de cálculo más cómoda a mano:

Coeficiente de variación:

Es adimensional, así que permite comparar la dispersión de variables medidas en unidades distintas —salarios en euros frente a producción en toneladas—. Es la misma idea que la elasticidad del tema 4: dividir por el nivel para poder comparar.

Medidas de forma

Asimetría (sesgo).

ValorFormaRelación media-mediana
cola larga a la derecha
simétrica
cola larga a la izquierda

Casi todas las variables monetarias tienen .

Curtosis.

Mide el peso de las colas comparado con una distribución normal. Positiva significa colas más pesadas: valores extremos más frecuentes de lo que la normal predice. En rentabilidades financieras es sistemáticamente positiva, y es la razón de que los modelos basados en la normal subestimen el riesgo de las crisis.

Valores atípicos

Un criterio operativo y muy usado: es atípico todo dato fuera de

Es la regla que dibuja los bigotes de un diagrama de caja. Detectar un atípico no autoriza a borrarlo: primero hay que averiguar si es un error de medida (se corrige o se elimina) o un dato real (se conserva y se explica).

Relación entre dos variables

Covarianza:

Su signo indica el sentido de la relación, pero su magnitud depende de las unidades y no se puede interpretar directamente.

Coeficiente de correlación lineal de Pearson:

Siempre entre y , adimensional. Mide la fuerza de la relación lineal:

  • : los puntos están exactamente sobre una recta.
  • : no hay relación lineal. Puede haber una relación fortísima pero curva.

Este coeficiente es la base de la regresión del tema 29, y también la fuente del error más repetido de la estadística aplicada: correlación no implica causalidad.

4. Ejemplo económico resuelto

Problema. Los salarios brutos anuales (en miles de euros) de los 11 empleados de una pyme son:

Describe la distribución y decide qué medida de centro debe usar el comité de empresa en una negociación salarial.

Paso 1. Media.

Paso 2. Mediana. Los datos ya están ordenados y es impar, así que la mediana es el dato en posición :

Diferencia enorme: la media es un 36 % mayor que la mediana. Ya sabemos que hay algo tirando por arriba.

Paso 3. Cuartiles y atípicos. Con 11 datos, es el dato en posición 3 y el de la 9 (dividiendo la muestra en cuatro tramos):

El salario de 118 está muy por encima de 43,5: es un valor atípico. Corresponde seguramente al gerente o al socio fundador.

Paso 4. Dispersión. Calculamos :

Una desviación típica casi igual a la media: dispersión extrema para un colectivo de once personas de la misma empresa.

Paso 5. Forma. Como , la distribución es asimétrica a la derecha, exactamente lo esperable en salarios.

Paso 6. Qué pasa si se excluye el atípico. Con los 10 primeros:

Comparación:

EstadísticoCon los 11Sin el atípico
Media32,7324,20
Mediana2423
Desv. típica28,674,98
CV0,8760,206

Un solo dato de once cambiaba la media en 8500 € y multiplicaba la desviación típica por casi seis. A la mediana apenas la movió: de 24 a 23. Eso es la robustez.

Paso 7. Responder a la pregunta. El comité debe usar la mediana, 24 000 €, y darla acompañada del recorrido intercuartílico.

Por qué. La media de 32 730 € no describe a nadie: diez de los once empleados cobran menos. Presentarla como «salario medio de la empresa» daría una imagen falsa de la situación de la plantilla.

Esto no es una tecnicalidad estadística: es exactamente lo que ocurre con los datos de renta nacional, y la razón de que los informes de desigualdad den siempre mediana y percentiles, no media.

5. Errores típicos

Dar solo la media. Sin la mediana no se sabe si la distribución es simétrica, y sin la desviación típica no se sabe si el promedio representa algo.

Confundir varianza y cuasivarianza. Divisor o . Con muestras grandes da casi igual; con muestras pequeñas, no. Y en inferencia siempre se usa .

Interpretar la varianza directamente. Está en unidades al cuadrado: «la varianza de los salarios es 822 miles de euros al cuadrado» no significa nada intuitivo. Se interpreta la desviación típica.

Comparar desviaciones típicas de variables distintas. Para eso está el coeficiente de variación. Comparar la dispersión de salarios en euros con la de producción en toneladas usando no tiene sentido.

Promediar tasas de crecimiento con la media aritmética. Hay que usar la geométrica, o equivalentemente promediar los factores multiplicando. Es el error del tema 1 con otro disfraz.

Eliminar atípicos automáticamente. La regla del detecta, no sentencia. En economía los atípicos suelen ser los datos más informativos: las grandes empresas, las crisis, los años de shock.

Leer como «no hay relación». Solo dice que no hay relación lineal. Una relación en forma de U puede tener correlación cero y ser perfectamente determinista.

Deducir causalidad de la correlación. Es el error más caro de la estadística aplicada y tiene un tema entero dedicado: el 29.

6. Ejercicios

Ejercicio 1 · Medidas básicas

básico

Las ventas mensuales (en miles de unidades) de un producto durante seis meses son:

Calcula media, mediana, cuasivarianza y desviación típica.

Ver solución

Media:

Mediana: ordenados: . Con par, es la media de los dos centrales:

Media y mediana son casi iguales: distribución bastante simétrica.

Cuasivarianza. Usando la fórmula de cálculo:

Una dispersión del 18 % respecto del nivel medio: moderada y estable, típica de un producto consolidado.

Ejercicio 2 · Media aritmética frente a geométrica

básico

Una inversión rinde un 25 % el primer año, un el segundo y un 15 % el tercero. Calcula la rentabilidad media anual y explica por qué no es el 6,67 %.

Ver solución

Media aritmética (incorrecta aquí):

Lo que realmente ocurrió. Un euro invertido se convierte en

Un 15 % acumulado en tres años.

Media geométrica (correcta):

Comprobación:

Por qué la aritmética engaña. Con el 6,67 % anual, tres años darían : un 21,4 %, muy por encima del 15 % real. La diferencia viene de que una caída del 20 % exige una subida del 25 % solo para volver al punto de partida: las pérdidas pesan más que las ganancias del mismo tamaño.

La media aritmética de rentabilidades siempre es mayor o igual que la geométrica, y la diferencia crece con la volatilidad. Por eso los fondos publican rentabilidad «anualizada», que es la geométrica.

Ejercicio 3 · Atípicos y decisión

medio

Los tiempos de entrega (en días) de un proveedor durante 12 pedidos han sido:

  1. Identifica los valores atípicos con la regla del recorrido intercuartílico.
  2. Calcula media y mediana con y sin ellos.
  3. ¿Qué debe hacer el responsable de compras?
Ver solución

1. Cuartiles. Con , la mitad inferior son los 6 primeros y la superior los 6 últimos.

El pedido de 28 días es atípico (supera 12). Ningún dato queda por debajo del límite inferior.

2. Con y sin el atípico.

Con los 12: , luego días y .

Sin él: sobre 11 datos, luego y (dato en posición 6).

MediaMediana
Con el atípico7,505,5
Sin él5,645,0

Un solo pedido de doce sube el tiempo medio de entrega en casi dos días.

3. Qué hacer. No borrarlo. La secuencia correcta es:

  • Investigar el caso. ¿Fue una huelga de transporte, un pedido especial, un error administrativo? Un tiempo de 28 días frente a una mediana de 5,5 no es ruido estadístico: es un suceso con causa concreta.
  • Informar con las dos cifras. «Entrega típica de 5,5 días, con un incidente de 28 días en 12 pedidos» describe la realidad. «Entrega media de 7,5 días» no describe ningún pedido: ni los normales ni el incidente.
  • Decidir según lo que importe. Si lo relevante es planificar el stock del día a día, manda la mediana. Si lo relevante es el riesgo de rotura de stock, el atípico es precisamente el dato más importante de los doce: dice que una vez cada doce pedidos puede haber un retraso de tres semanas.

La conclusión general. En gestión de riesgos, los atípicos no son ruido que estorba: son la señal. Eliminarlos equivale a decidir que las crisis no ocurren.

Ejercicio 4 · Correlación sin relación lineal

avanzado

Un analista mide la relación entre el precio de un bien () y el ingreso total () para siete niveles de precio:

1234567
712151615127
  1. Calcula el coeficiente de correlación.
  2. Interpreta el resultado y di qué error cometería quien concluyera que el precio no afecta al ingreso.
Ver solución

1. Cálculos.

Covarianza: calculamos .

producto150030

2. Interpretación.

La correlación es exactamente cero, y sin embargo la relación entre precio e ingreso es perfectamente determinista: los datos siguen una parábola. De hecho, se ajustan exactamente a

Comprobación con : ; con : .

El error. Concluir «el precio no afecta al ingreso» sería gravemente falso. El precio lo determina por completo; lo que ocurre es que la relación no es lineal, y solo mide relación lineal.

Aquí la simetría es perfecta: subidas y bajadas de ingreso se compensan exactamente al calcular la covarianza, y por eso da cero.

Contenido económico. Este es justo el patrón del tema 4: el ingreso crece con el precio mientras la demanda es inelástica, alcanza un máximo donde (aquí, en ) y decrece después. El ingreso máximo está en , y es exactamente la información que la correlación no puede ver.

La lección metodológica. Antes de calcular un coeficiente, hay que dibujar los datos. Un diagrama de dispersión habría mostrado la parábola en un segundo. Es la razón de que el análisis exploratorio no sea opcional, y de que en el tema 29 se insista en mirar los residuos antes que los coeficientes.

7. Qué desbloquea

Necesitas antes:

Te abre la puerta a:

8. Recursos externos

  • Sanabria, Comprendiendo la Estadística Inferencial (PDF libre). Los capítulos iniciales cubren la descriptiva con especial cuidado en la intuición de cada medida.
  • Apuntes UGR — Estadística II. Compactos y bien organizados; útiles para repasar fórmulas antes de un examen.
  • Gretl. Es el momento de instalarlo. Con Ver → Estadísticos principales sobre cualquier variable se obtienen todas las medidas de este tema, y el diagrama de caja (Variable → Gráfico de caja) muestra los atípicos según la regla del . Trae cargadas las bases de datos de los manuales de econometría, así que sirve ya para practicar con datos reales.