Contraste de hipótesis: errores tipo I y II, significación y potencia
1. La pregunta
Una empresa lanza una campaña publicitaria. Las ventas del mes siguiente suben un 4 %. ¿Funcionó la campaña, o es la fluctuación normal de un mes cualquiera?
Las ventas suben y bajan todos los meses sin que nadie haga nada. La pregunta no es si subieron —eso se ve— sino si subieron más de lo que el azar explicaría. Responderla es un contraste de hipótesis, y es la maquinaria que sostiene todas las decisiones basadas en datos: desde aprobar un medicamento hasta declarar significativo un coeficiente de regresión en el tema 30.
2. Intuición
Un contraste funciona como un juicio penal, y la analogía es exacta en cada pieza.
Presunción de inocencia. Se parte de que no hay efecto: la campaña no sirvió, el medicamento no cura, la variable no influye. Esa es la hipótesis nula, . No se acepta porque se crea, sino porque es el punto de partida por defecto.
La carga de la prueba recae en la acusación. Para condenar hacen falta pruebas «más allá de toda duda razonable». Para rechazar hacen falta datos tan improbables bajo que sea más razonable pensar que es falsa.
Dos formas de equivocarse. Condenar a un inocente (error tipo I) o absolver a un culpable (error tipo II). Los sistemas judiciales se diseñan para minimizar el primero, aceptando más del segundo. La estadística clásica hace exactamente lo mismo: fija pequeño y deja a lo que salga.
«No culpable» no es «inocente». Un veredicto absolutorio significa que no hubo pruebas suficientes, no que se haya demostrado la inocencia. Igual: no rechazar no la demuestra. Por eso nunca se dice «acepto » sino «no hay evidencia para rechazarla».
Y la parte contraintuitiva. Con una muestra enorme se rechaza casi cualquier , porque hasta una diferencia ridícula se vuelve detectable. Significativo estadísticamente no es lo mismo que importante económicamente. Es el error de interpretación que más daño hace en econometría aplicada.
3. Formalización
Las hipótesis
- , la hipótesis nula, siempre contiene la igualdad. Es la que se somete a prueba.
- , la alternativa, es lo que se sospecha o se quiere demostrar.
Contrastes bilaterales y unilaterales:
| Alternativa | Tipo | Se rechaza si |
|---|---|---|
| bilateral | el estadístico es extremo por cualquier lado | |
| unilateral derecho | el estadístico es grande | |
| unilateral izquierdo | el estadístico es pequeño |
La alternativa se decide ANTES de ver los datos. Elegirla después, para que salga significativo, invalida el contraste.
Los dos errores
| verdadera | falsa | |
|---|---|---|
| Rechazar | Error tipo I () | Decisión correcta () |
| No rechazar | Decisión correcta () | Error tipo II () |
es el nivel de significación y se fija de antemano: 0,05, 0,01 o 0,10 según lo que cueste equivocarse.
es la potencia del contraste: la capacidad de detectar un efecto que realmente existe.
El conflicto. Con fijo, reducir aumenta : ser más exigente para condenar deja escapar a más culpables. La única forma de reducir los dos a la vez es aumentar la muestra.
Estadístico de contraste y regiones
Un estadístico de contraste mide la discrepancia entre lo observado y lo que predice, en unidades de error típico. Para la media:
La región crítica o de rechazo es el conjunto de valores del estadístico que llevan a rechazar. Para un bilateral al nivel :
El valor p
El valor p es la probabilidad de obtener un resultado al menos tan extremo como el observado, suponiendo que es cierta.
Lo que el valor p NO es, y aquí se concentran casi todos los errores:
- No es la probabilidad de que sea cierta. no tiene probabilidad en el enfoque clásico: es cierta o falsa.
- No es la probabilidad de haberse equivocado al rechazar.
- No mide el tamaño del efecto. Un con una muestra enorme puede corresponder a un efecto insignificante.
Lo que sí es: una medida de cuán sorprendentes son los datos si fuera cierta. Un dice «si no hubiera efecto, datos así de extremos aparecerían 3 veces de cada 100».
Contrastes más frecuentes
Media, desconocida:
Proporción:
Nótese que en el denominador va , el valor de , no : bajo se conoce la varianza. Es la diferencia con el intervalo de confianza del tema 26, donde no hay ningún que suponer.
Varianza (población normal):
Cálculo de la potencia
Para calcular hay que fijar un valor concreto de la alternativa, . En un contraste bilateral con conocida:
La potencia crece con:
- el tamaño del efecto : los efectos grandes son fáciles de detectar;
- el tamaño muestral ;
- el nivel : ser menos exigente aumenta la potencia, a costa de más falsos positivos;
- menor variabilidad .
Un contraste con poca potencia es peligroso: no rechazar no significa nada, porque el contraste no habría detectado ni un efecto grande.
Relación con los intervalos de confianza
Son la misma inferencia presentada de dos formas. El intervalo es más informativo porque da todos los valores compatibles con los datos, no solo un sí/no sobre uno.
Significación estadística frente a relevancia económica
Un resultado significativo dice que el efecto existe; no dice que importe.
- Con enorme, cualquier diferencia distinta de cero acaba siendo significativa.
- Con pequeño, un efecto grande puede no serlo.
Siempre hay que informar del tamaño del efecto y de su intervalo de confianza, no solo del valor p. Un aumento de ventas del 0,3 % puede ser significativísimo y no pagar la campaña.
4. Ejemplo económico resuelto
Problema. Una cadena de tiendas tiene un ticket medio histórico de 48 €. Tras una campaña, una muestra de 64 tickets da € con €.
- Plantea y resuelve el contraste al 5 %.
- Calcula el valor p.
- Calcula la potencia del contraste si el efecto real fuera de 3 €.
- La campaña costó 12 000 € y la cadena vende 8000 tickets al mes. ¿Compensó?
Paso 1. Plantear las hipótesis. La cadena quiere saber si la campaña subió el ticket, así que la alternativa es unilateral derecha:
(Decidido antes de ver los datos: la campaña solo puede haber ayudado o no haber hecho nada.)
Paso 2. Estadístico de contraste.
Paso 3. Región crítica. Unilateral derecho al 5 % con 63 grados de libertad:
Conclusión: hay evidencia, al nivel del 5 %, de que el ticket medio ha aumentado.
Paso 4. Valor p.
Lectura correcta: «si la campaña no hubiera tenido ningún efecto, obtener un ticket medio de 51,20 € o más en una muestra de 64 tendría una probabilidad del 2,5 %».
Lectura incorrecta: «hay un 2,5 % de probabilidad de que la campaña no haya funcionado». Eso sería , que este marco no calcula.
Paso 5. Potencia si el efecto real fuera de 3 €. Es decir, .
Se rechaza cuando supera el valor crítico:
Bajo :
La potencia es del 58 %, y por tanto .
Qué significa. Si la campaña realmente sube el ticket 3 €, este contraste solo lo detectaría 58 veces de cada 100. Cuatro de cada diez estudios idénticos concluirían erróneamente que no hay efecto.
Es una potencia baja. Lo habitual es exigir un 80 %. Para alcanzarlo haría falta:
113 tickets en lugar de 64.
Paso 6. La pregunta económica, que es la que importa.
Intervalo de confianza al 95 % para la media (bilateral, ):
El aumento estimado es de 3,20 € por ticket, pero con un intervalo que va de 0,00 a 6,40 €.
Beneficio de la campaña, suponiendo que el ticket es margen (simplificación):
Conclusión matizada. La estimación central sugiere que la campaña, con un coste de 12 000 €, generó unos 25 600 € en un mes: rentable. Pero el intervalo llega hasta cero: los datos son compatibles con que no haya servido de nada.
Recomendación honesta: el resultado es prometedor pero no concluyente. Antes de comprometer presupuesto para repetirla conviene ampliar la muestra —113 tickets darían un 80 % de potencia— o dejarla correr otro mes y medir de nuevo. Declarar el éxito con y una potencia del 58 % sería precipitado.
Esta es la diferencia entre significación y relevancia. El contraste dijo «rechaza»; la decisión empresarial requiere mirar el intervalo y el coste, no el valor p.
5. Errores típicos
Decir «acepto ». Nunca se acepta: no se rechaza. La ausencia de evidencia no es evidencia de ausencia, sobre todo con poca potencia.
Interpretar el valor p como . Es al revés: es . Confundir una condicional con su inversa es la falacia del tema 21 reapareciendo.
Elegir la alternativa después de ver los datos. Convertir un bilateral en unilateral para que baje de 0,05 duplica en la práctica el nivel de significación real.
Confundir significativo con importante. Con , una diferencia de 0,01 € es significativa y económicamente irrelevante. Informar siempre del tamaño del efecto.
Ignorar la potencia. Un «no significativo» procedente de un contraste con potencia del 30 % no informa de nada. Antes de concluir que no hay efecto hay que comprobar que el estudio podría haberlo detectado.
Hacer muchos contrastes y quedarse con el que sale. Con 20 contrastes al 5 %, uno sale significativo por puro azar en promedio. Es el problema de las comparaciones múltiples, que reaparece en el ANOVA del tema 28.
Usar en el denominador del contraste de proporciones. Bajo se supone , así que la varianza es . En el intervalo de confianza sí va , porque allí no hay hipótesis que suponer.
Fijar después de ver el valor p. El nivel se decide antes, en función del coste de los dos errores.
6. Ejercicios
Ejercicio 1 · Contraste bilateral para la media
básicoUna máquina debe envasar 500 g por paquete. Una muestra de 36 paquetes da g con g. ¿Está descalibrada, al 5 %?
Ver solución
Hipótesis. Descalibrada significa desviarse en cualquier dirección: bilateral.
Estadístico.
Región crítica. .
Valor p: .
Conclusión. Hay evidencia de que la máquina está descalibrada, envasando de media unos 6 g menos de lo debido.
Lectura práctica. El intervalo al 95 % es : no contiene 500, coherente con el rechazo. Y el déficit es de entre 0,9 y 11,1 gramos por paquete, información mucho más útil para decidir si hay que parar la línea que el simple «significativo».
Ejercicio 2 · Contraste de proporción
básicoUn banco afirma que el 85 % de sus clientes está satisfecho. Una muestra de 200 clientes da 160 satisfechos. ¿Se puede rechazar la afirmación al 5 %?
Ver solución
Hipótesis. Se quiere comprobar si la satisfacción es menor de lo afirmado:
Estadístico. . En el denominador va :
Región crítica. Unilateral izquierdo al 5 %: .
Valor p: .
Conclusión. Hay evidencia, al 5 %, de que la satisfacción real es inferior al 85 % afirmado.
Matiz de relevancia. La estimación es del 80 %, cinco puntos por debajo. ¿Importa? Con un intervalo al 95 % de , la satisfacción real está entre el 74,5 % y el 85,5 %. La afirmación del banco queda justo en el borde. El rechazo es cierto pero ajustado, y con otra muestra podría no producirse.
Ejercicio 3 · Potencia y tamaño muestral
medioSe quiere contrastar frente a al 5 %, con conocida.
- Con , ¿cuál es la potencia si el valor real fuera ?
- ¿Y si fuera ?
- ¿Qué haría falta para detectar con una potencia del 90 %?
Ver solución
1. Con y .
Valor crítico: se rechaza si .
Bajo :
63,9 %.
2. Con . El valor crítico no cambia (depende solo de , y ):
Solo el 26 %.
Lo que muestra la comparación. El mismo contraste detecta un efecto de 8 unidades el 64 % de las veces, y uno de 4 unidades solo el 26 %. La potencia depende críticamente del tamaño del efecto, y los efectos pequeños son mucho más difíciles de detectar.
Con una potencia del 26 %, un resultado «no significativo» no informa prácticamente de nada: tres de cada cuatro veces se fallaría aunque el efecto existiera.
3. Tamaño necesario para potencia 0,90 con .
Con y :
215 observaciones.
Conclusión práctica. Pasar de detectar efectos de 8 a detectar efectos de 4 con buena potencia exige multiplicar la muestra casi por nueve (de 25 a 215). Detectar efectos pequeños es caro, y por eso conviene decidir de antemano qué tamaño de efecto merece la pena detectar antes de diseñar el estudio.
Ejercicio 4 · Significativo pero irrelevante
avanzadoUna plataforma de comercio electrónico prueba un cambio de diseño con 200 000 usuarios en cada grupo. La tasa de conversión pasa del 3,20 % al 3,28 %.
- Contrasta si el cambio es significativo al 1 %.
- Calcula el intervalo de confianza para la diferencia.
- Si cada conversión deja 25 € de margen y rediseñar el sitio cuesta 400 000 €, ¿qué recomiendas?
- ¿Qué habría pasado con 2000 usuarios por grupo?
Ver solución
1. Contraste de diferencia de proporciones.
Proporción combinada bajo :
Error típico de la diferencia:
Región crítica al 1 %: .
Valor p: .
Al 1 % no es significativo; tampoco al 5 %.
2. Intervalo de confianza para la diferencia (al 95 %, usando las proporciones separadas en el error típico):
En puntos porcentuales: entre y puntos. El intervalo contiene el cero, coherente con el no rechazo.
3. Recomendación económica. Traducimos el intervalo a euros anuales. Con 400 000 usuarios (los dos grupos) y suponiendo ese volumen como base mensual:
Con un coste de 400 000 €, el rediseño se amortizaría en 50 meses con el efecto central (4 años), en 21 meses en el mejor caso, y nunca en el peor.
Recomendación: no rediseñar todavía. No solo porque el resultado no sea significativo, sino porque incluso el escenario optimista da un plazo de recuperación de casi dos años para un cambio de diseño que quedará obsoleto antes. Si se quiere resolver la duda, hay que alargar el test para estrechar el intervalo.
4. Con 2000 usuarios por grupo. El error típico se multiplica por :
Aún más lejos de la significación. El intervalo sería : de a puntos porcentuales, un rango que abarca desde un desastre hasta un éxito rotundo. Con esa muestra el experimento no informa de nada.
La lección doble de este ejercicio.
- Con muestras grandes, cuidado con lo contrario a lo que suele avisarse: aquí ni siquiera 200 000 usuarios por grupo bastan, porque el efecto es diminuto en términos relativos. La regla no es «con grande todo sale significativo», sino que la significación depende de la relación entre el tamaño del efecto y el error típico.
- Lo que decide no es el valor p sino el intervalo traducido a euros. Un resultado significativo con un efecto de 8000 €/mes tampoco justificaría un gasto de 400 000 €.
7. Qué desbloquea
Necesitas antes:
Te abre la puerta a:
- Comparación de medias y proporciones; chi-cuadrado; ANOVA — tema 28
- Regresión múltiple, supuestos de Gauss-Markov, R² y contrastes — tema 30
- Modelos univariantes ARIMA y metodología Box-Jenkins — tema 39
8. Recursos externos
- Sanabria, Comprendiendo la Estadística Inferencial (PDF libre). Explica con cuidado qué significa el nivel de significación, que es exactamente donde se acumulan los malentendidos.
- Inferencia Estadística — Luis Rincón (UNAM). Contrastes de hipótesis con el desarrollo formal de regiones críticas y potencia.
- Apuntes UGR — Estadística II, tema 4. Tabla de contrastes por parámetro, útil como referencia rápida.
- Gretl. La calculadora de contrastes devuelve el estadístico y el valor p para todos los casos de este tema. Y al estimar modelos en el bloque 7, cada coeficiente vendrá con su contraste : será el mismo procedimiento aplicado a .