Saltar al contenido
Matemáticas para Economía40 temas · 7 asignaturas · 42 ECTS
Tema 21 de 40

Probabilidad, probabilidad condicionada y teorema de Bayes

10 h estimadas21.405 Fundamentos de estadística

1. La pregunta

Un banco tiene un sistema antifraude que detecta el 99 % de las operaciones fraudulentas y solo da falsa alarma en el 2 % de las legítimas. Salta una alerta.

¿Cuál es la probabilidad de que esa operación sea realmente fraudulenta? Casi todo el mundo responde «99 %». La respuesta correcta, si el fraude afecta al 0,5 % de las operaciones, es del 20 %. Ocho de cada diez alertas son falsas.

Ese salto entre la intuición y el número es el contenido de este tema, y tiene consecuencias directas: en detección de fraude, en scoring crediticio, en diagnóstico médico y en cualquier contraste de hipótesis del bloque 6.

2. Intuición

Probabilidad condicionada: cambiar el universo. Preguntar «¿cuál es la probabilidad de que llueva?» no es lo mismo que «¿cuál es la probabilidad de que llueva si el cielo está nublado?». La segunda restringe el universo: ya no se consideran todos los días, solo los nublados.

Condicionar es quedarse con una parte del total y recalcular las proporciones dentro de ella. Toda la fórmula de la probabilidad condicionada dice eso: dividir por el tamaño del nuevo universo.

Bayes: darle la vuelta a la pregunta. El sistema antifraude está calibrado para responder «si hay fraude, ¿saltará la alerta?». Pero el analista necesita lo contrario: «ha saltado la alerta, ¿hay fraude?». No son la misma pregunta y no tienen la misma respuesta.

Por qué la intuición falla. Imagina 10 000 operaciones. Si el 0,5 % son fraude, hay 50 fraudulentas y 9950 legítimas. El sistema detecta 49,5 de las fraudulentas (el 99 %), pero también marca 199 de las legítimas (el 2 %). Total de alertas: 248,5, de las cuales solo 49,5 son fraude real.

El 2 % de un grupo enorme produce más falsas alarmas que el 99 % de un grupo diminuto. Ese es todo el fenómeno, y se llama falacia de la tasa base: ignorar cuán raro es el suceso de partida.

3. Formalización

Espacio muestral y sucesos

El espacio muestral es el conjunto de todos los resultados posibles de un experimento aleatorio. Un suceso es un subconjunto de .

Una probabilidad es una función que asigna a cada suceso un número cumpliendo:

  1. para todo suceso .
  2. .
  3. Si y son incompatibles (no pueden ocurrir a la vez), entonces .

De ahí se deducen las reglas de uso diario:

La resta del último término evita contar dos veces lo que está en los dos sucesos.

Probabilidad condicionada

Para :

Se lee «probabilidad de dado ». El denominador es el nuevo universo.

De ahí, la regla del producto:

Independencia

y son independientes si saber que ocurre uno no cambia la probabilidad del otro:

No confundir con incompatibles. Dos sucesos incompatibles con probabilidad positiva son dependientes al máximo: si ocurre uno, el otro es imposible. Es un error muy frecuente.

Teorema de la probabilidad total

Si forman una partición de (son incompatibles entre sí y su unión es todo), entonces para cualquier suceso :

Se descompone el suceso según en cuál de los escenarios ocurre, y se suma ponderando por la probabilidad de cada escenario. Es la herramienta para calcular probabilidades cuando la información viene troceada por casos.

Teorema de Bayes

Cada pieza tiene nombre propio:

ElementoNombreQué es
probabilidad a priorilo que se creía antes de observar
verosimilitudlo que el dato dice bajo cada hipótesis
probabilidad a posteriorilo que se cree tras observar
evidenciaconstante que normaliza

Bayes es la regla para actualizar creencias con datos, y esa lectura es la que lo hace central en economía: es cómo un agente racional revisa sus expectativas al llegar información nueva.

El caso de los tests: sensibilidad y especificidad

Con = «tener la condición» (fraude, morosidad, enfermedad) y = «el test da positivo»:

MedidaDefiniciónQué mide
Prevalenciacuán común es la condición
Sensibilidaddetecta a los que la tienen
Especificidadno molesta a los que no
Valor predictivo positivolo que realmente interesa

El valor predictivo positivo por Bayes:

Depende críticamente de la prevalencia. El mismo test, aplicado a una población de riesgo alto o a la población general, da valores predictivos radicalmente distintos. Es la razón económica de que el cribado masivo de sucesos raros sea caro e ineficaz.

Un método práctico: frecuencias naturales

Los problemas de Bayes se resuelven mucho mejor con una población imaginaria que con fórmulas. Se toma una población grande y redonda —10 000, por ejemplo—, se reparte según las probabilidades y se cuenta. La aritmética es trivial y los errores desaparecen.

Es lo que se hizo en la sección de intuición, y es el método recomendado para los ejercicios.

4. Ejemplo económico resuelto

Problema. Una entidad financiera concede créditos. Por experiencia histórica, el 8 % de los solicitantes acaba impagando. La entidad usa un modelo de scoring que clasifica a los solicitantes como «riesgo alto» o «riesgo bajo». El modelo clasifica como riesgo alto al 85 % de los que efectivamente impagan y al 12 % de los que pagan correctamente.

  1. ¿Qué proporción de solicitantes es clasificada como riesgo alto?
  2. Si un solicitante es clasificado como riesgo alto, ¿cuál es la probabilidad de que impague?
  3. ¿Y si es clasificado como riesgo bajo?
  4. ¿Le compensa a la entidad rechazar a todos los de riesgo alto, si cada crédito concedido a un buen pagador deja 900 € y cada impago cuesta 6000 €?

Paso 1. Poner nombres y datos.

  • = «impaga», = «paga».
  • = «clasificado riesgo alto», = «riesgo bajo».

Paso 2. Tabla con 10 000 solicitantes. Es la vía rápida y sin errores.

De los 800 que impagan, el 85 % es clasificado alto: . De los 9200 que pagan, el 12 % es clasificado alto: .

Riesgo altoRiesgo bajoTotal
Impaga680120800
Paga110480969200
Total1784821610 000

Paso 3. Responder a la pregunta 1.

Comprobación con probabilidad total:

Paso 4. Pregunta 2: probabilidad de impago dado riesgo alto.

Por Bayes:

Fíjate en el salto. La probabilidad a priori era del 8 %; tras la alerta del modelo, sube al 38 %. El modelo es informativo —multiplica por casi cinco la probabilidad— pero la mayoría de los clasificados como riesgo alto (el 62 %) pagarán sin problema. Es la falacia de la tasa base otra vez: el 12 % de un grupo de 9200 produce más clasificaciones altas que el 85 % de un grupo de 800.

Paso 5. Pregunta 3: riesgo bajo.

De un 8 % a priori baja a un 1,5 %. El modelo es más útil descartando que señalando, que es lo habitual con sucesos poco frecuentes.

Paso 6. Pregunta 4: la decisión económica. Comparamos dos políticas sobre los 10 000 solicitantes.

Política A: conceder a todos.

Política B: rechazar a los de riesgo alto. Solo se concede a los 8216 de riesgo bajo, de los cuales 8096 pagan y 120 impagan:

La política B casi duplica el beneficio: 6,57 frente a 3,48 millones.

Qué se pierde y qué se gana. Al rechazar a los 1784 de riesgo alto, la entidad renuncia al margen de 1104 buenos pagadores ( €) pero evita 680 impagos ( €). Gana la diferencia, €, que es exactamente .

El umbral de decisión. ¿Con qué probabilidad de impago compensa conceder? Conceder a un solicitante con probabilidad de impago tiene valor esperado

que es positivo si , es decir, 13,0 %.

  • Riesgo alto: rechazar. Correcto.
  • Riesgo bajo: conceder. Correcto.
  • Sin modelo: conceder a todos, que es la política A.

La conclusión que importa. No hace falta que el modelo acierte casi siempre; basta con que desplace la probabilidad a un lado u otro del umbral económico. Un modelo con solo un 38 % de acierto en sus alertas ha generado tres millones de euros, porque el umbral relevante estaba en el 13 %.

5. Errores típicos

Confundir con . Es el error central del tema y tiene nombre: falacia del fiscal. «El 99 % de los fraudes disparan la alerta» no es «el 99 % de las alertas son fraude».

Ignorar la tasa base. Cuando el suceso es raro, las falsas alarmas dominan aunque la tasa de error sea pequeña. Ningún test es bueno o malo en abstracto: depende de la prevalencia de la población a la que se aplique.

Confundir independientes con incompatibles. Incompatibles significa que no pueden darse a la vez; independientes, que uno no informa sobre el otro. Dos sucesos incompatibles con probabilidad positiva son fuertemente dependientes.

Sumar probabilidades de sucesos que se solapan. solo vale si son incompatibles. Si no, hay que restar .

Multiplicar probabilidades sin comprobar la independencia. exige independencia. En economía casi nada lo es: los impagos se concentran en las recesiones, y suponerlos independientes fue una de las causas de la crisis de 2008.

Olvidar que las condicionadas de una partición suman 1. . Es la comprobación más barata para detectar errores.

Aplicar Bayes sin partición completa. El denominador debe recoger todos los escenarios posibles. Si falta uno, la probabilidad a posteriori sale mal.

6. Ejercicios

Ejercicio 1 · Reglas básicas

básico

En una empresa, el 60 % de los empleados tiene formación universitaria, el 35 % habla inglés con fluidez y el 25 % cumple las dos cosas. Se elige un empleado al azar.

  1. ¿Probabilidad de que tenga formación universitaria o hable inglés?
  2. ¿Probabilidad de que hable inglés si tiene formación universitaria?
  3. ¿Son independientes los dos sucesos?
Ver solución

Sean = «universitario» e = «habla inglés»: , , .

1.

El 70 %. Restar la intersección es imprescindible: los 25 % que cumplen ambas se habrían contado dos veces.

2.

El 41,7 %.

3. Si fueran independientes, debería ser :

No son independientes. Y la dependencia es positiva: entre los universitarios, el 41,7 % habla inglés, frente al 35 % del total. Tener estudios superiores hace más probable hablar inglés, cosa nada sorprendente.

Ejercicio 2 · Probabilidad total

básico

Una fábrica tiene tres líneas de montaje. La línea A produce el 50 % de las unidades, la B el 30 % y la C el 20 %. La proporción de piezas defectuosas es del 2 % en A, del 3 % en B y del 5 % en C. ¿Qué proporción de la producción total es defectuosa?

Ver solución

Las tres líneas forman una partición: toda pieza viene de una y solo una.

Observación de gestión. Las líneas A y C aportan la misma cantidad de defectos (0,010 cada una) por motivos opuestos: A porque produce mucho, C porque falla mucho. Reducir a la mitad la tasa de defectos de C ahorraría tanto como reducir a la mitad la de A, y probablemente sea mucho más barato.

Ejercicio 3 · Bayes hacia atrás

medio

Con los datos del ejercicio 2, se detecta una pieza defectuosa en el control final. ¿Cuál es la probabilidad de que provenga de la línea C?

Ver solución

Con frecuencias naturales. Sobre 10 000 unidades:

LíneaProducciónDefectuosas
A5000
B3000
C2000
Total10 000290

Con la fórmula de Bayes:

Comparación de las tres a posteriori:

Suman 100 %, como debe ser.

La lectura. Aunque C es con diferencia la línea más defectuosa (5 % frente a 2 %), solo produce un tercio de los defectos, porque fabrica poco. A, con la mejor tasa de todas, genera exactamente los mismos defectos que C.

Es la misma lógica que en las alertas de fraude: un porcentaje pequeño de un volumen grande puede pesar más que un porcentaje grande de un volumen pequeño. Un responsable de calidad que solo mirase las tasas de defecto priorizaría C y dejaría intacta la mitad del problema.

Ejercicio 4 · Cuándo deja de compensar un test

avanzado

Una aseguradora estudia implantar un test de detección de fraude en siniestros. El test tiene sensibilidad del 90 % y especificidad del 95 %. Investigar un siniestro marcado cuesta 400 €. Un fraude no detectado cuesta 5000 €.

  1. Si el 4 % de los siniestros son fraudulentos, calcula el valor predictivo positivo.
  2. Determina a partir de qué prevalencia de fraude compensa investigar los positivos.
  3. ¿Qué ocurre si la prevalencia baja al 0,5 %?
Ver solución

1. Valor predictivo positivo con prevalencia del 4 %.

Sobre 10 000 siniestros: 400 fraudulentos, 9600 legítimos.

  • Positivos entre los fraudulentos: .
  • Falsos positivos: especificidad 95 % 5 % de falsas alarmas: .
Test Test Total
Fraude36040400
Legítimo48091209600
Total840916010 000

Menos de la mitad de los positivos son fraude real, con un test que acierta el 90 % y solo falla el 5 %.

2. Umbral de rentabilidad. Investigar un siniestro marcado cuesta 400 € y evita un fraude de 5000 € solo si el siniestro es realmente fraudulento, cosa que ocurre con probabilidad .

Valor esperado de investigar un positivo:

Compensa si :

Ahora hay que traducir esa condición a prevalencia. Con prevalencia :

Imponiendo que sea mayor que 0,08:

Compensa investigar los positivos siempre que el fraude afecte a más del 0,48 % de los siniestros. Con el 4 % del enunciado, compensa con mucho margen.

Verificación con el caso 1. Investigar los 840 positivos cuesta € y evita 360 fraudes de 5000 €, es decir, €. Beneficio neto: 1 464 000 €. Ampliamente rentable.

3. Prevalencia del 0,5 %. Sobre 10 000 siniestros: 50 fraudulentos, 9950 legítimos.

  • Verdaderos positivos: .
  • Falsos positivos: .
  • Total positivos: 542,5.

Justo por encima del umbral del 8 %, coherente con el calculado en el apartado 2.

Balance económico:

Apenas compensa. El mismo test, con el mismo rendimiento técnico, ha pasado de generar 1,46 millones a generar 8000 €, solo porque el fraude es ocho veces menos frecuente.

La conclusión. Un test no tiene «calidad» en abstracto: su valor depende de la prevalencia y de la asimetría de costes. Antes de comprar un sistema de detección hay que preguntar a qué población se va a aplicar, no solo cuál es su tasa de acierto. Y una mejora de la especificidad —reducir falsas alarmas— vale mucho más que una mejora de la sensibilidad cuando el suceso es raro.

7. Qué desbloquea

Necesitas antes:

Te abre la puerta a:

8. Recursos externos

  • Sanabria, Comprendiendo la Estadística Inferencial (PDF libre). Los capítulos de probabilidad combinan rigor e intuición, y tratan Bayes con ejemplos desarrollados.
  • Apuntes UGR — Estadística II. Compactos, útiles para repasar las reglas y la probabilidad total antes de un examen.
  • Aviso de orden. Los vídeos de inferencia de Luis Rincón (UNAM), que aparecen en el bloque 6, exigen manejar probabilidad en varias variables. Van después de completar este bloque, nunca antes.