¿Qué son la Precisión, la Exhaustividad y la Puntuación F1?
Precisión, Exhaustividad y Puntuación F1 – Métricas de Clasificación del Aprendizaje Automático (Machine Learning): Guía Detallada
Definición de Precisión, Exhaustividad y Puntuación F1
La precisión, la exhaustividad y la puntuación F1 son métricas de rendimiento fundamentales para evaluar modelos de clasificación y detección de objetos. Se calculan a partir de una matriz de confusión, una tabla que compara las etiquetas predichas con la verdad fundamental. Estas tres métricas cuentan historias diferentes sobre el rendimiento del modelo, y la elección entre ellas depende del costo de los diferentes tipos de errores en su aplicación.
La precisión responde a la pregunta: “Cuando el modelo señala un defecto, ¿con qué frecuencia es correcto?” Matemáticamente, precisión = VP / (VP + FP), donde VP es el recuento de detecciones verdaderas positivas (detecciones correctas) y FP es el recuento de detecciones falsas positivas (detecciones incorrectas). La precisión mide la fracción de todas las predicciones positivas que son realmente correctas. Una precisión de 0.95 significa que el 95 por ciento de los defectos que el modelo detecta son genuinos.
La exhaustividad (también llamada sensibilidad) responde: “De todos los defectos reales presentes, ¿cuántos encuentra el modelo?” La fórmula es exhaustividad = VP / (VP + FN), donde FN es el recuento de detecciones falsas negativas (defectos que el modelo pasó por alto). La exhaustividad mide la fracción de todos los defectos reales que el modelo detecta con éxito. Una exhaustividad de 0.90 significa que el modelo captura el 90 por ciento de los defectos reales en la escena.
La puntuación F1 es la media armónica de la precisión y la exhaustividad: F1 = 2 * (Precisión * Exhaustividad) / (Precisión + Exhaustividad). Este número único varía de 0 a 1, siendo 1 la detección perfecta. La F1 proporciona una métrica equilibrada cuando tanto los falsos positivos como los falsos negativos son costosos. Penaliza el desequilibrio extremo entre precisión y exhaustividad, por lo que un modelo no puede lograr una F1 alta sacrificando una métrica en favor de la otra.
La Matriz de Confusión y las Métricas Derivadas
Las tres métricas se derivan de una tabla simple de dos por dos llamada matriz de confusión:
| Predicción | Realmente Defecto | Realmente OK |
|---|---|---|
| El modelo dice “Defecto” | VP (Verdadero Positivo) | FP (Falso Positivo) |
| El modelo dice “OK” | FN (Falso Negativo) | VN (Verdadero Negativo) |
A partir de esta matriz, la precisión y la exhaustividad se derivan directamente:
| Métrica | Fórmula | Qué significa | Costo de equivocarse |
|---|---|---|---|
| Precisión | VP / (VP + FP) | Fracción de detecciones que son correctas | Las falsas alarmas desperdician el tiempo del inspector |
| Exhaustividad | VP / (VP + FN) | Fracción de defectos reales que se encuentran | Los defectos pasados por alto ponen en peligro la seguridad |
| Puntuación F1 | 2 * P * E / (P + E) | Media armónica equilibrada de ambas | Penaliza los equilibrios extremos |
Un modelo con alta precisión pero baja exhaustividad captura solo los defectos obvios y rara vez genera falsas alarmas. Un modelo con alta exhaustividad pero baja precisión detecta casi todos los defectos, pero señala muchos no defectos, ahogando a los inspectores en trabajo de verificación manual. El modelo ideal logra ambos, pero en la práctica, el umbral (el límite de decisión que separa las predicciones positivas de las negativas) debe ajustarse para equilibrar estas demandas contrapuestas.
El Equilibrio entre Precisión y Exhaustividad en la Inspección Crítica para la Seguridad
En la inspección de pavimentos e iluminación de aeropuertos, la elección entre precisión y exhaustividad tiene consecuencias reales para la seguridad. Considere dos escenarios:
Escenario 1: Detección de Objetos Extraños en Pistas (FOD)
Un FOD en una pista activa es un peligro crítico. Un avión que golpee escombros puede sufrir daños catastróficos. En este contexto, un defecto pasado por alto (falso negativo) plantea un riesgo grave, por lo que la exhaustividad es primordial. Un inspector podría tolerar falsas alarmas, dedicando tiempo adicional a verificar que ciertos objetos detectados son realmente material extraño, porque el costo de pasar por alto un FOD real es inaceptable. Una exhaustividad de 0.98 es preferible a una exhaustividad de 0.80, incluso si la precisión cae de 0.95 a 0.85 en el proceso. Los falsos positivos marginales son una pequeña carga operativa en comparación con un peligro de seguridad pasado por alto.
Escenario 2: Registro Rutinario de Daños en el Pavimento
Para la inspección rutinaria de daños en la superficie del pavimento (grietas, ahuellamiento, descascarillado), el modo de fallo cambia. Los falsos positivos significan que el informe de inspección contiene entradas que los equipos de mantenimiento deben investigar y finalmente descartar como no problemas. Un sistema que señala 1,000 anomalías superficiales cuando solo 500 son defectos reales obliga a un costoso triaje manual. Aquí, la precisión se vuelve más importante en relación con la exhaustividad. Una precisión de 0.90 (el 90 por ciento de los daños señalados es genuino) es más valiosa que una exhaustividad de 0.99 con una precisión de 0.50.
Este equilibrio no es simétrico entre dominios dentro del mismo aeropuerto. La inspección de iluminación (calibración PAPI, estado de las luces de aproximación, uniformidad de intensidad) puede exigir puntos de operación de precisión-exhaustividad diferentes a los de la exploración de la superficie del pavimento o la evaluación de la franqueza de obstáculos.
Aplicaciones en la Inspección de Pavimentos e Infraestructuras
En la práctica, los modelos de visión por computadora para la inspección de aeropuertos generan puntuaciones de confianza de detección, no predicciones binarias. Un modelo podría señalar una posible grieta con una confianza de 0.72, otra con 0.55 y otra con 0.92. El umbral de decisión (por ejemplo, “señalar detecciones con confianza superior a 0.7”) controla directamente el equilibrio entre precisión y exhaustividad.
Reducir el umbral de 0.7 a 0.5 detecta más defectos (mayor exhaustividad) porque ahora se incluyen las detecciones marginales. Sin embargo, también señala más falsos positivos (menor precisión) porque los no defectos límite ahora cruzan el umbral. Elevar el umbral a 0.9 hace lo contrario: menos detecciones en general, pero aquellas que pasan tienen más probabilidades de ser correctas.
Al evaluar un nuevo modelo de detección de defectos, los profesionales a menudo calculan la precisión-exhaustividad en todos los umbrales posibles y visualizan el resultado como una curva de precisión-exhaustividad. El área bajo esta curva (AUC-PR) es una métrica resumida. Un modelo que logra tanto una alta precisión como una alta exhaustividad en la mayoría de los umbrales obtiene una puntuación más alta que uno que se ve obligado a elegir entre ellas.
Cuándo Priorizar la Precisión frente a la Exhaustividad
El contexto operativo determina el equilibrio óptimo:
Priorizar la Exhaustividad (Alta Sensibilidad) cuando el costo de un defecto pasado por alto es grave: detección de FOD, daños estructurales críticos o fallos de iluminación que afectan la navegación de aproximación. Un sistema automatizado con una exhaustividad de 0.95 y una precisión de 0.70 es aceptable porque los defectos pasados por alto son inaceptables.
Priorizar la Precisión (Baja Tasa de Falsos Positivos) cuando las falsas alarmas son costosas: monitoreo rutinario de daños que requiere verificación manual, o cuando el sistema de inspección alimenta una cola de triaje donde los falsos positivos consumen tiempo de expertos escaso.
Equilibrar con la F1 (Precisión y Exhaustividad Medias) cuando tanto los falsos positivos como los falsos negativos conllevan un costo significativo, y no tiene una razón sólida para ponderar uno sobre el otro. La puntuación F1 asegura que el modelo no sobresalga en una métrica mientras se desploma en la otra.
Muchos flujos de trabajo de inspección de aeropuertos operan en un proceso de dos etapas: un sistema de IA automatizado con alta exhaustividad (capturando casi todos los candidatos) alimenta un paso de revisión humana que filtra los falsos positivos. El sistema general logra los beneficios de seguridad de la alta exhaustividad sin la carga operativa de las falsas alarmas excesivas. La precisión de la IA puede ser moderada, el experto humano proporciona la verificación final.
Comparación y Resumen
La siguiente tabla contrasta cómo responden estas métricas al comportamiento del modelo:
| Escenario | Precisión | Exhaustividad | F1 | Mejor Caso de Uso |
|---|---|---|---|---|
| Detecta todo, muchas falsas alarmas | Baja | Alta | Media | Escenarios de alto riesgo donde pasar por alto defectos es inaceptable |
| Detecta solo ciertos defectos, pocas falsas alarmas | Alta | Baja | Baja | Triaje de baja urgencia donde las falsas alarmas pierden tiempo |
| Equilibrado, moderado en ambos | Media | Media | Alta | Evaluación de propósito general sin asimetría de costos extrema |
Conclusión
La precisión, la exhaustividad y la puntuación F1 no son medidas absolutas de la calidad del modelo, son herramientas para comprender el comportamiento del modelo y tomar decisiones informadas sobre su implementación. En la inspección de iluminación y pavimentos de aeropuertos, la precisión y la exhaustividad conllevan diferentes costos en el mundo real. Un sistema de alta exhaustividad y precisión moderada puede ser la opción correcta para la detección de defectos críticos para la seguridad, especialmente en la primera etapa de un flujo de trabajo de inspección de dos etapas. Por el contrario, un sistema de alta precisión puede ser adecuado para informes rutinarios donde la revisión humana es abundante. La puntuación F1 proporciona un resumen equilibrado cuando ningún costo único domina. Comprender estas métricas y la matriz de confusión en la que se basan es esencial para construir y evaluar sistemas de IA que mejoren la seguridad y la eficiencia operativa del aeropuerto.