Glosario de aviación

¿Qué son la Precisión, la Exhaustividad y la Puntuación F1?

Definición
La precisión, la exhaustividad y la puntuación F1 son métricas de rendimiento utilizadas para evaluar modelos de clasificación y detección de objetos en la inspección de infraestructuras impulsada por IA. La precisión es la relación entre las detecciones verdaderas positivas y todas las detecciones positivas (VP / (VP + FP)), y mide la frecuencia con la que el modelo es correcto cuando señala un defecto. La exhaustividad (también llamada sensibilidad) es la relación entre los verdaderos positivos y todos los defectos reales (VP / (VP + FN)), y mide cuántos defectos reales encuentra el modelo. Un modelo de alta precisión produce pocas falsas alarmas pero puede pasar por alto defectos, un modelo de alta exhaustividad encuentra la mayoría de los defectos pero puede producir falsos positivos. La puntuación F1 es la media armónica de la precisión y la exhaustividad (2 × Precisión × Exhaustividad / (Precisión + Exhaustividad)), y proporciona una métrica única que equilibra ambas. En la detección de daños en pavimentos, el equilibrio adecuado entre precisión y exhaustividad depende de la aplicación: la detección de defectos críticos para la seguridad (por ejemplo, FOD en pistas) suele priorizar la exhaustividad, mientras que los sistemas de informes automatizados pueden favorecer la precisión para reducir la carga de revisión manual.

Precisión, Exhaustividad y Puntuación F1 – Métricas de Clasificación del Aprendizaje Automático (Machine Learning): Guía Detallada

Definición de Precisión, Exhaustividad y Puntuación F1

La precisión, la exhaustividad y la puntuación F1 son métricas de rendimiento fundamentales para evaluar modelos de clasificación y detección de objetos. Se calculan a partir de una matriz de confusión, una tabla que compara las etiquetas predichas con la verdad fundamental. Estas tres métricas cuentan historias diferentes sobre el rendimiento del modelo, y la elección entre ellas depende del costo de los diferentes tipos de errores en su aplicación.

La precisión responde a la pregunta: “Cuando el modelo señala un defecto, ¿con qué frecuencia es correcto?” Matemáticamente, precisión = VP / (VP + FP), donde VP es el recuento de detecciones verdaderas positivas (detecciones correctas) y FP es el recuento de detecciones falsas positivas (detecciones incorrectas). La precisión mide la fracción de todas las predicciones positivas que son realmente correctas. Una precisión de 0.95 significa que el 95 por ciento de los defectos que el modelo detecta son genuinos.

La exhaustividad (también llamada sensibilidad) responde: “De todos los defectos reales presentes, ¿cuántos encuentra el modelo?” La fórmula es exhaustividad = VP / (VP + FN), donde FN es el recuento de detecciones falsas negativas (defectos que el modelo pasó por alto). La exhaustividad mide la fracción de todos los defectos reales que el modelo detecta con éxito. Una exhaustividad de 0.90 significa que el modelo captura el 90 por ciento de los defectos reales en la escena.

La puntuación F1 es la media armónica de la precisión y la exhaustividad: F1 = 2 * (Precisión * Exhaustividad) / (Precisión + Exhaustividad). Este número único varía de 0 a 1, siendo 1 la detección perfecta. La F1 proporciona una métrica equilibrada cuando tanto los falsos positivos como los falsos negativos son costosos. Penaliza el desequilibrio extremo entre precisión y exhaustividad, por lo que un modelo no puede lograr una F1 alta sacrificando una métrica en favor de la otra.

La Matriz de Confusión y las Métricas Derivadas

Las tres métricas se derivan de una tabla simple de dos por dos llamada matriz de confusión:

PredicciónRealmente DefectoRealmente OK
El modelo dice “Defecto”VP (Verdadero Positivo)FP (Falso Positivo)
El modelo dice “OK”FN (Falso Negativo)VN (Verdadero Negativo)

A partir de esta matriz, la precisión y la exhaustividad se derivan directamente:

MétricaFórmulaQué significaCosto de equivocarse
PrecisiónVP / (VP + FP)Fracción de detecciones que son correctasLas falsas alarmas desperdician el tiempo del inspector
ExhaustividadVP / (VP + FN)Fracción de defectos reales que se encuentranLos defectos pasados por alto ponen en peligro la seguridad
Puntuación F12 * P * E / (P + E)Media armónica equilibrada de ambasPenaliza los equilibrios extremos

Un modelo con alta precisión pero baja exhaustividad captura solo los defectos obvios y rara vez genera falsas alarmas. Un modelo con alta exhaustividad pero baja precisión detecta casi todos los defectos, pero señala muchos no defectos, ahogando a los inspectores en trabajo de verificación manual. El modelo ideal logra ambos, pero en la práctica, el umbral (el límite de decisión que separa las predicciones positivas de las negativas) debe ajustarse para equilibrar estas demandas contrapuestas.

El Equilibrio entre Precisión y Exhaustividad en la Inspección Crítica para la Seguridad

En la inspección de pavimentos e iluminación de aeropuertos, la elección entre precisión y exhaustividad tiene consecuencias reales para la seguridad. Considere dos escenarios:

Escenario 1: Detección de Objetos Extraños en Pistas (FOD)

Un FOD en una pista activa es un peligro crítico. Un avión que golpee escombros puede sufrir daños catastróficos. En este contexto, un defecto pasado por alto (falso negativo) plantea un riesgo grave, por lo que la exhaustividad es primordial. Un inspector podría tolerar falsas alarmas, dedicando tiempo adicional a verificar que ciertos objetos detectados son realmente material extraño, porque el costo de pasar por alto un FOD real es inaceptable. Una exhaustividad de 0.98 es preferible a una exhaustividad de 0.80, incluso si la precisión cae de 0.95 a 0.85 en el proceso. Los falsos positivos marginales son una pequeña carga operativa en comparación con un peligro de seguridad pasado por alto.

Escenario 2: Registro Rutinario de Daños en el Pavimento

Para la inspección rutinaria de daños en la superficie del pavimento (grietas, ahuellamiento, descascarillado), el modo de fallo cambia. Los falsos positivos significan que el informe de inspección contiene entradas que los equipos de mantenimiento deben investigar y finalmente descartar como no problemas. Un sistema que señala 1,000 anomalías superficiales cuando solo 500 son defectos reales obliga a un costoso triaje manual. Aquí, la precisión se vuelve más importante en relación con la exhaustividad. Una precisión de 0.90 (el 90 por ciento de los daños señalados es genuino) es más valiosa que una exhaustividad de 0.99 con una precisión de 0.50.

Este equilibrio no es simétrico entre dominios dentro del mismo aeropuerto. La inspección de iluminación (calibración PAPI, estado de las luces de aproximación, uniformidad de intensidad) puede exigir puntos de operación de precisión-exhaustividad diferentes a los de la exploración de la superficie del pavimento o la evaluación de la franqueza de obstáculos.

Aplicaciones en la Inspección de Pavimentos e Infraestructuras

En la práctica, los modelos de visión por computadora para la inspección de aeropuertos generan puntuaciones de confianza de detección, no predicciones binarias. Un modelo podría señalar una posible grieta con una confianza de 0.72, otra con 0.55 y otra con 0.92. El umbral de decisión (por ejemplo, “señalar detecciones con confianza superior a 0.7”) controla directamente el equilibrio entre precisión y exhaustividad.

Reducir el umbral de 0.7 a 0.5 detecta más defectos (mayor exhaustividad) porque ahora se incluyen las detecciones marginales. Sin embargo, también señala más falsos positivos (menor precisión) porque los no defectos límite ahora cruzan el umbral. Elevar el umbral a 0.9 hace lo contrario: menos detecciones en general, pero aquellas que pasan tienen más probabilidades de ser correctas.

Al evaluar un nuevo modelo de detección de defectos, los profesionales a menudo calculan la precisión-exhaustividad en todos los umbrales posibles y visualizan el resultado como una curva de precisión-exhaustividad. El área bajo esta curva (AUC-PR) es una métrica resumida. Un modelo que logra tanto una alta precisión como una alta exhaustividad en la mayoría de los umbrales obtiene una puntuación más alta que uno que se ve obligado a elegir entre ellas.

Cuándo Priorizar la Precisión frente a la Exhaustividad

El contexto operativo determina el equilibrio óptimo:

  • Priorizar la Exhaustividad (Alta Sensibilidad) cuando el costo de un defecto pasado por alto es grave: detección de FOD, daños estructurales críticos o fallos de iluminación que afectan la navegación de aproximación. Un sistema automatizado con una exhaustividad de 0.95 y una precisión de 0.70 es aceptable porque los defectos pasados por alto son inaceptables.

  • Priorizar la Precisión (Baja Tasa de Falsos Positivos) cuando las falsas alarmas son costosas: monitoreo rutinario de daños que requiere verificación manual, o cuando el sistema de inspección alimenta una cola de triaje donde los falsos positivos consumen tiempo de expertos escaso.

  • Equilibrar con la F1 (Precisión y Exhaustividad Medias) cuando tanto los falsos positivos como los falsos negativos conllevan un costo significativo, y no tiene una razón sólida para ponderar uno sobre el otro. La puntuación F1 asegura que el modelo no sobresalga en una métrica mientras se desploma en la otra.

Muchos flujos de trabajo de inspección de aeropuertos operan en un proceso de dos etapas: un sistema de IA automatizado con alta exhaustividad (capturando casi todos los candidatos) alimenta un paso de revisión humana que filtra los falsos positivos. El sistema general logra los beneficios de seguridad de la alta exhaustividad sin la carga operativa de las falsas alarmas excesivas. La precisión de la IA puede ser moderada, el experto humano proporciona la verificación final.

Comparación y Resumen

La siguiente tabla contrasta cómo responden estas métricas al comportamiento del modelo:

EscenarioPrecisiónExhaustividadF1Mejor Caso de Uso
Detecta todo, muchas falsas alarmasBajaAltaMediaEscenarios de alto riesgo donde pasar por alto defectos es inaceptable
Detecta solo ciertos defectos, pocas falsas alarmasAltaBajaBajaTriaje de baja urgencia donde las falsas alarmas pierden tiempo
Equilibrado, moderado en ambosMediaMediaAltaEvaluación de propósito general sin asimetría de costos extrema

Conclusión

La precisión, la exhaustividad y la puntuación F1 no son medidas absolutas de la calidad del modelo, son herramientas para comprender el comportamiento del modelo y tomar decisiones informadas sobre su implementación. En la inspección de iluminación y pavimentos de aeropuertos, la precisión y la exhaustividad conllevan diferentes costos en el mundo real. Un sistema de alta exhaustividad y precisión moderada puede ser la opción correcta para la detección de defectos críticos para la seguridad, especialmente en la primera etapa de un flujo de trabajo de inspección de dos etapas. Por el contrario, un sistema de alta precisión puede ser adecuado para informes rutinarios donde la revisión humana es abundante. La puntuación F1 proporciona un resumen equilibrado cuando ningún costo único domina. Comprender estas métricas y la matriz de confusión en la que se basan es esencial para construir y evaluar sistemas de IA que mejoren la seguridad y la eficiencia operativa del aeropuerto.

Preguntas Frecuentes

Evalúe el Rendimiento de la Inspección con IA

Los modelos de IA de TarmacView se evalúan rigurosamente utilizando métricas de precisión, exhaustividad y F1 en todas las clases de daños del pavimento para garantizar un rendimiento de detección fiable.