Glosario de aviación

¿Qué son la Precisión, la Exhaustividad y la Puntuación F1?

IA · Aprendizaje Automático · Visión por Computadora · Detección de Defectos · Inspección de Infraestructuras 8 idiomas
Definición
La precisión, la exhaustividad y la puntuación F1 son métricas de rendimiento utilizadas para evaluar modelos de clasificación y detección de objetos en la inspección de infraestructuras impulsada por IA. La precisión es la relación entre las detecciones verdaderas positivas y todas las detecciones positivas (VP / (VP + FP)), y mide la frecuencia con la que el modelo es correcto cuando señala un defecto. La exhaustividad (también llamada sensibilidad) es la relación entre los verdaderos positivos y todos los defectos reales (VP / (VP + FN)), y mide cuántos defectos reales encuentra el modelo. Un modelo de alta precisión produce pocas falsas alarmas pero puede pasar por alto defectos, un modelo de alta exhaustividad encuentra la mayoría de los defectos pero puede producir falsos positivos. La puntuación F1 es la media armónica de la precisión y la exhaustividad (2 × Precisión × Exhaustividad / (Precisión + Exhaustividad)), y proporciona una métrica única que equilibra ambas. En la detección de daños en pavimentos, el equilibrio adecuado entre precisión y exhaustividad depende de la aplicación: la detección de defectos críticos para la seguridad (por ejemplo, FOD en pistas) suele priorizar la exhaustividad, mientras que los sistemas de informes automatizados pueden favorecer la precisión para reducir la carga de revisión manual.

Precisión, Exhaustividad y Puntuación F1 – Métricas de Clasificación del Aprendizaje Automático (Machine Learning): Guía Detallada

Definición de Precisión, Exhaustividad y Puntuación F1

La precisión, la exhaustividad y la puntuación F1 son métricas de rendimiento fundamentales para evaluar modelos de clasificación y detección de objetos. Se calculan a partir de una matriz de confusión, una tabla que compara las etiquetas predichas con la verdad fundamental. Estas tres métricas cuentan historias diferentes sobre el rendimiento del modelo, y la elección entre ellas depende del costo de los diferentes tipos de errores en su aplicación.

La precisión responde a la pregunta: “Cuando el modelo señala un defecto, ¿con qué frecuencia es correcto?” Matemáticamente, precisión = VP / (VP + FP), donde VP es el recuento de detecciones verdaderas positivas (detecciones correctas) y FP es el recuento de detecciones falsas positivas (detecciones incorrectas). La precisión mide la fracción de todas las predicciones positivas que son realmente correctas. Una precisión de 0.95 significa que el 95 por ciento de los defectos que el modelo detecta son genuinos.

La exhaustividad (también llamada sensibilidad) responde: “De todos los defectos reales presentes, ¿cuántos encuentra el modelo?” La fórmula es exhaustividad = VP / (VP + FN), donde FN es el recuento de detecciones falsas negativas (defectos que el modelo pasó por alto). La exhaustividad mide la fracción de todos los defectos reales que el modelo detecta con éxito. Una exhaustividad de 0.90 significa que el modelo captura el 90 por ciento de los defectos reales en la escena.

La puntuación F1 es la media armónica de la precisión y la exhaustividad: F1 = 2 * (Precisión * Exhaustividad) / (Precisión + Exhaustividad). Este número único varía de 0 a 1, siendo 1 la detección perfecta. La F1 proporciona una métrica equilibrada cuando tanto los falsos positivos como los falsos negativos son costosos. Penaliza el desequilibrio extremo entre precisión y exhaustividad, por lo que un modelo no puede lograr una F1 alta sacrificando una métrica en favor de la otra.

La Matriz de Confusión y las Métricas Derivadas

Las tres métricas se derivan de una tabla simple de dos por dos llamada matriz de confusión:

PredicciónRealmente DefectoRealmente OK
El modelo dice “Defecto”VP (Verdadero Positivo)FP (Falso Positivo)
El modelo dice “OK”FN (Falso Negativo)VN (Verdadero Negativo)

A partir de esta matriz, la precisión y la exhaustividad se derivan directamente:

MétricaFórmulaQué significaCosto de equivocarse
PrecisiónVP / (VP + FP)Fracción de detecciones que son correctasLas falsas alarmas desperdician el tiempo del inspector
ExhaustividadVP / (VP + FN)Fracción de defectos reales que se encuentranLos defectos pasados por alto ponen en peligro la seguridad
Puntuación F12 * P * E / (P + E)Media armónica equilibrada de ambasPenaliza los equilibrios extremos

Un modelo con alta precisión pero baja exhaustividad captura solo los defectos obvios y rara vez genera falsas alarmas. Un modelo con alta exhaustividad pero baja precisión detecta casi todos los defectos, pero señala muchos no defectos, ahogando a los inspectores en trabajo de verificación manual. El modelo ideal logra ambos, pero en la práctica, el umbral (el límite de decisión que separa las predicciones positivas de las negativas) debe ajustarse para equilibrar estas demandas contrapuestas.

El Equilibrio entre Precisión y Exhaustividad en la Inspección Crítica para la Seguridad

En la inspección de pavimentos e iluminación de aeropuertos, la elección entre precisión y exhaustividad tiene consecuencias reales para la seguridad. Considere dos escenarios:

Escenario 1: Detección de Objetos Extraños en Pistas (FOD)

Un FOD en una pista activa es un peligro crítico. Un avión que golpee escombros puede sufrir daños catastróficos. En este contexto, un defecto pasado por alto (falso negativo) plantea un riesgo grave, por lo que la exhaustividad es primordial. Un inspector podría tolerar falsas alarmas, dedicando tiempo adicional a verificar que ciertos objetos detectados son realmente material extraño, porque el costo de pasar por alto un FOD real es inaceptable. Una exhaustividad de 0.98 es preferible a una exhaustividad de 0.80, incluso si la precisión cae de 0.95 a 0.85 en el proceso. Los falsos positivos marginales son una pequeña carga operativa en comparación con un peligro de seguridad pasado por alto.

Escenario 2: Registro Rutinario de Daños en el Pavimento

Para la inspección rutinaria de daños en la superficie del pavimento (grietas, ahuellamiento, descascarillado), el modo de fallo cambia. Los falsos positivos significan que el informe de inspección contiene entradas que los equipos de mantenimiento deben investigar y finalmente descartar como no problemas. Un sistema que señala 1,000 anomalías superficiales cuando solo 500 son defectos reales obliga a un costoso triaje manual. Aquí, la precisión se vuelve más importante en relación con la exhaustividad. Una precisión de 0.90 (el 90 por ciento de los daños señalados es genuino) es más valiosa que una exhaustividad de 0.99 con una precisión de 0.50.

Este equilibrio no es simétrico entre dominios dentro del mismo aeropuerto. La inspección de iluminación (calibración PAPI, estado de las luces de aproximación, uniformidad de intensidad) puede exigir puntos de operación de precisión-exhaustividad diferentes a los de la exploración de la superficie del pavimento o la evaluación de la franqueza de obstáculos.

Aplicaciones en la Inspección de Pavimentos e Infraestructuras

En la práctica, los modelos de visión por computadora para la inspección de aeropuertos generan puntuaciones de confianza de detección, no predicciones binarias. Un modelo podría señalar una posible grieta con una confianza de 0.72, otra con 0.55 y otra con 0.92. El umbral de decisión (por ejemplo, “señalar detecciones con confianza superior a 0.7”) controla directamente el equilibrio entre precisión y exhaustividad.

Reducir el umbral de 0.7 a 0.5 detecta más defectos (mayor exhaustividad) porque ahora se incluyen las detecciones marginales. Sin embargo, también señala más falsos positivos (menor precisión) porque los no defectos límite ahora cruzan el umbral. Elevar el umbral a 0.9 hace lo contrario: menos detecciones en general, pero aquellas que pasan tienen más probabilidades de ser correctas.

Al evaluar un nuevo modelo de detección de defectos, los profesionales a menudo calculan la precisión-exhaustividad en todos los umbrales posibles y visualizan el resultado como una curva de precisión-exhaustividad. El área bajo esta curva (AUC-PR) es una métrica resumida. Un modelo que logra tanto una alta precisión como una alta exhaustividad en la mayoría de los umbrales obtiene una puntuación más alta que uno que se ve obligado a elegir entre ellas.

Cuándo Priorizar la Precisión frente a la Exhaustividad

El contexto operativo determina el equilibrio óptimo:

  • Priorizar la Exhaustividad (Alta Sensibilidad) cuando el costo de un defecto pasado por alto es grave: detección de FOD, daños estructurales críticos o fallos de iluminación que afectan la navegación de aproximación. Un sistema automatizado con una exhaustividad de 0.95 y una precisión de 0.70 es aceptable porque los defectos pasados por alto son inaceptables.

  • Priorizar la Precisión (Baja Tasa de Falsos Positivos) cuando las falsas alarmas son costosas: monitoreo rutinario de daños que requiere verificación manual, o cuando el sistema de inspección alimenta una cola de triaje donde los falsos positivos consumen tiempo de expertos escaso.

  • Equilibrar con la F1 (Precisión y Exhaustividad Medias) cuando tanto los falsos positivos como los falsos negativos conllevan un costo significativo, y no tiene una razón sólida para ponderar uno sobre el otro. La puntuación F1 asegura que el modelo no sobresalga en una métrica mientras se desploma en la otra.

Muchos flujos de trabajo de inspección de aeropuertos operan en un proceso de dos etapas: un sistema de IA automatizado con alta exhaustividad (capturando casi todos los candidatos) alimenta un paso de revisión humana que filtra los falsos positivos. El sistema general logra los beneficios de seguridad de la alta exhaustividad sin la carga operativa de las falsas alarmas excesivas. La precisión de la IA puede ser moderada, el experto humano proporciona la verificación final.

Comparación y Resumen

La siguiente tabla contrasta cómo responden estas métricas al comportamiento del modelo:

EscenarioPrecisiónExhaustividadF1Mejor Caso de Uso
Detecta todo, muchas falsas alarmasBajaAltaMediaEscenarios de alto riesgo donde pasar por alto defectos es inaceptable
Detecta solo ciertos defectos, pocas falsas alarmasAltaBajaBajaTriaje de baja urgencia donde las falsas alarmas pierden tiempo
Equilibrado, moderado en ambosMediaMediaAltaEvaluación de propósito general sin asimetría de costos extrema

Conclusión

La precisión, la exhaustividad y la puntuación F1 no son medidas absolutas de la calidad del modelo, son herramientas para comprender el comportamiento del modelo y tomar decisiones informadas sobre su implementación. En la inspección de iluminación y pavimentos de aeropuertos, la precisión y la exhaustividad conllevan diferentes costos en el mundo real. Un sistema de alta exhaustividad y precisión moderada puede ser la opción correcta para la detección de defectos críticos para la seguridad, especialmente en la primera etapa de un flujo de trabajo de inspección de dos etapas. Por el contrario, un sistema de alta precisión puede ser adecuado para informes rutinarios donde la revisión humana es abundante. La puntuación F1 proporciona un resumen equilibrado cuando ningún costo único domina. Comprender estas métricas y la matriz de confusión en la que se basan es esencial para construir y evaluar sistemas de IA que mejoren la seguridad y la eficiencia operativa del aeropuerto.

Preguntas Frecuentes

¿Cuál es la diferencia entre precisión y exhaustividad?
La precisión mide la fracción de detecciones que son verdaderamente correctas (VP/(VP+FP)), lo que refleja la tasa de falsas alarmas. La exhaustividad mide la fracción de todos los defectos reales que se encuentran (VP/(VP+FN)), lo que refleja la tasa de omisiones. Un modelo de alta precisión genera pocas falsas alarmas pero puede pasar por alto defectos, mientras que un modelo de alta exhaustividad detecta la mayoría de los defectos pero produce más falsos positivos.
¿Cuándo debería priorizar la exhaustividad sobre la precisión en la detección de defectos?
En aplicaciones críticas para la seguridad, como la detección de objetos extraños en pistas (FOD) o daños críticos en el pavimento que podrían poner en peligro las aeronaves, la exhaustividad suele ser más importante. Pasar por alto un defecto (falso negativo) tiene graves consecuencias para la seguridad, por lo que es preferible detectar la mayoría de los defectos incluso con algunas falsas alarmas.
¿Por qué no maximizar simplemente la exhaustividad para detectar todos los defectos posibles?
Maximizar la exhaustividad crea un exceso de falsos positivos, lo que en un flujo de trabajo de inspección automatizado obliga a revisar manualmente numerosos elementos que no son problemas, consumiendo tiempo y recursos. Esto disminuye la eficiencia operativa y puede crear fatiga de alertas, lo que hace que los inspectores pasen por alto problemas reales entre el ruido.
¿Qué mide la puntuación F1?
La puntuación F1 es la media armónica de la precisión y la exhaustividad, calculada como 2 * (Precisión * Exhaustividad) / (Precisión + Exhaustividad). Proporciona una métrica única que equilibra tanto la precisión como la exhaustividad, útil cuando se necesita que tanto los falsos positivos como los falsos negativos sean bajos.
¿Cómo se relacionan la precisión, la exhaustividad y la F1 con la matriz de confusión?
Las tres métricas se derivan de las cuatro celdas de una matriz de confusión: verdaderos positivos (VP), verdaderos negativos (VN), falsos positivos (FP) y falsos negativos (FN). La precisión utiliza VP y FP, la exhaustividad utiliza VP y FN, la F1 es su media armónica combinada.
¿Puede un modelo tener alta precisión y alta exhaustividad simultáneamente?
Idealmente sí, pero en la práctica a menudo existe un equilibrio. Un modelo con un umbral de decisión más estricto logra una alta precisión pero una menor exhaustividad (menos falsas alarmas pero más omisiones), mientras que un umbral más bajo aumenta la exhaustividad pero disminuye la precisión (detecta más defectos pero más falsas alarmas). El punto de operación óptimo depende de la tolerancia de la aplicación a estos errores.
Comience ¿Necesita verificar su iluminación de aeródromo o pavimento? TarmacView inspecciona PAPI, iluminación de pista y aproximación, pavimento y superficies de obstáculos mediante drones, entre movimientos de aeronaves, y entrega un informe de cumplimiento diseñado para su regulador.
Seguir leyendo

Más información

03 PÁGINAS
Precisión y Exactitud de la Determinación de Posición en Topografía
glossary

Precisión y Exactitud de la Determinación de Posición en Topografía

Comprenda los conceptos clave de precisión y exactitud de ubicación en topografía, incluyendo exactitud absoluta y relativa, niveles de confianza y estándares relevantes como NSSDA y FGDC. Esencial para aviación, construcción, SIG y levantamientos legales de terrenos.

Detección de Objetos para Defectos y Elementos de Infraestructura
glossary

Detección de Objetos para Defectos y Elementos de Infraestructura

La detección de objetos localiza y clasifica objetos en imágenes mediante cajas delimitadoras, para la inspección de infraestructura, esto incluye baches, parches, señales, FOD y defectos grandes. YOLO, Faster R-CNN y DETR son las arquitecturas líderes. Cubre métodos de detección de objetos, entrenamiento con anotaciones de cajas delimitadoras (formatos VOC, COCO), métricas de evaluación (mAP) y…

Precisión de Navegación
glossary

Precisión de Navegación

La precisión de navegación mide cuán cerca está la posición estimada por un sistema de navegación respecto a la posición real. Es crucial para la navegación aérea, marítima, terrestre y espacial, con estándares establecidos por organismos como OACI e IMO. Factores como la geometría satelital, la calidad de la señal y la tecnología del receptor influyen en la precisión.