Aviation-Glossar

Was sind Präzision, Recall und F1-Score?

Definition
Präzision, Recall und F1-Score sind Leistungsmetriken zur Bewertung von Klassifikations- und Objekterkennungsmodellen in der KI-gestützten Infrastrukturinspektion. Die Präzision ist das Verhältnis von richtig-positiven Erkennungen zu allen positiven Erkennungen (TP / (TP + FP)) und misst, wie oft das Modell korrekt ist, wenn es einen Defekt markiert. Der Recall (auch Sensitivität genannt) ist das Verhältnis von richtig-positiven zu allen tatsächlichen Defekten (TP / (TP + FN)) und misst, wie viele echte Defekte das Modell findet. Ein Modell mit hoher Präzision erzeugt wenige Fehlalarme, kann aber Defekte übersehen, ein Modell mit hohem Recall findet die meisten Defekte, kann aber falsch-positive Ergebnisse liefern. Der F1-Score ist das harmonische Mittel von Präzision und Recall (2 × Präzision × Recall / (Präzision + Recall)) und bietet eine einzelne Metrik, die beide ausgleicht. Bei der Fahrbahnschadenserkennung hängt der angemessene Kompromiss zwischen Präzision und Recall von der Anwendung ab: Sicherheitskritische Defekterkennung (z. B. FOD auf Start- und Landebahnen) priorisiert typischerweise den Recall, während automatisierte Berichtssysteme die Präzision bevorzugen können, um den manuellen Prüfaufwand zu reduzieren.

Präzision, Recall und F1-Score – Metriken zur Klassifikation im maschinellen Lernen: Ausführlicher Leitfaden

Definition von Präzision, Recall und F1-Score

Präzision, Recall und F1-Score sind grundlegende Leistungsmetriken zur Bewertung von Klassifikations- und Objekterkennungsmodellen. Sie werden aus einer Konfusionsmatrix berechnet, einer Tabelle, die vorhergesagte Labels mit der Ground Truth vergleicht. Diese drei Metriken erzählen unterschiedliche Geschichten über die Modellleistung, und die Wahl zwischen ihnen hängt von den Kosten der verschiedenen Fehlerarten in Ihrer Anwendung ab.

Präzision beantwortet die Frage: “Wenn das Modell einen Defekt markiert, wie oft ist das korrekt?” Mathematisch gilt: Präzision = TP / (TP + FP), wobei TP die Anzahl der richtig-positiven Erkennungen (korrekte Erkennungen) und FP die Anzahl der falsch-positiven Erkennungen (inkorrekte Erkennungen) ist. Die Präzision misst den Anteil aller positiven Vorhersagen, die tatsächlich korrekt sind. Eine Präzision von 0,95 bedeutet, dass 95 Prozent der vom Modell erkannten Defekte echt sind.

Recall (auch Sensitivität genannt) beantwortet die Frage: “Von allen tatsächlich vorhandenen Defekten, wie viele findet das Modell?” Die Formel lautet: Recall = TP / (TP + FN), wobei FN die Anzahl der falsch-negativen Erkennungen (vom Modell übersehene Defekte) ist. Der Recall misst den Anteil aller tatsächlichen Defekte, die das Modell erfolgreich erkennt. Ein Recall von 0,90 bedeutet, dass das Modell 90 Prozent der echten Defekte in der Szene erfasst.

F1-Score ist das harmonische Mittel von Präzision und Recall: F1 = 2 * (Präzision * Recall) / (Präzision + Recall). Diese einzelne Zahl reicht von 0 bis 1, wobei 1 für eine perfekte Erkennung steht. Der F1-Score bietet eine ausgewogene Metrik, wenn sowohl falsch-positive als auch falsch-negative Ergebnisse kostspielig sind. Er bestraft extreme Ungleichgewichte zwischen Präzision und Recall, sodass ein Modell keinen hohen F1-Score erreichen kann, indem es eine Metrik zugunsten der anderen opfert.

Die Konfusionsmatrix und abgeleitete Metriken

Alle drei Metriken leiten sich aus einer einfachen Zwei-mal-Zwei-Tabelle ab, der Konfusionsmatrix:

VorhersageTatsächlich DefektTatsächlich OK
Modell sagt “Defekt”TP (Richtig-positiv)FP (Falsch-positiv)
Modell sagt “OK”FN (Falsch-negativ)TN (Richtig-negativ)

Aus dieser Matrix ergeben sich Präzision und Recall direkt:

MetrikFormelBedeutungKosten bei Fehler
PräzisionTP / (TP + FP)Anteil der Erkennungen, die korrekt sindFehlalarme verschwenden Inspektionszeit
RecallTP / (TP + FN)Anteil der tatsächlichen Defekte, die gefunden werdenÜbersehene Defekte gefährden die Sicherheit
F1-Score2 * P * R / (P + R)Ausgewogenes harmonisches Mittel beiderBestraft extreme Kompromisse

Ein Modell mit hoher Präzision, aber niedrigem Recall erfasst nur offensichtliche Defekte und löst selten Fehlalarme aus. Ein Modell mit hohem Recall, aber niedriger Präzision erfasst fast jeden Defekt, markiert aber viele Nicht-Defekte und überfordert die Inspektoren mit manuellen Überprüfungen. Das ideale Modell erreicht beides, aber in der Praxis muss der Schwellenwert (die Entscheidungsgrenze, die positive von negativen Vorhersagen trennt) angepasst werden, um diese konkurrierenden Anforderungen auszugleichen.

Der Präzisions-Recall-Kompromiss bei sicherheitskritischen Inspektionen

Bei der Inspektion von Flughafenfahrbahnen und -befeuerung hat die Wahl zwischen Präzision und Recall reale Sicherheitsfolgen. Betrachten Sie zwei Szenarien:

Szenario 1: Erkennung von Fremdkörpern (FOD) auf Start- und Landebahnen

Ein Fremdkörper auf einer aktiven Start- und Landebahn ist eine kritische Gefahr. Ein Flugzeug, das auf Trümmer trifft, kann katastrophale Schäden erleiden. In diesem Zusammenhang stellt ein übersehener Defekt (falsch-negativ) ein schwerwiegendes Risiko dar, daher ist der Recall von größter Bedeutung. Ein Inspektor könnte Fehlalarme in Kauf nehmen und zusätzliche Zeit für die Überprüfung aufwenden, ob bestimmte erkannte Objekte tatsächlich Fremdmaterial sind, da die Kosten für das Übersehen eines echten FOD inakzeptabel sind. Ein Recall von 0,98 ist einem Recall von 0,80 vorzuziehen, selbst wenn die Präzision dabei von 0,95 auf 0,85 sinkt. Die zusätzlichen Fehlalarme sind eine geringe betriebliche Belastung im Vergleich zu einer übersehenen Sicherheitsgefahr.

Szenario 2: Routinemäßige Erfassung von Fahrbahnschäden

Bei der routinemäßigen Inspektion von Fahrbahnoberflächenschäden (Risse, Spurrinnen, Abplatzungen) ändert sich die Fehlerart. Falsch-positive Ergebnisse bedeuten, dass der Inspektionsbericht Einträge enthält, die von Wartungsteams untersucht und letztendlich als nicht relevant eingestuft werden müssen. Ein System, das 1.000 Oberflächenanomalien markiert, von denen nur 500 echte Defekte sind, erzwingt eine teure manuelle Nachbearbeitung. Hier wird die Präzision im Verhältnis zum Recall wichtiger. Eine Präzision von 0,90 (90 Prozent der markierten Schäden sind echt) ist wertvoller als ein Recall von 0,99 mit einer Präzision von 0,50.

Dieser Kompromiss ist nicht symmetrisch über die verschiedenen Bereiche desselben Flughafens. Die Befeuerungsinspektion (PAPI-Kalibrierung, Status der Anflugbefeuerung, Gleichmäßigkeit der Lichtstärke) kann andere Präzisions-Recall-Betriebspunkte erfordern als die Fahrbahnoberflächenabtastung oder die Bewertung von Hindernisfreiheit.

Anwendungen in der Fahrbahn- und Infrastrukturinspektion

In der Praxis geben Computersehen-Modelle für die Flughafeninspektion Erkennungskonfidenzwerte aus, keine binären Vorhersagen. Ein Modell könnte einen potenziellen Riss mit einer Konfidenz von 0,72 markieren, einen anderen mit 0,55 und einen weiteren mit 0,92. Der Entscheidungsschwellenwert (z. B. “Erkennungen mit einer Konfidenz über 0,7 markieren”) steuert direkt den Präzisions-Recall-Kompromiss.

Die Senkung des Schwellenwerts von 0,7 auf 0,5 erfasst mehr Defekte (höherer Recall), da nun auch grenzwertige Erkennungen einbezogen werden. Es werden jedoch auch mehr falsch-positive Ergebnisse markiert (niedrigere Präzision), da grenzwertige Nicht-Defekte nun den Schwellenwert überschreiten. Die Erhöhung des Schwellenwerts auf 0,9 bewirkt das Gegenteil: insgesamt weniger Erkennungen, aber diejenigen, die den Schwellenwert passieren, sind mit größerer Wahrscheinlichkeit korrekt.

Bei der Bewertung eines neuen Defekterkennungsmodells berechnen Praktiker häufig die Präzision und den Recall über alle möglichen Schwellenwerte hinweg und visualisieren das Ergebnis als Präzisions-Recall-Kurve. Die Fläche unter dieser Kurve (AUC-PR) ist eine zusammenfassende Metrik. Ein Modell, das bei den meisten Schwellenwerten sowohl eine hohe Präzision als auch einen hohen Recall erreicht, erzielt eine höhere Punktzahl als eines, das gezwungen ist, sich zwischen ihnen zu entscheiden.

Wann Präzision vs. Recall priorisiert werden sollte

Der betriebliche Kontext bestimmt das optimale Gleichgewicht:

  • Recall priorisieren (Hohe Sensitivität) wenn die Kosten eines übersehenen Defekts schwerwiegend sind: FOD-Erkennung, kritische strukturelle Schäden oder Befeuerungsausfälle, die die Anflugnavigation beeinträchtigen. Ein automatisiertes System mit einem Recall von 0,95 und einer Präzision von 0,70 ist akzeptabel, da übersehene Defekte inakzeptabel sind.

  • Präzision priorisieren (Niedrige Falsch-Positiv-Rate) wenn Fehlalarme teuer sind: routinemäßige Schadensüberwachung, die eine manuelle Überprüfung erfordert, oder wenn das Inspektionssystem in eine Nachbearbeitungswarteschlange einspeist, in der falsch-positive Ergebnisse knappe Expertenzeit verbrauchen.

  • Mit F1 ausgleichen (Mittlere Präzision und Recall) wenn sowohl falsch-positive als auch falsch-negative Ergebnisse erhebliche Kosten verursachen und Sie keinen starken Grund haben, eine Metrik gegenüber der anderen zu gewichten. Der F1-Score stellt sicher, dass das Modell nicht bei einer Metrik hervorragend abschneidet, während es bei der anderen zusammenbricht.

Viele Flughafeninspektionsworkflows arbeiten in einem zweistufigen Prozess: Ein automatisiertes KI-System mit hohem Recall (erfasst fast alle Kandidaten) speist einen manuellen Überprüfungsschritt, der falsch-positive Ergebnisse herausfiltert. Das Gesamtsystem erreicht die Sicherheitsvorteile eines hohen Recalls ohne die betriebliche Belastung durch übermäßige Fehlalarme. Die Präzision der KI kann moderat sein, der menschliche Experte führt die endgültige Überprüfung durch.

Vergleich und Zusammenfassung

Die folgende Tabelle zeigt, wie diese Metriken auf das Modellverhalten reagieren:

SzenarioPräzisionRecallF1Bester Anwendungsfall
Erkennt alles, viele FehlalarmeNiedrigHochMittelHochrisikoszenarien, in denen das Übersehen von Defekten inakzeptabel ist
Erkennt nur bestimmte Defekte, wenige FehlalarmeHochNiedrigNiedrigNachbearbeitung mit geringer Dringlichkeit, bei der Fehlalarme Zeit verschwenden
Ausgewogen, moderat in beidenMittelMittelHochAllgemeine Bewertung ohne extreme Kostenasymmetrie

Fazit

Präzision, Recall und F1-Score sind keine absoluten Maße für die Modellqualität, sie sind Werkzeuge zum Verständnis des Modellverhaltens und zum Treffen fundierter Entscheidungen über den Einsatz. Bei der Inspektion von Flughafenbefeuerung und -fahrbahnen haben Präzision und Recall unterschiedliche reale Kosten. Ein System mit hohem Recall und moderater Präzision kann die richtige Wahl für die sicherheitskritische Defekterkennung sein, insbesondere in der ersten Stufe eines zweistufigen Inspektionsworkflows. Umgekehrt kann ein System mit hoher Präzision für die routinemäßige Berichterstattung geeignet sein, bei der eine manuelle Überprüfung reichlich vorhanden ist. Der F1-Score bietet eine ausgewogene Zusammenfassung, wenn keine einzelne Kostenart dominiert. Das Verständnis dieser Metriken und der Konfusionsmatrix, auf der sie basieren, ist für die Entwicklung und Bewertung von KI-Systemen, die die Flughafensicherheit und Betriebseffizienz verbessern, unerlässlich.

Häufig gestellte Fragen

Bewerten Sie die Leistung der KI-Inspektion

Die KI-Modelle von TarmacView werden mithilfe von Präzisions-, Recall- und F1-Metriken für verschiedene Fahrbahnschadensklassen streng evaluiert, um eine zuverlässige Erkennungsleistung sicherzustellen.