← SŁOWNIK LOTNICZY
0-9 A B C D E F G H I J K L M N O P R S T U V W Z
Słownik lotniczy

Czym są Precyzja, Czułość i Wynik F1?

AI · Uczenie Maszynowe · Wizja Komputerowa · Wykrywanie Uszkodzeń · Inspekcja Infrastruktury 8 języki
Definicja
Precyzja, czułość i wynik F1 to metryki wydajności używane do oceny modeli klasyfikacji i detekcji obiektów w inspekcji infrastruktury opartej na AI. Precyzja to stosunek prawdziwie pozytywnych detekcji do wszystkich pozytywnych detekcji (TP / (TP + FP)), mierzący jak często model ma rację, gdy oznacza uszkodzenie. Czułość (zwana również czułością) to stosunek prawdziwie pozytywnych do wszystkich rzeczywistych uszkodzeń (TP / (TP + FN)), mierzący ile rzeczywistych uszkodzeń model znajduje. Model o wysokiej precyzji generuje mało fałszywych alarmów, ale może pomijać uszkodzenia, model o wysokiej czułości znajduje większość uszkodzeń, ale może generować fałszywie pozytywne wyniki. Wynik F1 to średnia harmoniczna precyzji i czułości (2 × Precyzja × Czułość / (Precyzja + Czułość)), zapewniająca pojedynczą metrykę równoważącą obie. W wykrywaniu uszkodzeń nawierzchni odpowiedni kompromis między precyzją a czułością zależy od zastosowania: wykrywanie uszkodzeń krytycznych dla bezpieczeństwa (np. FOD na pasach startowych) zazwyczaj priorytetowo traktuje czułość, podczas gdy zautomatyzowane systemy raportowania mogą faworyzować precyzję, aby zmniejszyć obciążenie związane z ręcznym przeglądem.

Precyzja, Czułość i Wynik F1 – Metryki Klasyfikacji Uczenia Maszynowego (Uczenie Maszynowe): Szczegółowy Przewodnik

Definicja Precyzji, Czułości i Wyniku F1

Precyzja, czułość i wynik F1 to podstawowe metryki wydajności do oceny modeli klasyfikacji i detekcji obiektów. Są one obliczane na podstawie macierzy pomyłek, tabeli porównującej przewidywane etykiety z rzeczywistymi danymi. Te trzy metryki opowiadają różne historie o wydajności modelu, a wybór między nimi zależy od kosztu różnych typów błędów w twoim zastosowaniu.

Precyzja odpowiada na pytanie: „Gdy model oznacza uszkodzenie, jak często ma rację?” Matematycznie: precyzja = TP / (TP + FP), gdzie TP to liczba prawdziwie pozytywnych detekcji (prawidłowe detekcje), a FP to liczba fałszywie pozytywnych detekcji (nieprawidłowe detekcje). Precyzja mierzy odsetek wszystkich pozytywnych przewidywań, które są faktycznie prawidłowe. Precyzja 0,95 oznacza, że 95 procent uszkodzeń wykrytych przez model jest prawdziwych.

Czułość (zwana również czułością) odpowiada na pytanie: „Ze wszystkich rzeczywistych uszkodzeń, ile model znajduje?” Wzór to: czułość = TP / (TP + FN), gdzie FN to liczba fałszywie negatywnych detekcji (uszkodzenia pominięte przez model). Czułość mierzy odsetek wszystkich rzeczywistych uszkodzeń, które model pomyślnie wykrywa. Czułość 0,90 oznacza, że model znajduje 90 procent rzeczywistych uszkodzeń w scenie.

Wynik F1 to średnia harmoniczna precyzji i czułości: F1 = 2 * (Precyzja * Czułość) / (Precyzja + Czułość). Ta pojedyncza liczba mieści się w zakresie od 0 do 1, gdzie 1 oznacza doskonałe wykrywanie. F1 zapewnia zrównoważoną metrykę, gdy zarówno fałszywie pozytywne, jak i fałszywie negatywne wyniki są kosztowne. Karze on skrajną nierównowagę między precyzją a czułością, więc model nie może osiągnąć wysokiego F1, poświęcając jedną metrykę na rzecz drugiej.

Macierz Pomyłek i Metryki Pochodne

Wszystkie trzy metryki pochodzą z prostej tabeli dwa na dwa zwanej macierzą pomyłek:

PrzewidywanieFaktycznie UszkodzenieFaktycznie OK
Model mówi „Uszkodzenie”TP (Prawdziwie Pozytywny)FP (Fałszywie Pozytywny)
Model mówi „OK”FN (Fałszywie Negatywny)TN (Prawdziwie Negatywny)

Z tej macierzy precyzja i czułość wynikają bezpośrednio:

MetrykaWzórCo oznaczaKoszt błędu
PrecyzjaTP / (TP + FP)Odsetek detekcji, które są prawidłoweFałszywe alarmy marnują czas inspektora
CzułośćTP / (TP + FN)Odsetek rzeczywistych uszkodzeń, które zostały znalezionePominięte uszkodzenia zagrażają bezpieczeństwu
Wynik F12 * P * C / (P + C)Zrównoważona średnia harmoniczna obuKarze skrajne kompromisy

Model o wysokiej precyzji, ale niskiej czułości znajduje tylko oczywiste uszkodzenia i rzadko generuje fałszywe alarmy. Model o wysokiej czułości, ale niskiej precyzji znajduje prawie każde uszkodzenie, ale oznacza wiele nieuszkodzeń, zalewając inspektorów ręczną weryfikacją. Idealny model osiąga obie, ale w praktyce próg (granica decyzyjna oddzielająca przewidywania pozytywne od negatywnych) musi być dostrojony, aby zrównoważyć te konkurencyjne wymagania.

Kompromis Precyzja-Czułość w Inspekcji Krytycznej dla Bezpieczeństwa

W inspekcji nawierzchni i oświetlenia lotnisk wybór między precyzją a czułością ma realne konsekwencje dla bezpieczeństwa. Rozważ dwa scenariusze:

Scenariusz 1: Wykrywanie Ciał Obcych na Pasie Startowym (FOD)

Ciało obce na aktywnym pasie startowym to krytyczne zagrożenie. Uderzenie statku powietrznego w odłamki może spowodować katastrofalne uszkodzenia. W tym kontekście pominięcie uszkodzenia (fałszywie negatywny) stanowi poważne ryzyko, więc czułość jest najważniejsza. Inspektor może tolerować fałszywe alarmy, poświęcając dodatkowy czas na weryfikację, czy pewne wykryte obiekty są rzeczywiście obcym materiałem, ponieważ koszt pominięcia rzeczywistego FOD jest niedopuszczalny. Czułość 0,98 jest preferowana nad czułością 0,80, nawet jeśli precyzja spada z 0,95 do 0,85 w tym procesie. Marginalne fałszywie pozytywne wyniki to małe obciążenie operacyjne w porównaniu z pominiętym zagrożeniem bezpieczeństwa.

Scenariusz 2: Rutynowe Rejestrowanie Uszkodzeń Nawierzchni

W przypadku rutynowej inspekcji uszkodzeń powierzchni nawierzchni (pęknięcia, koleiny, złuszczenia) tryb awarii się zmienia. Fałszywie pozytywne wyniki oznaczają, że raport z inspekcji zawiera wpisy, które zespoły utrzymania muszą zbadać i ostatecznie odrzucić jako nieistotne. System, który oznacza 1000 anomalii powierzchniowych, podczas gdy tylko 500 to rzeczywiste uszkodzenia, wymusza kosztowną ręczną segregację. Tutaj precyzja staje się ważniejsza w stosunku do czułości. Precyzja 0,90 (90 procent oznaczonych uszkodzeń jest prawdziwych) jest bardziej wartościowa niż czułość 0,99 z precyzją 0,50.

Ten kompromis nie jest symetryczny w różnych domenach na tym samym lotnisku. Inspekcja oświetlenia (kalibracja PAPI, stan świateł podejścia, jednorodność natężenia) może wymagać innych punktów pracy precyzji i czułości niż skanowanie powierzchni nawierzchni lub ocena przeszkód.

Zastosowania w Inspekcji Nawierzchni i Infrastruktury

W praktyce modele wizji komputerowej do inspekcji lotnisk generują wyniki pewności detekcji, a nie binarne przewidywania. Model może oznaczyć potencjalne pęknięcie z pewnością 0,72, inne z 0,55, a jeszcze inne z 0,92. Próg decyzyjny (np. „oznacz detekcje z pewnością powyżej 0,7”) bezpośrednio kontroluje kompromis precyzja-czułość.

Obniżenie progu z 0,7 do 0,5 znajduje więcej uszkodzeń (wyższa czułość), ponieważ marginalne detekcje są teraz uwzględniane. Jednak oznacza to również więcej fałszywie pozytywnych wyników (niższa precyzja), ponieważ graniczne nieuszkodzenia teraz przekraczają próg. Podniesienie progu do 0,9 robi odwrotnie: mniej detekcji ogólnie, ale te, które przechodzą, są bardziej prawdopodobne, że są prawidłowe.

Podczas oceny nowego modelu wykrywania uszkodzeń praktycy często obliczają precyzję i czułość dla wszystkich możliwych progów i wizualizują wynik jako krzywą precyzja-czułość. Pole pod tą krzywą (AUC-PR) jest metryką podsumowującą. Model, który osiąga zarówno wysoką precyzję, jak i wysoką czułość przy większości progów, uzyskuje wyższy wynik niż ten zmuszony do wyboru między nimi.

Kiedy Priorytetowo Traktować Precyzję vs. Czułość

Kontekst operacyjny określa optymalną równowagę:

  • Priorytet dla Czułości (Wysoka Czułość) gdy koszt pominięcia uszkodzenia jest poważny: wykrywanie FOD, krytyczne uszkodzenia strukturalne lub awarie oświetlenia wpływające na nawigację podejścia. Zautomatyzowany system z czułością 0,95 i precyzją 0,70 jest akceptowalny, ponieważ pominięte uszkodzenia są niedopuszczalne.

  • Priorytet dla Precyzji (Niski Wskaźnik Fałszywie Pozytywnych) gdy fałszywe alarmy są kosztowne: rutynowe monitorowanie uszkodzeń wymagające ręcznej weryfikacji, lub gdy system inspekcji zasila kolejkę segregacji, w której fałszywie pozytywne wyniki pochłaniają ograniczony czas ekspertów.

  • Równowaga z F1 (Średnia Precyzja i Czułość) gdy zarówno fałszywie pozytywne, jak i fałszywie negatywne wyniki niosą znaczący koszt, i nie ma silnego powodu, aby ważyć jeden nad drugim. Wynik F1 zapewnia, że model nie osiąga doskonałości w jednej metryce, załamując się na drugiej.

Wiele przepływów pracy inspekcji lotnisk działa w procesie dwuetapowym: zautomatyzowany system AI o wysokiej czułości (znajdujący prawie wszystkich kandydatów) zasila etap ręcznego przeglądu, który odfiltrowuje fałszywie pozytywne wyniki. Cały system osiąga korzyści bezpieczeństwa wynikające z wysokiej czułości bez obciążenia operacyjnego nadmiernymi fałszywymi alarmami. Precyzja AI może być umiarkowana. Ekspert-ludzki zapewnia ostateczną kontrolę.

Porównanie i Podsumowanie

Poniższa tabela porównuje, jak te metryki reagują na zachowanie modelu:

ScenariuszPrecyzjaCzułośćF1Najlepsze Zastosowanie
Wykrywa wszystko, wiele fałszywych alarmówNiskaWysokaŚredniScenariusze wysokiego ryzyka, gdzie pomijanie uszkodzeń jest niedopuszczalne
Wykrywa tylko pewne uszkodzenia, mało fałszywych alarmówWysokaNiskaNiskiSegregacja o niskiej pilności, gdzie fałszywe alarmy marnują czas
Zrównoważony, umiarkowany w obuŚredniaŚredniaWysokiOgólna ocena bez skrajnej asymetrii kosztów

Wnioski

Precyzja, czułość i wynik F1 nie są bezwzględnymi miarami jakości modelu. Są narzędziami do zrozumienia zachowania modelu i podejmowania świadomych decyzji dotyczących wdrożenia. W inspekcji oświetlenia i nawierzchni lotnisk precyzja i czułość niosą różne koszty w świecie rzeczywistym. System o wysokiej czułości i umiarkowanej precyzji może być właściwym wyborem do wykrywania uszkodzeń krytycznych dla bezpieczeństwa, zwłaszcza w pierwszym etapie dwuetapowego przepływu pracy inspekcji. Z drugiej strony, system o wysokiej precyzji może być odpowiedni do rutynowego raportowania, gdzie ręczny przegląd jest obfity. Wynik F1 zapewnia zrównoważone podsumowanie, gdy żaden pojedynczy koszt nie dominuje. Zrozumienie tych metryk i macierzy pomyłek, na której się opierają, jest niezbędne do budowania i oceny systemów AI, które zwiększają bezpieczeństwo i wydajność operacyjną lotnisk.

Często zadawane pytania

Jaka jest różnica między precyzją a czułością?
Precyzja mierzy odsetek detekcji, które są naprawdę prawidłowe (TP/(TP+FP)), odzwierciedlając wskaźnik fałszywych alarmów. Czułość mierzy odsetek wszystkich rzeczywistych uszkodzeń, które zostały znalezione (TP/(TP+FN)), odzwierciedlając wskaźnik pominięć. Model o wysokiej precyzji generuje mało fałszywych alarmów, ale może pomijać uszkodzenia, podczas gdy model o wysokiej czułości znajduje większość uszkodzeń, ale generuje więcej fałszywie pozytywnych wyników.
Kiedy powinienem priorytetowo traktować czułość nad precyzją w wykrywaniu uszkodzeń?
W zastosowaniach krytycznych dla bezpieczeństwa, takich jak wykrywanie ciał obcych na pasie startowym (FOD) lub krytycznych uszkodzeń nawierzchni, które mogą zagrozić statkom powietrznym, czułość jest zazwyczaj ważniejsza. Pominięcie uszkodzenia (fałszywie negatywny) ma poważne konsekwencje dla bezpieczeństwa, dlatego wykrycie większości uszkodzeń, nawet kosztem pewnej liczby fałszywych alarmów, jest preferowane.
Dlaczego nie zmaksymalizować po prostu czułości, aby wykryć każde możliwe uszkodzenie?
Maksymalizacja czułości tworzy nadmierną liczbę fałszywie pozytywnych wyników, co w zautomatyzowanym przepływie pracy inspekcji wymusza ręczny przegląd wielu nieistniejących problemów, pochłaniając czas i zasoby. Zmniejsza to wydajność operacyjną i może prowadzić do zmęczenia alertami, powodując, że inspektorzy przeoczą prawdziwe problemy wśród szumu.
Co mierzy wynik F1?
Wynik F1 to średnia harmoniczna precyzji i czułości, obliczana jako 2 * (Precyzja * Czułość) / (Precyzja + Czułość). Zapewnia pojedynczą metrykę równoważącą zarówno precyzję, jak i czułość, przydatną, gdy zarówno fałszywie pozytywne, jak i fałszywie negatywne wyniki muszą być niskie.
Jak precyzja, czułość i F1 odnoszą się do macierzy pomyłek?
Wszystkie trzy metryki pochodzą z czterech komórek macierzy pomyłek: prawdziwie pozytywne (TP), prawdziwie negatywne (TN), fałszywie pozytywne (FP) i fałszywie negatywne (FN). Precyzja wykorzystuje TP i FP. Czułość wykorzystuje TP i FN. F1 to ich połączona średnia harmoniczna.
Czy model może mieć jednocześnie wysoką precyzję i wysoką czułość?
Idealnie tak, ale w praktyce często występuje kompromis. Model z bardziej restrykcyjnym progiem decyzyjnym osiąga wysoką precyzję, ale niższą czułość (mniej fałszywych alarmów, ale więcej pominięć), podczas gdy niższy próg zwiększa czułość, ale zmniejsza precyzję (znajduje więcej uszkodzeń, ale więcej fałszywych alarmów). Najlepszy punkt pracy zależy od tolerancji aplikacji na te błędy.
Rozpocznij Potrzebujesz weryfikacji oświetlenia lotniska lub nawierzchni? TarmacView kontroluje PAPI, oświetlenie drogi startowej i podejścia, nawierzchnię oraz powierzchnie przeszkodowe za pomocą drona, pomiędzy ruchami statków powietrznych, i dostarcza raport zgodności przygotowany dla Twojego organu regulacyjnego.
Czytaj dalej

Dowiedz się więcej

03 STRONY
Dokładność pomiaru
glossary

Dokładność pomiaru

Dokładność pomiaru definiuje powtarzalność i spójność wyników pomiarów w określonych warunkach, co jest kluczowe dla zastosowań naukowych, przemysłowych i zapewniania jakości. To hasło wyjaśnia precyzję, dokładność, powtarzalność, precyzję pośrednią, odtwarzalność oraz powiązane pojęcia statystyczne.

Dokładność i precyzja
glossary

Dokładność i precyzja

Poznaj kluczowe pojęcia dotyczące dokładności, precyzji, powtarzalności i odtwarzalności w jakości pomiarów, niezbędne w lotnictwie, przemyśle i badaniach naukowych. Zrozum definicje, normy techniczne, zastosowania praktyczne oraz to, jak zapewniają one bezpieczeństwo, zgodność i kontrolę jakości.

Intersection Over Union (IoU)
glossary

Intersection Over Union (IoU)

Intersection Over Union (IoU), nazywany również indeksem Jaccarda, mierzy nakładanie się przewidywanej maski segmentacyjnej na maskę rzeczywistą: IoU = |A∩B| / |A∪B|. Jest to podstawowa metryka dokładności segmentacji pęknięć, gdzie IoU > 0,5 uznaje się za dobry wynik. Głowica segmentacji pęknięć DINOv3 TarmacView osiąga IoU testowe 0,519. Obejmuje obliczanie IoU, interpretację, związek ze…