Letecký slovník

Čo sú presnosť, recall a F1 skóre?

Definícia
Presnosť, recall a F1 skóre sú metriky výkonnosti používané na hodnotenie klasifikačných modelov a modelov detekcie objektov v AI inšpekcii infraštruktúry. Presnosť je pomer skutočne pozitívnych detekcií ku všetkým pozitívnym detekciám (TP / (TP + FP)), meria, ako často je model správny, keď označí defekt. Recall (tiež nazývaný senzitivita) je pomer skutočne pozitívnych detekcií ku všetkým skutočným defektom (TP / (TP + FN)), meria, koľko skutočných defektov model nájde. Model s vysokou presnosťou produkuje málo falošných poplachov, ale môže prehliadať defekty, model s vysokým recallom nájde väčšinu defektov, ale môže produkovať falošne pozitívne výsledky. F1 skóre je harmonický priemer presnosti a recallu (2 × Presnosť × Recall / (Presnosť + Recall)), poskytuje jedinú metriku, ktorá vyvažuje obe. Pri detekcii poškodení vozoviek závisí vhodný kompromis medzi presnosťou a recallom od aplikácie: detekcia defektov kritických pre bezpečnosť (napr. FOD na dráhach) zvyčajne uprednostňuje recall, zatiaľ čo automatizované reportovacie systémy môžu uprednostňovať presnosť na zníženie záťaže manuálneho preverovania.

Presnosť, Recall a F1 skóre – Metriky klasifikácie strojového učenia (Strojové učenie): Podrobný sprievodca

Definícia presnosti, recallu a F1 skóre

Presnosť, recall a F1 skóre sú základné metriky výkonnosti pre hodnotenie klasifikačných modelov a modelov detekcie objektov. Vypočítavajú sa z mätúcej matice, tabuľky, ktorá porovnáva predpovedané označenia so skutočnosťou. Tieto tri metriky rozprávajú rôzne príbehy o výkonnosti modelu a výber medzi nimi závisí od nákladov na rôzne typy chýb vo vašej aplikácii.

Presnosť odpovedá na otázku: “Keď model označí defekt, ako často je to správne?” Matematicky: presnosť = TP / (TP + FP), kde TP je počet skutočne pozitívnych detekcií (správne detekcie) a FP je počet falošne pozitívnych detekcií (nesprávne detekcie). Presnosť meria podiel všetkých pozitívnych predpovedí, ktoré sú skutočne správne. Presnosť 0,95 znamená, že 95 percent defektov, ktoré model detekuje, je skutočných.

Recall (tiež nazývaný senzitivita) odpovedá na otázku: “Zo všetkých skutočne prítomných defektov, koľko model nájde?” Vzorec je: recall = TP / (TP + FN), kde FN je počet falošne negatívnych detekcií (defekty, ktoré model prehliadol). Recall meria podiel všetkých skutočných defektov, ktoré model úspešne detekuje. Recall 0,90 znamená, že model zachytí 90 percent skutočných defektov v scéne.

F1 skóre je harmonický priemer presnosti a recallu: F1 = 2 * (Presnosť * Recall) / (Presnosť + Recall). Toto jediné číslo sa pohybuje od 0 do 1, pričom 1 znamená dokonalú detekciu. F1 poskytuje vyváženú metriku, keď sú náklady na falošne pozitívne aj falošne negatívne výsledky vysoké. Trestá extrémnu nerovnováhu medzi presnosťou a recallom, takže model nemôže dosiahnuť vysoké F1 obetovaním jednej metriky v prospech druhej.

Mätúca matica a odvodené metriky

Všetky tri metriky sú odvodené z jednoduchej dvojkrát dvoj tabuľky nazývanej mätúca matica:

PredpoveďSkutočne defektSkutočne v poriadku
Model hovorí “Defekt”TP (Skutočne pozitívny)FP (Falošne pozitívny)
Model hovorí “V poriadku”FN (Falošne negatívny)TN (Skutočne negatívny)

Z tejto matice priamo vyplývajú presnosť a recall:

MetrikaVzorecČo znamenáNáklady na chybu
PresnosťTP / (TP + FP)Podiel detekcií, ktoré sú správneFalošné poplachy plytvajú časom inšpektora
RecallTP / (TP + FN)Podiel skutočných defektov, ktoré boli nájdenéPrehliadnuté defekty ohrozujú bezpečnosť
F1 skóre2 * P * R / (P + R)Vyvážený harmonický priemer obochTrestá extrémne kompromisy

Model s vysokou presnosťou, ale nízkym recallom zachytáva iba zjavné defekty a zriedkavo vyvoláva falošné poplachy. Model s vysokým recallom, ale nízkou presnosťou zachytí takmer každý defekt, ale označí mnoho nedefektov, čím zaplaví inšpektorov manuálnym overovaním. Ideálny model dosahuje oboje, ale v praxi musí byť prah (rozhodovacia hranica oddeľujúca pozitívne od negatívnych predpovedí) vyladený tak, aby vyvážil tieto konkurenčné požiadavky.

Kompromis medzi presnosťou a recallom v bezpečnostne kritickej inšpekcii

Pri inšpekcii letiskových vozoviek a osvetlenia má výber medzi presnosťou a recallom skutočné bezpečnostné dôsledky. Zvážte dva scenáre:

Scenár 1: Detekcia cudzích predmetov na dráhe (FOD)

Cudzí predmet na aktívnej dráhe je kritické nebezpečenstvo. Lietadlo, ktoré narazí na úlomok, môže utrpieť katastrofálne poškodenie. V tomto kontexte predstavuje prehliadnutý defekt (falošne negatívny) vážne riziko, preto je recall prvoradý. Inšpektor môže tolerovať falošné poplachy a stráviť dodatočný čas overovaním, či určité detekované objekty sú skutočne cudzí materiál, pretože náklady na prehliadnutie skutočného FOD sú neprijateľné. Recall 0,98 je výhodnejší ako recall 0,80, aj keď presnosť klesne z 0,95 na 0,85. Okrajové falošné poplachy sú malou prevádzkovou záťažou v porovnaní s prehliadnutým bezpečnostným rizikom.

Scenár 2: Rutinné zaznamenávanie poškodení vozovky

Pri rutinnej inšpekcii povrchových poškodení vozovky (trhliny, vyjazdené koľaje, odlupovanie) sa režim zlyhania mení. Falošne pozitívne výsledky znamenajú, že inšpekčná správa obsahuje položky, ktoré musí údržba preskúmať a nakoniec zamietnuť ako nepodstatné. Systém, ktorý označí 1 000 povrchových anomálií, keď je skutočných defektov iba 500, si vynúti nákladné manuálne triedenie. Tu sa presnosť stáva dôležitejšou v porovnaní s recallom. Presnosť 0,90 (90 percent označených poškodení je skutočných) je cennejšia ako recall 0,99 s presnosťou 0,50.

Tento kompromis nie je symetrický naprieč doménami v rámci toho istého letiska. Inšpekcia osvetlenia (kalibrácia PAPI, stav približovacích svetiel, rovnomernosť intenzity) môže vyžadovať iné pracovné body presnosti a recallu ako skenovanie povrchu vozovky alebo posudzovanie prekážok.

Aplikácie v inšpekcii vozoviek a infraštruktúry

V praxi modely počítačového videnia pre letiskovú inšpekciu nevydávajú binárne predpovede, ale skóre spoľahlivosti detekcie. Model môže označiť potenciálnu trhlinu so spoľahlivosťou 0,72, inú s 0,55 a ďalšiu s 0,92. Rozhodovací prah (napr. “označ detekcie so spoľahlivosťou nad 0,7”) priamo riadi kompromis medzi presnosťou a recallom.

Zníženie prahu z 0,7 na 0,5 zachytí viac defektov (vyšší recall), pretože sú teraz zahrnuté okrajové detekcie. Zároveň však označí viac falošne pozitívnych výsledkov (nižšia presnosť), pretože hraničné nedefekty teraz prekračujú prah. Zvýšenie prahu na 0,9 robí opak: celkovo menej detekcií, ale tie, ktoré prejdú, sú s väčšou pravdepodobnosťou správne.

Pri hodnotení nového modelu detekcie defektov odborníci často vypočítavajú presnosť a recall pre všetky možné prahy a vizualizujú výsledok ako krivku presnosti a recallu. Plocha pod touto krivkou (AUC-PR) je súhrnná metrika. Model, ktorý dosahuje vysokú presnosť aj vysoký recall pri väčšine prahov, skóruje vyššie ako model, ktorý je nútený medzi nimi vyberať.

Kedy uprednostniť presnosť vs. recall

Prevádzkový kontext určuje optimálnu rovnováhu:

  • Uprednostnite Recall (Vysoká senzitivita), keď sú náklady na prehliadnutý defekt závažné: detekcia FOD, kritické štrukturálne poškodenie alebo poruchy osvetlenia ovplyvňujúce navigáciu pri priblížení. Automatizovaný systém s recallom 0,95 a presnosťou 0,70 je prijateľný, pretože prehliadnuté defekty sú neprijateľné.

  • Uprednostnite Presnosť (Nízka miera falošne pozitívnych výsledkov), keď sú falošné poplachy nákladné: rutinné monitorovanie poškodení vyžadujúce manuálne overenie, alebo keď inšpekčný systém napája triediacu frontu, kde falošne pozitívne výsledky spotrebúvajú vzácny čas odborníkov.

  • Vyvážte pomocou F1 (Stredná presnosť a recall), keď falošne pozitívne aj falošne negatívne výsledky nesú významné náklady a nemáte silný dôvod uprednostniť jeden pred druhým. F1 skóre zaisťuje, že model nevyniká v jednej metrike na úkor kolapsu v druhej.

Mnohé letiskové inšpekčné pracovné postupy fungujú v dvojstupňovom procese: automatizovaný AI systém s vysokým recallom (zachytávajúci takmer všetkých kandidátov) napája ľudský kontrolný krok, ktorý filtruje falošne pozitívne výsledky. Celkový systém dosahuje bezpečnostné výhody vysokého recallu bez prevádzkovej záťaže nadmerných falošných poplachov. Presnosť AI môže byť mierna. Ľudský odborník poskytuje konečnú kontrolu.

Porovnanie a súhrn

Nasledujúca tabuľka porovnáva, ako tieto metriky reagujú na správanie modelu:

ScenárPresnosťRecallF1Najlepší prípad použitia
Detekuje všetko, veľa falošných poplachovNízkaVysokýStrednéVysoko rizikové scenáre, kde je prehliadnutie defektov neprijateľné
Detekuje iba určité defekty, málo falošných poplachovVysokáNízkyNízkeNízkonárazové triedenie, kde falošné poplachy plytvajú časom
Vyvážené, mierne v obochStrednáStrednýVysokéVšeobecné posúdenie bez extrémnej asymetrie nákladov

Záver

Presnosť, recall a F1 skóre nie sú absolútne miery kvality modelu. Sú to nástroje na pochopenie správania modelu a informované rozhodovanie o nasadení. Pri inšpekcii letiskového osvetlenia a vozoviek majú presnosť a recall rôzne reálne náklady. Systém s vysokým recallom a miernou presnosťou môže byť správnou voľbou pre detekciu defektov kritických pre bezpečnosť, najmä v prvom stupni dvojstupňového inšpekčného pracovného postupu. Naopak, systém s vysokou presnosťou môže byť vhodný pre rutinné reportovanie, kde je ľudská kontrola hojná. F1 skóre poskytuje vyvážený súhrn, keď neprevláda jediný náklad. Pochopenie týchto metrík a mätúcej matice, na ktorej sú založené, je nevyhnutné pre budovanie a hodnotenie AI systémov, ktoré zvyšujú bezpečnosť a prevádzkovú efektivitu letísk.

Často kladené otázky

Hodnoťte výkonnosť AI inšpekcie

Modely AI spoločnosti TarmacView sú prísne hodnotené pomocou metrík presnosti, recallu a F1 skóre naprieč triedami poškodení vozoviek, aby sa zabezpečila spoľahlivá detekčná výkonnosť.