Čo sú presnosť, recall a F1 skóre?
Presnosť, Recall a F1 skóre – Metriky klasifikácie strojového učenia (Strojové učenie): Podrobný sprievodca
Definícia presnosti, recallu a F1 skóre
Presnosť, recall a F1 skóre sú základné metriky výkonnosti pre hodnotenie klasifikačných modelov a modelov detekcie objektov. Vypočítavajú sa z mätúcej matice, tabuľky, ktorá porovnáva predpovedané označenia so skutočnosťou. Tieto tri metriky rozprávajú rôzne príbehy o výkonnosti modelu a výber medzi nimi závisí od nákladov na rôzne typy chýb vo vašej aplikácii.
Presnosť odpovedá na otázku: “Keď model označí defekt, ako často je to správne?” Matematicky: presnosť = TP / (TP + FP), kde TP je počet skutočne pozitívnych detekcií (správne detekcie) a FP je počet falošne pozitívnych detekcií (nesprávne detekcie). Presnosť meria podiel všetkých pozitívnych predpovedí, ktoré sú skutočne správne. Presnosť 0,95 znamená, že 95 percent defektov, ktoré model detekuje, je skutočných.
Recall (tiež nazývaný senzitivita) odpovedá na otázku: “Zo všetkých skutočne prítomných defektov, koľko model nájde?” Vzorec je: recall = TP / (TP + FN), kde FN je počet falošne negatívnych detekcií (defekty, ktoré model prehliadol). Recall meria podiel všetkých skutočných defektov, ktoré model úspešne detekuje. Recall 0,90 znamená, že model zachytí 90 percent skutočných defektov v scéne.
F1 skóre je harmonický priemer presnosti a recallu: F1 = 2 * (Presnosť * Recall) / (Presnosť + Recall). Toto jediné číslo sa pohybuje od 0 do 1, pričom 1 znamená dokonalú detekciu. F1 poskytuje vyváženú metriku, keď sú náklady na falošne pozitívne aj falošne negatívne výsledky vysoké. Trestá extrémnu nerovnováhu medzi presnosťou a recallom, takže model nemôže dosiahnuť vysoké F1 obetovaním jednej metriky v prospech druhej.
Mätúca matica a odvodené metriky
Všetky tri metriky sú odvodené z jednoduchej dvojkrát dvoj tabuľky nazývanej mätúca matica:
| Predpoveď | Skutočne defekt | Skutočne v poriadku |
|---|---|---|
| Model hovorí “Defekt” | TP (Skutočne pozitívny) | FP (Falošne pozitívny) |
| Model hovorí “V poriadku” | FN (Falošne negatívny) | TN (Skutočne negatívny) |
Z tejto matice priamo vyplývajú presnosť a recall:
| Metrika | Vzorec | Čo znamená | Náklady na chybu |
|---|---|---|---|
| Presnosť | TP / (TP + FP) | Podiel detekcií, ktoré sú správne | Falošné poplachy plytvajú časom inšpektora |
| Recall | TP / (TP + FN) | Podiel skutočných defektov, ktoré boli nájdené | Prehliadnuté defekty ohrozujú bezpečnosť |
| F1 skóre | 2 * P * R / (P + R) | Vyvážený harmonický priemer oboch | Trestá extrémne kompromisy |
Model s vysokou presnosťou, ale nízkym recallom zachytáva iba zjavné defekty a zriedkavo vyvoláva falošné poplachy. Model s vysokým recallom, ale nízkou presnosťou zachytí takmer každý defekt, ale označí mnoho nedefektov, čím zaplaví inšpektorov manuálnym overovaním. Ideálny model dosahuje oboje, ale v praxi musí byť prah (rozhodovacia hranica oddeľujúca pozitívne od negatívnych predpovedí) vyladený tak, aby vyvážil tieto konkurenčné požiadavky.
Kompromis medzi presnosťou a recallom v bezpečnostne kritickej inšpekcii
Pri inšpekcii letiskových vozoviek a osvetlenia má výber medzi presnosťou a recallom skutočné bezpečnostné dôsledky. Zvážte dva scenáre:
Scenár 1: Detekcia cudzích predmetov na dráhe (FOD)
Cudzí predmet na aktívnej dráhe je kritické nebezpečenstvo. Lietadlo, ktoré narazí na úlomok, môže utrpieť katastrofálne poškodenie. V tomto kontexte predstavuje prehliadnutý defekt (falošne negatívny) vážne riziko, preto je recall prvoradý. Inšpektor môže tolerovať falošné poplachy a stráviť dodatočný čas overovaním, či určité detekované objekty sú skutočne cudzí materiál, pretože náklady na prehliadnutie skutočného FOD sú neprijateľné. Recall 0,98 je výhodnejší ako recall 0,80, aj keď presnosť klesne z 0,95 na 0,85. Okrajové falošné poplachy sú malou prevádzkovou záťažou v porovnaní s prehliadnutým bezpečnostným rizikom.
Scenár 2: Rutinné zaznamenávanie poškodení vozovky
Pri rutinnej inšpekcii povrchových poškodení vozovky (trhliny, vyjazdené koľaje, odlupovanie) sa režim zlyhania mení. Falošne pozitívne výsledky znamenajú, že inšpekčná správa obsahuje položky, ktoré musí údržba preskúmať a nakoniec zamietnuť ako nepodstatné. Systém, ktorý označí 1 000 povrchových anomálií, keď je skutočných defektov iba 500, si vynúti nákladné manuálne triedenie. Tu sa presnosť stáva dôležitejšou v porovnaní s recallom. Presnosť 0,90 (90 percent označených poškodení je skutočných) je cennejšia ako recall 0,99 s presnosťou 0,50.
Tento kompromis nie je symetrický naprieč doménami v rámci toho istého letiska. Inšpekcia osvetlenia (kalibrácia PAPI, stav približovacích svetiel, rovnomernosť intenzity) môže vyžadovať iné pracovné body presnosti a recallu ako skenovanie povrchu vozovky alebo posudzovanie prekážok.
Aplikácie v inšpekcii vozoviek a infraštruktúry
V praxi modely počítačového videnia pre letiskovú inšpekciu nevydávajú binárne predpovede, ale skóre spoľahlivosti detekcie. Model môže označiť potenciálnu trhlinu so spoľahlivosťou 0,72, inú s 0,55 a ďalšiu s 0,92. Rozhodovací prah (napr. “označ detekcie so spoľahlivosťou nad 0,7”) priamo riadi kompromis medzi presnosťou a recallom.
Zníženie prahu z 0,7 na 0,5 zachytí viac defektov (vyšší recall), pretože sú teraz zahrnuté okrajové detekcie. Zároveň však označí viac falošne pozitívnych výsledkov (nižšia presnosť), pretože hraničné nedefekty teraz prekračujú prah. Zvýšenie prahu na 0,9 robí opak: celkovo menej detekcií, ale tie, ktoré prejdú, sú s väčšou pravdepodobnosťou správne.
Pri hodnotení nového modelu detekcie defektov odborníci často vypočítavajú presnosť a recall pre všetky možné prahy a vizualizujú výsledok ako krivku presnosti a recallu. Plocha pod touto krivkou (AUC-PR) je súhrnná metrika. Model, ktorý dosahuje vysokú presnosť aj vysoký recall pri väčšine prahov, skóruje vyššie ako model, ktorý je nútený medzi nimi vyberať.
Kedy uprednostniť presnosť vs. recall
Prevádzkový kontext určuje optimálnu rovnováhu:
Uprednostnite Recall (Vysoká senzitivita), keď sú náklady na prehliadnutý defekt závažné: detekcia FOD, kritické štrukturálne poškodenie alebo poruchy osvetlenia ovplyvňujúce navigáciu pri priblížení. Automatizovaný systém s recallom 0,95 a presnosťou 0,70 je prijateľný, pretože prehliadnuté defekty sú neprijateľné.
Uprednostnite Presnosť (Nízka miera falošne pozitívnych výsledkov), keď sú falošné poplachy nákladné: rutinné monitorovanie poškodení vyžadujúce manuálne overenie, alebo keď inšpekčný systém napája triediacu frontu, kde falošne pozitívne výsledky spotrebúvajú vzácny čas odborníkov.
Vyvážte pomocou F1 (Stredná presnosť a recall), keď falošne pozitívne aj falošne negatívne výsledky nesú významné náklady a nemáte silný dôvod uprednostniť jeden pred druhým. F1 skóre zaisťuje, že model nevyniká v jednej metrike na úkor kolapsu v druhej.
Mnohé letiskové inšpekčné pracovné postupy fungujú v dvojstupňovom procese: automatizovaný AI systém s vysokým recallom (zachytávajúci takmer všetkých kandidátov) napája ľudský kontrolný krok, ktorý filtruje falošne pozitívne výsledky. Celkový systém dosahuje bezpečnostné výhody vysokého recallu bez prevádzkovej záťaže nadmerných falošných poplachov. Presnosť AI môže byť mierna. Ľudský odborník poskytuje konečnú kontrolu.
Porovnanie a súhrn
Nasledujúca tabuľka porovnáva, ako tieto metriky reagujú na správanie modelu:
| Scenár | Presnosť | Recall | F1 | Najlepší prípad použitia |
|---|---|---|---|---|
| Detekuje všetko, veľa falošných poplachov | Nízka | Vysoký | Stredné | Vysoko rizikové scenáre, kde je prehliadnutie defektov neprijateľné |
| Detekuje iba určité defekty, málo falošných poplachov | Vysoká | Nízky | Nízke | Nízkonárazové triedenie, kde falošné poplachy plytvajú časom |
| Vyvážené, mierne v oboch | Stredná | Stredný | Vysoké | Všeobecné posúdenie bez extrémnej asymetrie nákladov |
Záver
Presnosť, recall a F1 skóre nie sú absolútne miery kvality modelu. Sú to nástroje na pochopenie správania modelu a informované rozhodovanie o nasadení. Pri inšpekcii letiskového osvetlenia a vozoviek majú presnosť a recall rôzne reálne náklady. Systém s vysokým recallom a miernou presnosťou môže byť správnou voľbou pre detekciu defektov kritických pre bezpečnosť, najmä v prvom stupni dvojstupňového inšpekčného pracovného postupu. Naopak, systém s vysokou presnosťou môže byť vhodný pre rutinné reportovanie, kde je ľudská kontrola hojná. F1 skóre poskytuje vyvážený súhrn, keď neprevláda jediný náklad. Pochopenie týchto metrík a mätúcej matice, na ktorej sú založené, je nevyhnutné pre budovanie a hodnotenie AI systémov, ktoré zvyšujú bezpečnosť a prevádzkovú efektivitu letísk.