Co je přesnost, úplnost a skóre F1?
Přesnost, úplnost a skóre F1 – Metriky klasifikace strojového učení: Podrobný průvodce
Definice přesnosti, úplnosti a skóre F1
Přesnost, úplnost a skóre F1 jsou základní metriky výkonu pro hodnocení modelů klasifikace a detekce objektů. Jsou vypočítávány z matice záměn, tabulky, která porovnává predikované štítky se skutečným stavem. Tyto tři metriky vyprávějí různé příběhy o výkonu modelu a volba mezi nimi závisí na nákladech různých typů chyb ve vaší aplikaci.
Přesnost odpovídá na otázku: “Když model označí vadu, jak často má pravdu?” Matematicky přesnost = TP / (TP + FP), kde TP je počet skutečně pozitivních detekcí (správné detekce) a FP je počet falešně pozitivních detekcí (nesprávné detekce). Přesnost měří podíl všech pozitivních predikcí, které jsou skutečně správné. Přesnost 0,95 znamená, že 95 procent vad, které model detekuje, je skutečných.
Úplnost (také nazývaná senzitivita) odpovídá na otázku: “Ze všech skutečně přítomných vad, kolik jich model najde?” Vzorec je úplnost = TP / (TP + FN), kde FN je počet falešně negativních detekcí (vady, které model přehlédl). Úplnost měří podíl všech skutečných vad, které model úspěšně detekuje. Úplnost 0,90 znamená, že model zachytí 90 procent skutečných vad v dané scéně.
Skóre F1 je harmonický průměr přesnosti a úplnosti: F1 = 2 * (Přesnost * Úplnost) / (Přesnost + Úplnost). Toto jediné číslo se pohybuje od 0 do 1, přičemž 1 představuje dokonalou detekci. F1 poskytuje vyváženou metriku, když jsou nákladné jak falešně pozitivní, tak falešně negativní výsledky. Trestá extrémní nerovnováhu mezi přesností a úplností, takže model nemůže dosáhnout vysokého F1 obětováním jedné metriky ve prospěch druhé.
Matice záměn a odvozené metriky
Všechny tři metriky vycházejí z jednoduché tabulky dva krát dva nazývané matice záměn:
| Predikce | Skutečně vada | Skutečně OK |
|---|---|---|
| Model říká “Vada” | TP (Skutečně pozitivní) | FP (Falešně pozitivní) |
| Model říká “OK” | FN (Falešně negativní) | TN (Skutečně negativní) |
Z této matice přímo vyplývají přesnost a úplnost:
| Metrika | Vzorec | Co znamená | Náklady na chybu |
|---|---|---|---|
| Přesnost | TP / (TP + FP) | Podíl detekcí, které jsou správné | Falešné poplachy plýtvají časem inspektora |
| Úplnost | TP / (TP + FN) | Podíl skutečných vad, které jsou nalezeny | Přehlédnuté vady ohrožují bezpečnost |
| Skóre F1 | 2 * P * U / (P + U) | Vyvážený harmonický průměr obou | Trestá extrémní kompromisy |
Model s vysokou přesností, ale nízkou úplností zachycuje pouze zřejmé vady a zřídka vyvolává falešné poplachy. Model s vysokou úplností, ale nízkou přesností zachycuje téměř každou vadu, ale označuje mnoho ne-vad, čímž inspektory zahlcuje manuálním ověřováním. Ideální model dosahuje obojího, ale v praxi musí být práh (rozhodovací hranice oddělující pozitivní od negativních predikcí) vyladěn tak, aby vyvážil tyto konkurenční požadavky.
Kompromis mezi přesností a úplností v bezpečnostně kritické inspekci
Při inspekci letištních vozovek a osvětlení má volba mezi přesností a úplností skutečné bezpečnostní důsledky. Zvažte dva scénáře:
Scénář 1: Detekce cizích předmětů na dráze (FOD)
Cizí předmět na aktivní dráze představuje kritické nebezpečí. Letadlo, které narazí do trosek, může utrpět katastrofální poškození. V této souvislosti představuje přehlédnutá vada (falešně negativní) závažné riziko, takže úplnost je prvořadá. Inspektor může tolerovat falešné poplachy a věnovat čas navíc ověřování, zda jsou určité detekované objekty skutečně cizím materiálem, protože náklady na přehlédnutí skutečného FOD jsou nepřijatelné. Úplnost 0,98 je výhodnější než úplnost 0,80, i když přesnost v tomto procesu klesne z 0,95 na 0,85. Okrajové falešné poplachy jsou malou provozní zátěží ve srovnání s přehlédnutým bezpečnostním rizikem.
Scénář 2: Rutinní zaznamenávání poškození vozovky
Při rutinní inspekci povrchových vad vozovky (trhliny, vyjeté koleje, odlupování) se režim selhání mění. Falešně pozitivní výsledky znamenají, že inspekční zpráva obsahuje položky, které musí údržbáři prošetřit a nakonec zamítnout jako nepodstatné. Systém, který označí 1 000 povrchových anomálií, když je skutečných vad pouze 500, si vynucuje nákladné manuální třídění. Zde se přesnost stává důležitější relativně k úplnosti. Přesnost 0,90 (90 procent označených vad je skutečných) je cennější než úplnost 0,99 s přesností 0,50.
Tento kompromis není symetrický napříč doménami v rámci stejného letiště. Inspekce osvětlení (kalibrace PAPI, stav přibližovacích světel, rovnoměrnost intenzity) může vyžadovat jiné pracovní body přesnosti a úplnosti než skenování povrchu vozovky nebo posouzení překážek.
Aplikace v inspekci vozovek a infrastruktury
V praxi modely počítačového vidění pro letištní inspekci vydávají skóre spolehlivosti detekce, nikoli binární predikce. Model může označit potenciální trhlinu se spolehlivostí 0,72, jinou s 0,55 a další s 0,92. Rozhodovací práh (např. “označit detekce se spolehlivostí nad 0,7”) přímo řídí kompromis mezi přesností a úplností.
Snížení prahu z 0,7 na 0,5 zachytí více vad (vyšší úplnost), protože jsou nyní zahrnuty okrajové detekce. Zároveň však označí více falešně pozitivních výsledků (nižší přesnost), protože hraniční ne-vady nyní práh překračují. Zvýšení prahu na 0,9 působí opačně: celkově méně detekcí, ale ty, které projdou, jsou s větší pravděpodobností správné.
Při hodnocení nového modelu detekce vad praktici často počítají přesnost a úplnost pro všechny možné prahy a vizualizují výsledek jako křivku přesnosti a úplnosti. Plocha pod touto křivkou (AUC-PR) je souhrnná metrika. Model, který dosahuje vysoké přesnosti i úplnosti u většiny prahů, skóruje výše než model, který je nucen mezi nimi volit.
Kdy upřednostnit přesnost vs. úplnost
Provozní kontext určuje optimální rovnováhu:
Upřednostněte úplnost (vysoká senzitivita), když jsou náklady na přehlédnutou vadu závažné: detekce FOD, kritické strukturální poškození nebo poruchy osvětlení ovlivňující navigaci při přiblížení. Automatizovaný systém s úplností 0,95 a přesností 0,70 je přijatelný, protože přehlédnuté vady jsou nepřijatelné.
Upřednostněte přesnost (nízká míra falešně pozitivních výsledků), když jsou falešné poplachy nákladné: rutinní monitorování vad vyžadující manuální ověření, nebo když inspekční systém napájí frontu třídění, kde falešně pozitivní výsledky spotřebovávají vzácný čas expertů.
Vyvažte pomocí F1 (střední přesnost a úplnost), když oba typy chyb – falešně pozitivní i falešně negativní – nesou významné náklady a nemáte silný důvod upřednostňovat jeden před druhým. Skóre F1 zajišťuje, že model nevyniká v jedné metrice na úkor kolapsu druhé.
Mnoho letištních inspekčních workflow funguje jako dvoustupňový proces: automatizovaný AI systém s vysokou úplností (zachycující téměř všechny kandidáty) napájí krok lidské kontroly, který filtruje falešně pozitivní výsledky. Celkový systém dosahuje bezpečnostních výhod vysoké úplnosti bez provozní zátěže nadměrných falešných poplachů. Přesnost AI může být střední. Lidský expert poskytuje konečnou kontrolu.
Srovnání a shrnutí
Následující tabulka porovnává, jak tyto metriky reagují na chování modelu:
| Scénář | Přesnost | Úplnost | F1 | Nejlepší případ použití |
|---|---|---|---|---|
| Detekuje vše, mnoho falešných poplachů | Nízká | Vysoká | Střední | Rizikové scénáře, kde je přehlédnutí vad nepřijatelné |
| Detekuje pouze určité vady, málo falešných poplachů | Vysoká | Nízká | Nízká | Třídění s nízkou naléhavostí, kde falešné poplachy plýtvají časem |
| Vyvážené, střední v obou | Střední | Střední | Vysoká | Obecné hodnocení bez extrémní asymetrie nákladů |
Závěr
Přesnost, úplnost a skóre F1 nejsou absolutními měřítky kvality modelu. Jsou to nástroje pro pochopení chování modelu a informované rozhodování o nasazení. Při inspekci letištního osvětlení a vozovek mají přesnost a úplnost různé reálné náklady. Systém s vysokou úplností a střední přesností může být správnou volbou pro detekci vad kritických pro bezpečnost, zejména v první fázi dvoustupňového inspekčního workflow. Naopak systém s vysokou přesností může být vhodný pro rutinní reportování, kde je lidská kontrola hojná. Skóre F1 poskytuje vyvážené shrnutí, když žádný jednotlivý náklad nedominuje. Porozumění těmto metrikám a matici záměn, na které jsou založeny, je nezbytné pro budování a hodnocení AI systémů, které zvyšují bezpečnost a provozní efektivitu letišť.