Letecký slovník

Co je přesnost, úplnost a skóre F1?

Definice
Přesnost, úplnost a skóre F1 jsou metriky výkonu používané k hodnocení modelů klasifikace a detekce objektů v AI inspekci infrastruktury. Přesnost je poměr skutečně pozitivních detekcí ke všem pozitivním detekcím (TP / (TP + FP)), měří, jak často je model správný, když označí vadu. Úplnost (také nazývaná senzitivita) je poměr skutečně pozitivních detekcí ke všem skutečným vadám (TP / (TP + FN)), měří, kolik skutečných vad model najde. Model s vysokou přesností produkuje málo falešných poplachů, ale může přehlížet vady, model s vysokou úplností najde většinu vad, ale může produkovat falešně pozitivní výsledky. Skóre F1 je harmonický průměr přesnosti a úplnosti (2 × Přesnost × Úplnost / (Přesnost + Úplnost)), poskytuje jedinou metriku, která vyvažuje obojí. Při detekci poškození vozovek závisí vhodný kompromis mezi přesností a úplností na aplikaci: detekce vad kritických pro bezpečnost (např. FOD na drahách) obvykle upřednostňuje úplnost, zatímco automatizované reportovací systémy mohou upřednostňovat přesnost, aby se snížila zátěž manuální kontroly.

Přesnost, úplnost a skóre F1 – Metriky klasifikace strojového učení: Podrobný průvodce

Definice přesnosti, úplnosti a skóre F1

Přesnost, úplnost a skóre F1 jsou základní metriky výkonu pro hodnocení modelů klasifikace a detekce objektů. Jsou vypočítávány z matice záměn, tabulky, která porovnává predikované štítky se skutečným stavem. Tyto tři metriky vyprávějí různé příběhy o výkonu modelu a volba mezi nimi závisí na nákladech různých typů chyb ve vaší aplikaci.

Přesnost odpovídá na otázku: “Když model označí vadu, jak často má pravdu?” Matematicky přesnost = TP / (TP + FP), kde TP je počet skutečně pozitivních detekcí (správné detekce) a FP je počet falešně pozitivních detekcí (nesprávné detekce). Přesnost měří podíl všech pozitivních predikcí, které jsou skutečně správné. Přesnost 0,95 znamená, že 95 procent vad, které model detekuje, je skutečných.

Úplnost (také nazývaná senzitivita) odpovídá na otázku: “Ze všech skutečně přítomných vad, kolik jich model najde?” Vzorec je úplnost = TP / (TP + FN), kde FN je počet falešně negativních detekcí (vady, které model přehlédl). Úplnost měří podíl všech skutečných vad, které model úspěšně detekuje. Úplnost 0,90 znamená, že model zachytí 90 procent skutečných vad v dané scéně.

Skóre F1 je harmonický průměr přesnosti a úplnosti: F1 = 2 * (Přesnost * Úplnost) / (Přesnost + Úplnost). Toto jediné číslo se pohybuje od 0 do 1, přičemž 1 představuje dokonalou detekci. F1 poskytuje vyváženou metriku, když jsou nákladné jak falešně pozitivní, tak falešně negativní výsledky. Trestá extrémní nerovnováhu mezi přesností a úplností, takže model nemůže dosáhnout vysokého F1 obětováním jedné metriky ve prospěch druhé.

Matice záměn a odvozené metriky

Všechny tři metriky vycházejí z jednoduché tabulky dva krát dva nazývané matice záměn:

PredikceSkutečně vadaSkutečně OK
Model říká “Vada”TP (Skutečně pozitivní)FP (Falešně pozitivní)
Model říká “OK”FN (Falešně negativní)TN (Skutečně negativní)

Z této matice přímo vyplývají přesnost a úplnost:

MetrikaVzorecCo znamenáNáklady na chybu
PřesnostTP / (TP + FP)Podíl detekcí, které jsou správnéFalešné poplachy plýtvají časem inspektora
ÚplnostTP / (TP + FN)Podíl skutečných vad, které jsou nalezenyPřehlédnuté vady ohrožují bezpečnost
Skóre F12 * P * U / (P + U)Vyvážený harmonický průměr obouTrestá extrémní kompromisy

Model s vysokou přesností, ale nízkou úplností zachycuje pouze zřejmé vady a zřídka vyvolává falešné poplachy. Model s vysokou úplností, ale nízkou přesností zachycuje téměř každou vadu, ale označuje mnoho ne-vad, čímž inspektory zahlcuje manuálním ověřováním. Ideální model dosahuje obojího, ale v praxi musí být práh (rozhodovací hranice oddělující pozitivní od negativních predikcí) vyladěn tak, aby vyvážil tyto konkurenční požadavky.

Kompromis mezi přesností a úplností v bezpečnostně kritické inspekci

Při inspekci letištních vozovek a osvětlení má volba mezi přesností a úplností skutečné bezpečnostní důsledky. Zvažte dva scénáře:

Scénář 1: Detekce cizích předmětů na dráze (FOD)

Cizí předmět na aktivní dráze představuje kritické nebezpečí. Letadlo, které narazí do trosek, může utrpět katastrofální poškození. V této souvislosti představuje přehlédnutá vada (falešně negativní) závažné riziko, takže úplnost je prvořadá. Inspektor může tolerovat falešné poplachy a věnovat čas navíc ověřování, zda jsou určité detekované objekty skutečně cizím materiálem, protože náklady na přehlédnutí skutečného FOD jsou nepřijatelné. Úplnost 0,98 je výhodnější než úplnost 0,80, i když přesnost v tomto procesu klesne z 0,95 na 0,85. Okrajové falešné poplachy jsou malou provozní zátěží ve srovnání s přehlédnutým bezpečnostním rizikem.

Scénář 2: Rutinní zaznamenávání poškození vozovky

Při rutinní inspekci povrchových vad vozovky (trhliny, vyjeté koleje, odlupování) se režim selhání mění. Falešně pozitivní výsledky znamenají, že inspekční zpráva obsahuje položky, které musí údržbáři prošetřit a nakonec zamítnout jako nepodstatné. Systém, který označí 1 000 povrchových anomálií, když je skutečných vad pouze 500, si vynucuje nákladné manuální třídění. Zde se přesnost stává důležitější relativně k úplnosti. Přesnost 0,90 (90 procent označených vad je skutečných) je cennější než úplnost 0,99 s přesností 0,50.

Tento kompromis není symetrický napříč doménami v rámci stejného letiště. Inspekce osvětlení (kalibrace PAPI, stav přibližovacích světel, rovnoměrnost intenzity) může vyžadovat jiné pracovní body přesnosti a úplnosti než skenování povrchu vozovky nebo posouzení překážek.

Aplikace v inspekci vozovek a infrastruktury

V praxi modely počítačového vidění pro letištní inspekci vydávají skóre spolehlivosti detekce, nikoli binární predikce. Model může označit potenciální trhlinu se spolehlivostí 0,72, jinou s 0,55 a další s 0,92. Rozhodovací práh (např. “označit detekce se spolehlivostí nad 0,7”) přímo řídí kompromis mezi přesností a úplností.

Snížení prahu z 0,7 na 0,5 zachytí více vad (vyšší úplnost), protože jsou nyní zahrnuty okrajové detekce. Zároveň však označí více falešně pozitivních výsledků (nižší přesnost), protože hraniční ne-vady nyní práh překračují. Zvýšení prahu na 0,9 působí opačně: celkově méně detekcí, ale ty, které projdou, jsou s větší pravděpodobností správné.

Při hodnocení nového modelu detekce vad praktici často počítají přesnost a úplnost pro všechny možné prahy a vizualizují výsledek jako křivku přesnosti a úplnosti. Plocha pod touto křivkou (AUC-PR) je souhrnná metrika. Model, který dosahuje vysoké přesnosti i úplnosti u většiny prahů, skóruje výše než model, který je nucen mezi nimi volit.

Kdy upřednostnit přesnost vs. úplnost

Provozní kontext určuje optimální rovnováhu:

  • Upřednostněte úplnost (vysoká senzitivita), když jsou náklady na přehlédnutou vadu závažné: detekce FOD, kritické strukturální poškození nebo poruchy osvětlení ovlivňující navigaci při přiblížení. Automatizovaný systém s úplností 0,95 a přesností 0,70 je přijatelný, protože přehlédnuté vady jsou nepřijatelné.

  • Upřednostněte přesnost (nízká míra falešně pozitivních výsledků), když jsou falešné poplachy nákladné: rutinní monitorování vad vyžadující manuální ověření, nebo když inspekční systém napájí frontu třídění, kde falešně pozitivní výsledky spotřebovávají vzácný čas expertů.

  • Vyvažte pomocí F1 (střední přesnost a úplnost), když oba typy chyb – falešně pozitivní i falešně negativní – nesou významné náklady a nemáte silný důvod upřednostňovat jeden před druhým. Skóre F1 zajišťuje, že model nevyniká v jedné metrice na úkor kolapsu druhé.

Mnoho letištních inspekčních workflow funguje jako dvoustupňový proces: automatizovaný AI systém s vysokou úplností (zachycující téměř všechny kandidáty) napájí krok lidské kontroly, který filtruje falešně pozitivní výsledky. Celkový systém dosahuje bezpečnostních výhod vysoké úplnosti bez provozní zátěže nadměrných falešných poplachů. Přesnost AI může být střední. Lidský expert poskytuje konečnou kontrolu.

Srovnání a shrnutí

Následující tabulka porovnává, jak tyto metriky reagují na chování modelu:

ScénářPřesnostÚplnostF1Nejlepší případ použití
Detekuje vše, mnoho falešných poplachůNízkáVysokáStředníRizikové scénáře, kde je přehlédnutí vad nepřijatelné
Detekuje pouze určité vady, málo falešných poplachůVysokáNízkáNízkáTřídění s nízkou naléhavostí, kde falešné poplachy plýtvají časem
Vyvážené, střední v obouStředníStředníVysokáObecné hodnocení bez extrémní asymetrie nákladů

Závěr

Přesnost, úplnost a skóre F1 nejsou absolutními měřítky kvality modelu. Jsou to nástroje pro pochopení chování modelu a informované rozhodování o nasazení. Při inspekci letištního osvětlení a vozovek mají přesnost a úplnost různé reálné náklady. Systém s vysokou úplností a střední přesností může být správnou volbou pro detekci vad kritických pro bezpečnost, zejména v první fázi dvoustupňového inspekčního workflow. Naopak systém s vysokou přesností může být vhodný pro rutinní reportování, kde je lidská kontrola hojná. Skóre F1 poskytuje vyvážené shrnutí, když žádný jednotlivý náklad nedominuje. Porozumění těmto metrikám a matici záměn, na které jsou založeny, je nezbytné pro budování a hodnocení AI systémů, které zvyšují bezpečnost a provozní efektivitu letišť.

Často kladené otázky

Vyhodnoťte výkon AI inspekce

Modely AI společnosti TarmacView jsou přísně hodnoceny pomocí metrik přesnosti, úplnosti a F1 napříč třídami poškození vozovek, aby byl zajištěn spolehlivý detekční výkon.