Letecký slovník

Co je přesnost, úplnost a skóre F1?

AI · Strojové učení · Počítačové vidění · Detekce vad · Inspekce infrastruktury 8 jazyky
Definice
Přesnost, úplnost a skóre F1 jsou metriky výkonu používané k hodnocení modelů klasifikace a detekce objektů v AI inspekci infrastruktury. Přesnost je poměr skutečně pozitivních detekcí ke všem pozitivním detekcím (TP / (TP + FP)), měří, jak často je model správný, když označí vadu. Úplnost (také nazývaná senzitivita) je poměr skutečně pozitivních detekcí ke všem skutečným vadám (TP / (TP + FN)), měří, kolik skutečných vad model najde. Model s vysokou přesností produkuje málo falešných poplachů, ale může přehlížet vady, model s vysokou úplností najde většinu vad, ale může produkovat falešně pozitivní výsledky. Skóre F1 je harmonický průměr přesnosti a úplnosti (2 × Přesnost × Úplnost / (Přesnost + Úplnost)), poskytuje jedinou metriku, která vyvažuje obojí. Při detekci poškození vozovek závisí vhodný kompromis mezi přesností a úplností na aplikaci: detekce vad kritických pro bezpečnost (např. FOD na drahách) obvykle upřednostňuje úplnost, zatímco automatizované reportovací systémy mohou upřednostňovat přesnost, aby se snížila zátěž manuální kontroly.

Přesnost, úplnost a skóre F1 – Metriky klasifikace strojového učení: Podrobný průvodce

Definice přesnosti, úplnosti a skóre F1

Přesnost, úplnost a skóre F1 jsou základní metriky výkonu pro hodnocení modelů klasifikace a detekce objektů. Jsou vypočítávány z matice záměn, tabulky, která porovnává predikované štítky se skutečným stavem. Tyto tři metriky vyprávějí různé příběhy o výkonu modelu a volba mezi nimi závisí na nákladech různých typů chyb ve vaší aplikaci.

Přesnost odpovídá na otázku: “Když model označí vadu, jak často má pravdu?” Matematicky přesnost = TP / (TP + FP), kde TP je počet skutečně pozitivních detekcí (správné detekce) a FP je počet falešně pozitivních detekcí (nesprávné detekce). Přesnost měří podíl všech pozitivních predikcí, které jsou skutečně správné. Přesnost 0,95 znamená, že 95 procent vad, které model detekuje, je skutečných.

Úplnost (také nazývaná senzitivita) odpovídá na otázku: “Ze všech skutečně přítomných vad, kolik jich model najde?” Vzorec je úplnost = TP / (TP + FN), kde FN je počet falešně negativních detekcí (vady, které model přehlédl). Úplnost měří podíl všech skutečných vad, které model úspěšně detekuje. Úplnost 0,90 znamená, že model zachytí 90 procent skutečných vad v dané scéně.

Skóre F1 je harmonický průměr přesnosti a úplnosti: F1 = 2 * (Přesnost * Úplnost) / (Přesnost + Úplnost). Toto jediné číslo se pohybuje od 0 do 1, přičemž 1 představuje dokonalou detekci. F1 poskytuje vyváženou metriku, když jsou nákladné jak falešně pozitivní, tak falešně negativní výsledky. Trestá extrémní nerovnováhu mezi přesností a úplností, takže model nemůže dosáhnout vysokého F1 obětováním jedné metriky ve prospěch druhé.

Matice záměn a odvozené metriky

Všechny tři metriky vycházejí z jednoduché tabulky dva krát dva nazývané matice záměn:

PredikceSkutečně vadaSkutečně OK
Model říká “Vada”TP (Skutečně pozitivní)FP (Falešně pozitivní)
Model říká “OK”FN (Falešně negativní)TN (Skutečně negativní)

Z této matice přímo vyplývají přesnost a úplnost:

MetrikaVzorecCo znamenáNáklady na chybu
PřesnostTP / (TP + FP)Podíl detekcí, které jsou správnéFalešné poplachy plýtvají časem inspektora
ÚplnostTP / (TP + FN)Podíl skutečných vad, které jsou nalezenyPřehlédnuté vady ohrožují bezpečnost
Skóre F12 * P * U / (P + U)Vyvážený harmonický průměr obouTrestá extrémní kompromisy

Model s vysokou přesností, ale nízkou úplností zachycuje pouze zřejmé vady a zřídka vyvolává falešné poplachy. Model s vysokou úplností, ale nízkou přesností zachycuje téměř každou vadu, ale označuje mnoho ne-vad, čímž inspektory zahlcuje manuálním ověřováním. Ideální model dosahuje obojího, ale v praxi musí být práh (rozhodovací hranice oddělující pozitivní od negativních predikcí) vyladěn tak, aby vyvážil tyto konkurenční požadavky.

Kompromis mezi přesností a úplností v bezpečnostně kritické inspekci

Při inspekci letištních vozovek a osvětlení má volba mezi přesností a úplností skutečné bezpečnostní důsledky. Zvažte dva scénáře:

Scénář 1: Detekce cizích předmětů na dráze (FOD)

Cizí předmět na aktivní dráze představuje kritické nebezpečí. Letadlo, které narazí do trosek, může utrpět katastrofální poškození. V této souvislosti představuje přehlédnutá vada (falešně negativní) závažné riziko, takže úplnost je prvořadá. Inspektor může tolerovat falešné poplachy a věnovat čas navíc ověřování, zda jsou určité detekované objekty skutečně cizím materiálem, protože náklady na přehlédnutí skutečného FOD jsou nepřijatelné. Úplnost 0,98 je výhodnější než úplnost 0,80, i když přesnost v tomto procesu klesne z 0,95 na 0,85. Okrajové falešné poplachy jsou malou provozní zátěží ve srovnání s přehlédnutým bezpečnostním rizikem.

Scénář 2: Rutinní zaznamenávání poškození vozovky

Při rutinní inspekci povrchových vad vozovky (trhliny, vyjeté koleje, odlupování) se režim selhání mění. Falešně pozitivní výsledky znamenají, že inspekční zpráva obsahuje položky, které musí údržbáři prošetřit a nakonec zamítnout jako nepodstatné. Systém, který označí 1 000 povrchových anomálií, když je skutečných vad pouze 500, si vynucuje nákladné manuální třídění. Zde se přesnost stává důležitější relativně k úplnosti. Přesnost 0,90 (90 procent označených vad je skutečných) je cennější než úplnost 0,99 s přesností 0,50.

Tento kompromis není symetrický napříč doménami v rámci stejného letiště. Inspekce osvětlení (kalibrace PAPI, stav přibližovacích světel, rovnoměrnost intenzity) může vyžadovat jiné pracovní body přesnosti a úplnosti než skenování povrchu vozovky nebo posouzení překážek.

Aplikace v inspekci vozovek a infrastruktury

V praxi modely počítačového vidění pro letištní inspekci vydávají skóre spolehlivosti detekce, nikoli binární predikce. Model může označit potenciální trhlinu se spolehlivostí 0,72, jinou s 0,55 a další s 0,92. Rozhodovací práh (např. “označit detekce se spolehlivostí nad 0,7”) přímo řídí kompromis mezi přesností a úplností.

Snížení prahu z 0,7 na 0,5 zachytí více vad (vyšší úplnost), protože jsou nyní zahrnuty okrajové detekce. Zároveň však označí více falešně pozitivních výsledků (nižší přesnost), protože hraniční ne-vady nyní práh překračují. Zvýšení prahu na 0,9 působí opačně: celkově méně detekcí, ale ty, které projdou, jsou s větší pravděpodobností správné.

Při hodnocení nového modelu detekce vad praktici často počítají přesnost a úplnost pro všechny možné prahy a vizualizují výsledek jako křivku přesnosti a úplnosti. Plocha pod touto křivkou (AUC-PR) je souhrnná metrika. Model, který dosahuje vysoké přesnosti i úplnosti u většiny prahů, skóruje výše než model, který je nucen mezi nimi volit.

Kdy upřednostnit přesnost vs. úplnost

Provozní kontext určuje optimální rovnováhu:

  • Upřednostněte úplnost (vysoká senzitivita), když jsou náklady na přehlédnutou vadu závažné: detekce FOD, kritické strukturální poškození nebo poruchy osvětlení ovlivňující navigaci při přiblížení. Automatizovaný systém s úplností 0,95 a přesností 0,70 je přijatelný, protože přehlédnuté vady jsou nepřijatelné.

  • Upřednostněte přesnost (nízká míra falešně pozitivních výsledků), když jsou falešné poplachy nákladné: rutinní monitorování vad vyžadující manuální ověření, nebo když inspekční systém napájí frontu třídění, kde falešně pozitivní výsledky spotřebovávají vzácný čas expertů.

  • Vyvažte pomocí F1 (střední přesnost a úplnost), když oba typy chyb – falešně pozitivní i falešně negativní – nesou významné náklady a nemáte silný důvod upřednostňovat jeden před druhým. Skóre F1 zajišťuje, že model nevyniká v jedné metrice na úkor kolapsu druhé.

Mnoho letištních inspekčních workflow funguje jako dvoustupňový proces: automatizovaný AI systém s vysokou úplností (zachycující téměř všechny kandidáty) napájí krok lidské kontroly, který filtruje falešně pozitivní výsledky. Celkový systém dosahuje bezpečnostních výhod vysoké úplnosti bez provozní zátěže nadměrných falešných poplachů. Přesnost AI může být střední. Lidský expert poskytuje konečnou kontrolu.

Srovnání a shrnutí

Následující tabulka porovnává, jak tyto metriky reagují na chování modelu:

ScénářPřesnostÚplnostF1Nejlepší případ použití
Detekuje vše, mnoho falešných poplachůNízkáVysokáStředníRizikové scénáře, kde je přehlédnutí vad nepřijatelné
Detekuje pouze určité vady, málo falešných poplachůVysokáNízkáNízkáTřídění s nízkou naléhavostí, kde falešné poplachy plýtvají časem
Vyvážené, střední v obouStředníStředníVysokáObecné hodnocení bez extrémní asymetrie nákladů

Závěr

Přesnost, úplnost a skóre F1 nejsou absolutními měřítky kvality modelu. Jsou to nástroje pro pochopení chování modelu a informované rozhodování o nasazení. Při inspekci letištního osvětlení a vozovek mají přesnost a úplnost různé reálné náklady. Systém s vysokou úplností a střední přesností může být správnou volbou pro detekci vad kritických pro bezpečnost, zejména v první fázi dvoustupňového inspekčního workflow. Naopak systém s vysokou přesností může být vhodný pro rutinní reportování, kde je lidská kontrola hojná. Skóre F1 poskytuje vyvážené shrnutí, když žádný jednotlivý náklad nedominuje. Porozumění těmto metrikám a matici záměn, na které jsou založeny, je nezbytné pro budování a hodnocení AI systémů, které zvyšují bezpečnost a provozní efektivitu letišť.

Často kladené otázky

Jaký je rozdíl mezi přesností a úplností?
Přesnost měří podíl detekcí, které jsou skutečně správné (TP/(TP+FP)), odráží míru falešných poplachů. Úplnost měří podíl všech skutečných vad, které jsou nalezeny (TP/(TP+FN)), odráží míru přehlédnutí. Model s vysokou přesností vyvolává málo falešných poplachů, ale může přehlížet vady, zatímco model s vysokou úplností zachytí většinu vad, ale produkuje více falešně pozitivních výsledků.
Kdy bych měl při detekci vad upřednostnit úplnost před přesností?
V aplikacích kritických pro bezpečnost, jako je detekce cizích předmětů na dráze (FOD) nebo kritického poškození vozovky, které by mohlo ohrozit letadla, je úplnost obvykle důležitější. Přehlédnutí vady (falešně negativní) má závažné bezpečnostní důsledky, proto je detekce většiny vad i za cenu některých falešných poplachů výhodnější.
Proč jednoduše nemaximalizovat úplnost, abychom zachytili každou možnou vadu?
Maximalizace úplnosti vytváří nadměrné množství falešně pozitivních výsledků, což v automatizovaném inspekčním workflow nutí k manuální kontrole mnoha nepodstatných záležitostí, což spotřebovává čas a zdroje. To snižuje provozní efektivitu a může vést k únavě z alarmů, kdy inspektoři mezi šumem přehlížejí skutečné problémy.
Co měří skóre F1?
Skóre F1 je harmonický průměr přesnosti a úplnosti, vypočítaný jako 2 * (Přesnost * Úplnost) / (Přesnost + Úplnost). Poskytuje jedinou metriku, která vyvažuje přesnost i úplnost, užitečnou, když potřebujete, aby falešně pozitivní i falešně negativní výsledky byly nízké.
Jak souvisí přesnost, úplnost a F1 s maticí záměn?
Všechny tři metriky vycházejí ze čtyř buněk matice záměn: skutečně pozitivní (TP), skutečně negativní (TN), falešně pozitivní (FP) a falešně negativní (FN). Přesnost používá TP a FP. Úplnost používá TP a FN. F1 je jejich kombinovaný harmonický průměr.
Může mít model současně vysokou přesnost a vysokou úplnost?
Ideálně ano, ale v praxi často existuje kompromis. Model s přísnějším rozhodovacím prahem dosahuje vysoké přesnosti, ale nižší úplnosti (méně falešných poplachů, ale více přehlédnutí), zatímco nižší práh zvyšuje úplnost, ale snižuje přesnost (zachytí více vad, ale také více falešných poplachů). Nejlepší pracovní bod závisí na toleranci aplikace vůči těmto chybám.
Začněte Potřebujete ověřit stav osvětlení letiště nebo zpevněných ploch? TarmacView kontroluje PAPI, dráhové a přibližovací osvětlení, povrch vozovek a překážky pomocí dronu mezi pohyby letadel a dodává zprávu o shodě přizpůsobenou vašemu regulátorovi.
Pokračovat ve čtení

Zjistit více

03 STRÁNKY
Intersection Over Union (IoU)
glossary

Intersection Over Union (IoU)

Intersection Over Union (IoU), nazývaný také Jaccardův index, měří překryv mezi predikovanou segmentační maskou a maskou ground truth: IoU = |A∩B| / |A∪B|. Je to primární metrika přesnosti segmentace trhlin, přičemž IoU > 0,5 je považováno za dobré. Segmentační hlava DINOv3 od TarmacView dosahuje testovacího IoU 0,519. Článek pokrývá výpočet IoU, interpretaci, vztah k Dice koeficientu a přijatelné…

Přesnost a preciznost určování polohy v geodézii
glossary

Přesnost a preciznost určování polohy v geodézii

Pochopte klíčové pojmy přesnosti a preciznosti polohy v geodézii, včetně absolutní a relativní přesnosti, úrovní spolehlivosti a relevantních norem jako NSSDA a FGDC. Nezbytné pro letectví, stavebnictví, GIS a právní pozemkové měření.

Přesnost měření
glossary

Přesnost měření

Přesnost měření je těsnost naměřené hodnoty ke skutečné hodnotě, což je zásadní v letectví, vědě i průmyslu. Zajišťuje spolehlivé výsledky, bezpečnost a soulad s předpisy minimalizací chyb a nejistot prostřednictvím kalibrace a osvědčených postupů.