Letecký slovník

Čo je prenosové učenie pre modely kontroly infraštruktúry?

Technológia · Strojové učenie · Hlboké učenie · Trénovanie 5 jazyky
Definícia
Prenosové učenie je paradigma strojového učenia, v ktorej sa model vyvinutý pre jednu úlohu znovu používa ako východiskový bod pre model na druhej, súvisiacej úlohe. V počítačovom videní pre kontrolu infraštruktúry to zvyčajne zahŕňa použitie neurónovej siete predtrénovanej na veľkom, všeobecnom datasete (ImageNet s 1,2 miliónmi obrázkov v 1 000 triedach, alebo Meta DINOv3 trénovaný na 1,7 miliardy obrázkov) a jej adaptáciu na detekciu trhlín, odlupovania, gumových usadenín a iných defektov vozovky s použitím malej časti údajov, ktoré by boli potrebné na trénovanie od nuly.

Často kladené otázky

Čo je prenosové učenie v počítačovom videní?
Prenosové učenie je technika strojového učenia, pri ktorej sa model natrénovaný na veľkom, všeúčelovom datasete znovu používa ako východiskový bod pre model na špecializovanejšej úlohe. V počítačovom videní je štandardným prístupom použitie neurónovej siete predtrénovanej na ImageNet (1,2 milióna obrázkov v 1 000 kategóriách objektov) alebo samoriadeného modelu ako DINOv3 (trénovaného na 1,7 miliardy obrázkov) a jej dolaďovanie na menšom datasete špecifickom pre danú úlohu. Predtrénovaný model sa naučil všeobecné vizuálne vlastnosti, hrany, textúry, tvary, farebné škvrny, ktoré sa prenášajú prakticky do akejkoľvek vizuálnej domény. Pre kontrolu infraštruktúry prenosové učenie znižuje požiadavku na údaje z 50 000+ označených obrázkov na len 200 – 1 000 obrázkov, pričom zachováva alebo prevyšuje presnosť modelu trénovaného od nuly.
Ako prenosové učenie znižuje požiadavky na údaje pri kontrole infraštruktúry?
Prenosové učenie znižuje požiadavky na údaje 10-200x v porovnaní s trénovaním od nuly. Model segmentácie trhlín trénovaný od nuly vyžaduje odhadom 50 000 – 100 000 obrázkov s pixelovou úrovňou označenia na dosiahnutie prijateľnej presnosti. S prenosovým učením z predtrénovanej kostry ImageNet dosahuje 1 000 – 2 000 označených obrázkov 60-70% mIoU pri segmentácii defektov dráhy. So samoriadeným predtrénovaním DINOv3 (1,7B obrázkov) dosahuje zmrazená kostra s lineárnou sondou na 200 označených obrázkoch 55-65% mIoU a dolaďovanie na 500 – 1 500 obrázkoch dosahuje 70-80% mIoU.
Aký je rozdiel medzi prenosovým učením, dolaďovaním a adaptáciou domény?
Prenosové učenie je široká paradigma opätovného využitia poznatkov z jednej úlohy alebo domény v inej. Dolaďovanie je najbežnejšia technika prenosového učenia, pri ktorej sa predtrénované váhy upravujú na cieľových údajoch, čiastočne alebo úplne. Adaptácia domény je podkategória prenosového učenia, kde úloha zostáva rovnaká, ale mení sa distribúcia údajov, napríklad adaptácia detektora trhlín na asfalte na betónové dráhy.
Čo je DINOv3 a prečo je dôležitý pre kontrolu infraštruktúry?
DINOv3 (Distillation with No Labels, verzia 3) je najmodernejší samoriadený vizuálny model od Meta, trénovaný na 1,7 miliardy kurátorských obrázkov (dataset LVD-1689M). Používa architektúru Vision Transformer (ViT) s až 7 miliardami parametrov a bol trénovaný bez akýchkoľvek ľudských anotácií. DINOv3 je kľúčový pre kontrolu infraštruktúry, pretože vytvára výnimočne silné husté vlastnosti, každý patche obrázka nesie sémanticky zmysluplnú informáciu aj bez dolaďovania, a podporuje vstupy s vysokým rozlíšením až do 4K+, čo zodpovedá požiadavkám snímok z UAV kontroly.
Ako funguje zmrazovanie kostry v prenosovom učení?
Zmrazovanie kostry zabraňuje aktualizácii váh vybraných vrstiev počas trénovania. Pre zmrazené vrstvy sa nevypočítavajú gradienty a ich váhy zostávajú fixné, zatiaľ čo len nezmrazené vrstvy a hlava špecifická pre úlohu sa učia z nových údajov. Bežné stratégie zmrazovania zahŕňajú: úplné zmrazenie kostry (trénovanie len hlavy, najlepšie pre malé datasety), fázové zmrazenie (zmrazenie skorých vrstiev, dolaďovanie neskorších vrstiev), postupné odmrazovanie (postupné odmrazovanie zhora nadol) a úbytkové rýchlosti učenia na úrovni vrstiev (Layer-wise Learning Rate Decay, LLRD), kde všetky vrstvy trénujú s rôznymi rýchlosťami učenia.
Čo je riadené kontrastívne učenie a ako zlepšuje prenosové učenie?
Riadené kontrastívne učenie (Supervised Contrastive Learning, SupCon), predstavené Khoslom a kol. na NeurIPS 2020, rozširuje samoriadené kontrastívne prístupy na riadené prostredie. Loss funkcia priťahuje všetky vzorky rovnakej triedy k sebe vo vkladacom priestore, zatiaľ čo odtláča vzorky z rôznych tried od seba. V TarmacView sa SupCon aplikuje po predtrénovaní DINOv3 na vytvorenie triedne štruktúrovaných vlastností z označených údajov dráhy pred trénovaním segmentačných hláv špecifických pre úlohu.
Aké sú požiadavky na údaje pre prenosové učenie pri detekcii trhlín na vozovke?
Požiadavky na údaje sa dramaticky líšia v závislosti od stratégie prenosového učenia. Zmrazená kostra DINOv3 s lineárnou sondou vyžaduje len 200 – 500 označených obrázkov a dosahuje 55-65% mIoU. Dolaďovanie horných 50% ViT blokov na 500 – 1 500 obrázkoch dosahuje 70-80% mIoU. Pridanie predtrénovania v doméne ciest pred dolaďovaním na dráhu s 200 – 1 000 obrázkami a riadeným kontrastívnym učením dosahuje 75-85% mIoU. Trénovanie od nuly vyžaduje odhadom 50 000 – 100 000 označených obrázkov.
Čo je doménová medzera a ako ovplyvňuje prenosové učenie pre kontrolu dráh?
Doménová medzera je štatistický rozdiel medzi doménou predtrénovania (typicky prirodzené obrázky z ImageNet) a cieľovou doménou kontroly infraštruktúry (povrchy vozoviek, trhliny, značenie dráh). Datasety defektov vozovky majú 2-3x väčšiu Frechet Inception Distance (FID) od ImageNet ako štandardné datasety jemnozrnnej klasifikácie. Mitigačné stratégie zahŕňajú predtrénovanie v strednej doméne na datasetoch ciest, samoriadené pokračujúce predtrénovanie na neoznačených snímkach dráh a augmentáciu údajov pre preklenutie medzery.
Ako TarmacView implementuje prenosové učenie?
TarmacView implementuje trojstupňovú pipeline prenosového učenia. Stupeň 1 používa zmrazenú kostru DINOv3 Vision Transformer predtrénovanú na 1,7 miliardy obrázkov. Stupeň 2 aplikuje riadené kontrastívne učenie (SupCon) dolaďovanie na označených údajoch defektov dráh. Stupeň 3 trénuje hlavy špecifické pre úlohu pre pixelovú sémantickú segmentáciu a odhad indexu stavu vozovky (PCI). Táto pipeline dosahuje 75-85% mIoU s 200 – 1 000 označenými snímkami dráhy.
Aké sú najlepšie postupy pre prenosové učenie pri kontrole infraštruktúry?
Najlepšie postupy zahŕňajú: začnite so zmrazenou kostrou a lineárnou sondou na stanovenie základnej línie, používajte postupné odmrazovanie zhora nadol, aplikujte úbytkové rýchlosti učenia na úrovni vrstiev (LLRD), používajte dvojstupňové dolaďovanie (ImageNet na Cesty na Dráhu), keď sú k dispozícii datasety ciest, konzistentne normalizujte všetky obrázky, aplikujte stochastickú hĺbku ako regularizáciu počas dolaďovania, konvertujte obrázky na odtiene sivej pri prenose medzi typmi povrchov, a zbierajte neoznačené snímky dráh pre samoriadené pokračujúce predtrénovanie.
Ako súvisí prenosové učenie s normami ICAO a FAA pre kontrolu dráh?
ICAO Annex 14 stanovuje globálne normy vyžadujúce pravidelné hodnotenie stavu vozovky. ICAO Doc 9137 definuje postupy údržby a kontroly vozoviek. Rámec indexu stavu vozovky (PCI) podľa ASTM D5340 je priemyselným štandardom pre hodnotenie stavu letiskových vozoviek. Pracovný dokument ICAO Assembly 42 WP/173 (SkyInspect360) navrhuje integráciu AI a strojového učenia pre kontrolu dráh. Prenosové učenie umožňuje systémom kontroly založeným na AI dosiahnuť presnosť segmentácie potrebnú pre spoľahlivý odhad PCI.
Začať Potrebujete overiť osvetlenie alebo povrch vašej letiskovej plochy? TarmacView kontroluje PAPI, dráhové a približovacie osvetlenie, povrch a prekážky pomocou dronu medzi pohybmi lietadiel a poskytuje správu o zhode pripravenú pre vášho regulátora.
Pokračovať v čítaní

Zistiť viac

03 STRÁN
DINOv3 Vision Transformer pre analýzu povrchov infraštruktúry
glossary

DINOv3 Vision Transformer pre analýzu povrchov infraštruktúry

DINOv3 (self-DIstillation with NO labels v3) je samoriadený vision transformer (ViT-B/16) predtrénovaný na 1,7 miliarde obrázkov, ktorý vytvára vysoko kvalitné 768-rozmerné vloženia zachytávajúce jemnú textúru a štruktúru. TarmacView používa DINOv3 ako svoju základnú sieť na analýzu typu povrchu, kvality, trhlín a defektov. Zahŕňa tréning DINO, architektúru ViT, dolaďovanie pre doménové úlohy a…

Rozšírenie údajov
glossary

Rozšírenie údajov

Rozšírenie údajov synteticky rozširuje trénovacie datasety aplikáciou transformácií obrazu, rotácie, preklápanie, farebné variácie, rozmazanie, šum, orezanie, s cieľom zlepšiť robustnosť modelu voči zmenám osvetlenia, orientácie a kvality obrazu. Pre kontrolu infraštruktúry sú kľúčové doménovo-špecifické augmentácie (perspektívne transformácie, simulácia tieňov, poveternostné efekty). Pokrýva…

Vložený priestor
glossary

Vložený priestor

Vložený priestor je viacrozmerný matematický priestor, v ktorom sú objekty ako obrázky, text alebo senzorové údaje reprezentované ako vektory, čo umožňuje vyhľadávanie podobností a rozpoznávanie vzorov v systémoch kontroly infraštruktúry poháňaných umelou inteligenciou.