- Mi a transzfer tanulás a számítógépes látás területén?
- A transzfer tanulás egy gépi tanulási technika, amelyben egy nagy, általános célú adathalmazon tanított modellt használunk kiindulási pontként egy speciálisabb feladat modelljéhez. A számítógépes látásban az általános megközelítés az, hogy egy ImageNet-en (1,2 millió kép 1000 objektumkategóriában) előtanított neurális hálózatot vagy egy önfelügyelt modellt (mint a DINOv3, 1,7 milliárd képen tanítva) veszünk, és azt egy kisebb, feladatspecifikus adathalmazon finomhangoljuk. Az előtanított modell általános vizuális jellemzőket tanult meg – éleket, textúrákat, formákat, színfoltokat – amelyek gyakorlatilag bármely vizuális tartományba átvihetők. Infrastruktúra-ellenőrzés esetében a transzfer tanulás az adatigényt 50 000+ címkézett képről akár 200–1000 képre csökkenti, miközben megtartja vagy meghaladja a nulláról tanított modell pontosságát.
- Hogyan csökkenti a transzfer tanulás az adatigényt az infrastruktúra-ellenőrzésben?
- A transzfer tanulás 10–200-szor csökkenti az adatigényt a nulláról történő tanításhoz képest. Egy nulláról tanított repedés-szegmentációs modellnek becslések szerint 50 000–100 000 pixelszintű címkézett képre van szüksége az elfogadható pontosság eléréséhez. Egy ImageNet-en előtanított backbone-ról induló transzfer tanulással 1000–2000 címkézett kép 60–70%-os mIoU-t ér el a kifutópálya-hibák szegmentálásában. DINOv3 önfelügyelt előtanítással (1,7 milliárd kép) egy rögzített backbone lineáris próbával 200 címkézett képen 55–65%-os mIoU-t, míg a finomhangolás 500–1500 képpel 70–80%-os mIoU-t ér el.
- Mi a különbség a transzfer tanulás, a finomhangolás és a domain adaptáció között?
- A transzfer tanulás a tudás egyik feladatról vagy tartományról a másikra történő újrafelhasználásának tág paradigmája. A finomhangolás a leggyakoribb transzfer tanulási technika, amely során az előtanított súlyokat részben vagy egészben a céladatokhoz igazítjuk. A domain adaptáció a transzfer tanulás egy alkategóriája, ahol a feladat változatlan, de az adateloszlás megváltozik – például egy aszfaltrepedés-detektor adaptálása beton kifutópályákra.
- Mi a DINOv3 és miért fontos az infrastruktúra-ellenőrzésben?
- A DINOv3 (Distillation with No Labels, 3. verzió) a Meta legmodernebb önfelügyelt látásmodellje, amelyet 1,7 milliárd kurált képen (LVD-1689M adathalmaz) tanítottak. Vision Transformer (ViT) architektúrát használ, akár 7 milliárd paraméterrel, és emberi címkék nélkül tanították. A DINOv3 azért kritikus fontosságú az infrastruktúra-ellenőrzésben, mert kivételesen erős sűrű jellemzőket állít elő – minden képi patch szemantikailag értelmes információt hordoz finomhangolás nélkül is –, és támogatja a 4K+ felbontású bemeneteket, megfelelve a UAV-ellenőrzési felvételek követelményeinek.
- Hogyan működik a backbone-rögzítés a transzfer tanulásban?
- A backbone-rögzítés megakadályozza, hogy a kiválasztott rétegek súlyai frissítésre kerüljenek a tanítás során. A rögzített rétegekhez nem számolunk gradienseket, súlyaik változatlanok maradnak, miközben csak a feloldott rétegek és a feladatspecifikus fej tanul az új adatokból. Gyakori rögzítési stratégiák: teljes backbone-rögzítés (csak a fej tanítása, legjobb kis adathalmazokhoz), rétegenkénti rögzítés (korai rétegek rögzítése, későbbi rétegek finomhangolása), progresszív feloldás (fokozatos feloldás felülről lefelé), valamint rétegenkénti tanulási ráta csökkentés (LLRD), ahol minden réteg eltérő tanulási rátával tanul.
- Mi a Felügyelt Kontrasztív Tanulás és hogyan erősíti a transzfer tanulást?
- A Felügyelt Kontrasztív Tanulást (SupCon) Khosla és munkatársai vezették be a NeurIPS 2020 konferencián. Az önfelügyelt kontrasztív megközelítéseket terjeszti ki a felügyelt környezetre. A veszteségfüggvény azonos osztályba tartozó mintákat közel húz egymáshoz a beágyazási térben, miközben a különböző osztályok mintáit távolítja egymástól. A TarmacView-ben a SupCon-t a DINOv3 előtanítást követően alkalmazzák, hogy osztály-szerkezetű jellemzőket hozzanak létre a címkézett kifutópálya-adatokból, még a feladatspecifikus szegmentációs fejek tanítása előtt.
- Milyen adatigényekkel jár a transzfer tanulás a burkolatrepedések felismerésében?
- Az adatigények drámaian változnak a transzfer tanulási stratégia függvényében. Egy rögzített DINOv3 backbone lineáris próbával mindössze 200–500 címkézett képet igényel, és 55–65%-os mIoU-t ér el. A ViT blokkok felső 50%-ának finomhangolása 500–1500 képen 70–80%-os mIoU-t eredményez. Út-domain előtanítás hozzáadásával, majd kifutópálya finomhangolással 200–1000 képen és Felügyelt Kontrasztív Tanulással 75–85%-os mIoU érhető el. A nulláról történő tanításhoz becslések szerint 50 000–100 000 címkézett kép szükséges.
- Mi a domain-szakadék és hogyan befolyásolja a transzfer tanulást a kifutópálya-ellenőrzésben?
- A domain-szakadék a statisztikai különbség az előtanítási tartomány (jellemzően természetes képek az ImageNet-ből) és a cél-tartomány (infrastruktúra-ellenőrzés: burkolatfelületek, repedések, kifutópálya-jelzések) között. A burkolathiba-adathalmazok Frechet Inception Distance (FID) értéke 2–3-szor nagyobb az ImageNet-hez képest, mint a szabványos finom osztályozási adathalmazoké. A szakadék csökkentésének stratégiái: köztes domain előtanítás út-adathalmazokon, önfelügyelt folytatólagos előtanítás címkézetlen kifutópálya-képeken, valamint adatbővítési áthidalás.
- Hogyan valósítja meg a TarmacView a transzfer tanulást?
- A TarmacView egy háromlépcsős transzfer tanulási folyamatot alkalmaz. Az 1. szakasz egy rögzített DINOv3 Vision Transformer backbone-t használ, amelyet 1,7 milliárd képen tanítottak elő. A 2. szakasz Felügyelt Kontrasztív Tanulás (SupCon) finomhangolást végez címkézett kifutópálya-hiba adatokon. A 3. szakasz feladatspecifikus fejeket tanít pixelszintű szemantikus szegmentációra és Burkolatállapot-index (PCI) becslésére. Ez a folyamat 75–85%-os mIoU-t ér el 200–1000 címkézett kifutópálya-képpel.
- Melyek a transzfer tanulás legjobb gyakorlatai az infrastruktúra-ellenőrzésben?
- A legjobb gyakorlatok közé tartozik: kezdjünk egy rögzített backbone-nal és lineáris próbával az alapvonal meghatározásához, alkalmazzunk progresszív feloldást felülről lefelé, használjunk rétegenkénti tanulási ráta csökkentést, végezzünk kétlépcsős finomhangolást (ImageNet → Út → Kifutópálya), ha út-adathalmazok rendelkezésre állnak, normalizáljuk az összes képet egységesen, alkalmazzunk sztochasztikus mélységet regularizációként a finomhangolás során, alakítsuk át a képeket szürkeárnyalatossá, amikor felületi típusok között váltunk, és gyűjtsünk címkézetlen kifutópálya-képeket az önfelügyelt folytatólagos előtanításhoz.
- Hogyan kapcsolódik a transzfer tanulás az ICAO és FAA kifutópálya-ellenőrzési szabványaihoz?
- Az ICAO Annex 14. nemzetközi szabványokat határoz meg a rendszeres burkolatállapot-felmérésekre vonatkozóan. Az ICAO Doc 9137 meghatározza a burkolatkarbantartási gyakorlatokat és ellenőrzési eljárásokat. Az ASTM D5340 szerinti Burkolatállapot-index (PCI) keretrendszer a repülőtéri burkolatállapot-felmérés iparági referenciája. Az ICAO Közgyűlés 42. WP/173 munkadokumentuma (SkyInspect360) a mesterséges intelligencia és gépi tanulás integrálását javasolja a kifutópálya-ellenőrzésbe. A transzfer tanulás lehetővé teszi az AI-alapú ellenőrző rendszerek számára a megbízható PCI-becsléshez szükséges szegmentációs pontosság elérését.