Čo je DINOv3 Vision Transformer?
DINOv3 Vision Transformer pre analýzu povrchov infraštruktúry

Samoriadené učenie a DINO
Samoriadené učenie (SSL) je paradigma strojového učenia, kde sa model učí zmysluplné reprezentácie z neoznačených údajov definovaním pretextovej úlohy, ktorá nevyžaduje ľudské anotácie. Model musí predpovedať niektorú časť údajov z iných častí, pričom využíva inherentnú štruktúru a vzory spoločného výskytu v rámci samotných údajov. V počítačovom videní metódy SSL prešli od ručne vyrobených pretextových úloh, ako je predpovedanie uhla rotácie obrázka (RotNet), skladanie puzzle z premiešaných výrezov alebo kolorovanie obrázkov v odtieňoch sivej, k sofistikovanejším kontrastívnym a destilačným prístupom. Základnou výhodou SSL je, že umožňuje tréning na webových súboroch údajov bez prohibičných nákladov na manuálnu anotáciu. Pre infraštruktúrne aplikácie, kde sú označené súbory údajov defektov vzácne a drahé na výrobu (vyžadujú certifikovaných inšpektorov a inžinierov), základné siete založené na SSL umožňujú efektívne učenie vlastností z obrovského množstva neoznačených snímok pred akýmkoľvek dolaďovaním špecifickým pre danú úlohu.
Toto je metóda detekcie trhlín, ktorá stojí za hodnotením cestných vozoviek od TarmacView.
Kontrastívne učenie metódy ako SimCLR, MoCo a SwAV sa učia reprezentácie tým, že augmentované pohľady toho istého obrázka (pozitívne páry) priťahujú k sebe v priestore vložení, zatiaľ čo pohľady rôznych obrázkov (negatívne páry) od seba odtláčajú. Tieto metódy vyžadujú starostlivé zaobchádzanie s negatívnymi vzorkami – príliš málo negatív zhoršuje výkon, príliš veľa zvyšuje výpočtové náklady. Nekontrastívne metódy ako BYOL, SimSiam a DINO sa úplne vyhýbajú potrebe negatívnych párov pomocou asymetrických sieťových architektúr a operácií zastavenia gradientu, aby sa zabránilo kolapsu reprezentácie. DINO (self-DIstillation with NO labels), predstavený Caronom a kol. v Meta AI v roku 2021, patrí do tejto nekontrastívnej rodiny a stal sa jednou z najvplyvnejších metód SSL v počítačovom videní. Pôvodný článok DINO demonštroval, že SSL a Vision Transformery majú jedinečnú synergiu – mechanizmy self-attention v ViT prirodzene vytvárajú sémantické segmentačné mapy bez akejkoľvek supervízie, čo je vlastnosť, ktorá vzniká z interakcie medzi stratégiou augmentácie viacnásobných orezov a cieľom samodestilácie.
Tréningový rámec DINO funguje nasledovne. Pre každý vstupný obrázok sa vygenerujú dva globálne pohľady (pokrývajúce viac ako 50% plochy obrázka, typicky 224x224 pixelov) a niekoľko lokálnych pohľadov (menšie orezy pokrývajúce menej ako 50% plochy obrázka, typicky 96x96 pixelov) prostredníctvom náhodného orezania so zmenou veľkosti, farebného chvenia a Gaussovho rozmazania. Všetky pohľady prechádzajú cez študentskú sieť (Vision Transformer). Globálne pohľady prechádzajú aj cez učiteľskú sieť, ktorá zdieľa rovnakú architektúru ako študent, ale má iné parametre. Parametre učiteľa sa neučia prostredníctvom gradientov – namiesto toho sa aktualizujú ako exponenciálny kĺzavý priemer (EMA) parametrov študenta. Základným tréningovým cieľom je dosiahnuť, aby výstupné rozdelenie študenta zodpovedalo výstupnému rozdeleniu učiteľa pre globálne pohľady, zatiaľ čo lokálne pohľady poskytujú dodatočný tréningový signál iba prostredníctvom študenta. Toto nastavenie učiteľ-študent, známe ako samodestilácia, vytvára učebný signál, ktorý nevyžaduje štítky – študent sa učí vytvárať konzistentné reprezentácie naprieč rôznymi augmentáciami toho istého obrázka, čo ho núti zachytiť invariantný sémantický obsah skôr než povrchné detaily na úrovni pixelov.
DINOv1 (2021) demonštroval tri kľúčové emergentné vlastnosti samoriadených ViT. Po prvé, mapy pozornosti z tokenu [CLS] k výrezom obrázka prirodzene segmentujú objekty od pozadia – vlastnosť, ktorá vzniká čisto zo samoriadenia bez akýchkoľvek segmentačných štítkov. Po druhé, naučené vlastnosti vykazujú vynikajúci výkon k-NN klasifikácie – jednoduchý klasifikátor najbližšieho suseda v priestore vlastností DINO dosahuje 78,2% top-1 presnosť na ImageNet bez akéhokoľvek dolaďovania. Po tretie, vlastnosti DINO vykazujú silnú sémantickú korešpondenciu naprieč rôznymi inštanciami rovnakej triedy objektov, čo umožňuje aplikácie vo vyhľadávaní obrázkov, spolusepmentácii a segmentácii objektov vo videu. Tieto vlastnosti urobili z DINO základnú metódu v krajine samoriadeného učenia a pripravili pôdu pre DINOv2 (2023) a DINOv3 (2025).
Architektúra ViT
Architektúra Vision Transformer (ViT), predstavená Dosovitským a kol. v Google v roku 2021, adaptuje architektúru Transformer z spracovania prirodzeného jazyka na počítačové videnie tým, že s výrezmi obrázka zaobchádza ako s analógmi slovných tokenov. Na rozdiel od konvolučných neurónových sietí (CNN), ktoré spracúvajú obrázky prostredníctvom lokálnych receptívnych polí so zabudovanou translačnou ekvivalenciou, ViT aplikujú globálnu self-attention na všetky výrezy súčasne, čo umožňuje modelu zachytiť závislosti na veľké vzdialenosti už od prvej vrstvy. Táto architektonická voľba sa ukázala ako kľúčová pre úspech DINO – pôvodný článok DINO ukázal, že samoriadené ViT výrazne prekonávajú samoriadené CNN a že synergia medzi self-attention a samodestiláciou je zodpovedná za emergentné vlastnosti sémantickej segmentácie.
Vloženie výrezu (Patch Embedding). Prvou operáciou v ViT je rozdelenie vstupného obrázka na mriežku neprekrývajúcich sa výrezov. Pre variant ViT-B/16 používaný TarmacView je veľkosť výrezu 16x16 pixelov. Vstupný obrázok 224x224 pixelov vytvára (224/16) x (224/16) = 14 x 14 = 196 výrezov. Každý výrez 16x16x3 (RGB kanály) je sploštený do vektora dĺžky 768 (16x16x3). V praxi je toto vloženie výrezu implementované ako jediná konvolučná vrstva s veľkosťou jadra rovnajúcou sa veľkosti výrezu (16x16) a krokom rovnajúcim sa veľkosti výrezu, čím vzniká 2D mriežka 14x14 vektorov vlastností, každý s dimenziou rovnajúcou sa skrytej veľkosti modelu (768 pre ViT-B). Naučiteľná lineárna projekcia potom mapuje každý sploštený výrez na dimenziu vloženia. Implementácia Conv2d je výpočtovo efektívna (jedna operácia nahrádza 196 samostatných lineárnych projekcií) a je štandardom vo všetkých moderných implementáciách ViT.
Token [CLS]. Po vzore architektúry BERT v NLP je na začiatok sekvencie vložení výrezov pridaný špeciálny naučiteľný klasifikačný token ([CLS]). Token [CLS] má rovnakú dimenziu (768) ako vloženia výrezov a je inicializovaný náhodne. Počas tréningu, prostredníctvom self-attention naprieč všetkými vrstvami transformeru, token [CLS] agreguje informácie zo všetkých výrezov obrázka – môže venovať pozornosť každému výrezu v každej vrstve, čím vytvára globálnu reprezentáciu celého obrázka. Na výstupe poslednej vrstvy transformeru slúži vloženie tokenu [CLS] ako reprezentácia na úrovni obrázka používaná pre klasifikačné úlohy. V DINOv3 je token [CLS] doplnený o 4 registračné tokeny – ďalšie naučiteľné tokeny pridané na začiatok sekvencie, ktoré fungujú ako pamäť na zošit na absorbovanie odľahlých alebo informácií o pozadí, čím bránia tokenom [CLS] a výrezov, aby boli skorumpované irelevantnými vysokofrekvenčnými detailmi.
Pozičné vloženia (Positional Embeddings). Keďže mechanizmus self-attention v Transformeri je permutačne invariantný (spracúva výrezy ako množinu, nie ako sekvenciu), pozičné informácie musia byť explicitne pridané, aby modelu povedali, kam každý výrez patrí v priestorovej mriežke. DINOv3 používa Rotary Position Embeddings (RoPE) namiesto štandardných naučiteľných absolútnych pozičných kódovaní používaných v DINOv2. RoPE kóduje relatívne pozičné informácie aplikáciou rotačnej matice na dotazovacie a kľúčové vektory v self-attention na základe ich priestorových súradníc. Frekvencia rotácie pre každú dimenziu je určená indexom dimenzie podľa geometrickej postupnosti. Kľúčovou výhodou RoPE pre analýzu infraštruktúry je jej schopnosť spracovávať vstupy s premenlivým rozlíšením – pri spracovaní obrázkov s vysokým rozlíšením (až do 4096x4096 pixelov) mechanizmus RoPE prirodzene generalizuje na väčšiu priestorovú mriežku bez potreby interpolácie naučených pozičných vložení. DINOv3 tiež zavádza náhodný posun boxu (random box jitter) počas aplikácie RoPE, kde sú pozičné indexy náhodne posunuté v rozsahu [-s,s] s s v [0.5,2.0], čím je model robustný voči rôznym pomerom strán a vzorom orezania.
Multi-Head Self-Attention (MHSA). Základným výpočtovým primitívom ViT je mechanizmus multi-head self-attention. V každom bloku transformeru je vstupná sekvencia N tokenov (N = 1 [CLS] + 4 registračné + 196 výrezov = 201 tokenov pre vstup 224x224) lineárne projektovaná do troch matíc: Dotazy (Q) , Kľúče (K) a Hodnoty (V) , každá s dimenziou 768 pre ViT-B/16. Mechanizmus pozornosti vypočítava párovú podobnosť medzi všetkými tokenmi ako bodový súčin Q a K^T, škálovaný druhou odmocninou d_k (kde d_k je dimenzia kľúča na hlavu). Výsledné váhy pozornosti (normalizované softmaxom) určujú, koľko každý token prispieva k reprezentácii každého iného tokenu. V ViT-B/16 je 12 hláv pozornosti, pričom každá pracuje v 64-rozmernom podpriestore (768/12 = 64). Viachlavová pozornosť umožňuje modelu venovať pozornosť rôznym typom vzťahov súčasne – napríklad jedna hlava sa môže zamerať na podobnosť textúry medzi výrezmi, iná na priestorovú blízkosť a ďalšia na členstvo v sémantickej kategórii. Výstupy všetkých hláv sú spojené a lineárne projektované späť na 768 dimenzií. Výpočtová zložitosť MHSA je O(N2d) – kvadratická v dĺžke sekvencie N, ale lineárna v dimenzii vloženia d. Pre sekvenciu 201 tokenov v DINOv3 ViT-B/16 je to zvládnuteľné (približne 40K výpočtov pozornosti na vrstvu), ale pre obrázky s vysokým rozlíšením s 4000+ tokenmi (napr. obrázok 1024x1024 vytvára 64x64 = 4096 výrezov) sa kvadratické škálovanie stáva významným faktorom.

Blok Transformer Enkodéra. Každá z 12 (ViT-B) alebo 40 (ViT-7B) vrstiev transformeru v DINOv3 nasleduje dizajn pred-normalizácie. Layer Normalization (LayerNorm) je aplikovaná pred podvrstvami MHSA aj MLP, s reziduálnymi spojeniami obchádzajúcimi každú podvrstvu. Podvrstva MLP (multilayer perceptron) pozostáva z dvoch lineárnych vrstiev s aktiváciou GELU (Gaussian Error Linear Unit) medzi nimi. Pre ViT-B/16 je skrytá dimenzia MLP 3072 (4x dimenzia vloženia), čo vytvára konfiguráciu: Dimenziu vloženia 768 na MLP skrytú 3072 na GELU na MLP výstup 768. Väčší učiteľský model DINOv3 (ViT-7B) používa v MLP aktiváciu SwiGLU (Swish-Gated Linear Unit) namiesto GELU, podľa trendov architektúry moderných veľkých jazykových modelov. SwiGLU aplikuje gating mechanizmus: výstup = (xW1) element-wise vynásobené Swish(xW2) krát W3. Táto gated aktivácia sa ukázala ako zlepšujúca stabilitu tréningu a konečný výkon pri škálovaní. Dizajn pred-normalizácie sa líši od pôvodného Transformeru s post-normalizáciou (kde normalizácia bola aplikovaná po pridaní rezídua) a ukázalo sa, že produkuje stabilnejší tréning, najmä pre hlboké (12+ vrstiev) transformery.
Súhrnná tabuľka architektúry pre rodinu modelov DINOv3.
| Model | Parametre | Dimenziu vloženia | Hlavy | Vrstvy | Dimenziu MLP | Veľkosť výrezu | Výrezy/224px |
|---|---|---|---|---|---|---|---|
| ViT-Small | 21M | 384 | 6 | 12 | 1536 | 16 | 196 |
| ViT-Base | 86M | 768 | 12 | 12 | 3072 | 16 | 196 |
| ViT-Large | 304M | 1024 | 16 | 24 | 4096 | 16 | 196 |
| ViT-H+ | ~1,5B | 1536 | 24 | 32 | 6144 | 16 | 196 |
| ViT-7B | 7B | 4096 | 32 | 40 | 8192 | 16 | 196 |
Architektúra ViT-Base (86M parametrov) je optimálnym kompromisom medzi kvalitou vlastností a výpočtovou efektívnosťou pre pipeline inšpekcie infraštruktúry TarmacView, ponúkajúc 768-rozmerné vloženia s 12 vrstvami výpočtového výkonu self-attention.
Tréning DINOv3 na 1,7 miliarde obrázkov
DINOv3 dosahuje svoj najmodernejší výkon prostredníctvom bezprecedentného rozsahu samoriadeného tréningu, využívajúc masívnu kuráciu údajov a efektívnu distribuovanú optimalizáciu na stovkách GPU.
Súbor údajov LVD-1689M. Tréningové dáta pre DINOv3 začínajú surovým fondom 17 miliárd obsahovo moderovaných obrázkov z Instagramu. Z tohto masívneho fondu tím Meta AI vybral vyváženú podmnožinu 1 689 miliónov obrázkov pomenovanú LVD-1689M (Large Visual Dataset 1689 Million). Pipeline kurácie je kritický, pretože jednoduché trénovanie na surových údajoch z Instagramu by vytvorilo model zaujatý smerom k prirodzenej frekvenčnej distribúcii vizuálnych konceptov na sociálnych sieťach – napríklad tváre, jedlo a krajiny by dominovali, zatiaľ čo infraštruktúra, priemyselné a vedecké snímky by boli nedostatočne zastúpené. Proces kurácie využíva hierarchické k-means zhlukovanie na vloženiach DINOv2 extrahovaných z celého fondu obrázkov. Model DINOv2 ViT-H/14 spracuje každý obrázok a výsledné vloženia CLS tokenov sú zhlukované do 25 000 zhlukov pomocou k-means. Následne je z každého zhluku vzorkovaný rovnaký počet obrázkov, čím vzniká zhlukovo vyvážený súbor údajov, ktorý zabezpečuje proporcionálne zastúpenie naprieč vizuálnymi doménami. Toto vyvážené vzorkovanie je priamo analogické stratifikovanému vzorkovaniu v štatistike – kontrolou členstva v zhluku súbor údajov zachytáva plnú diverzitu vizuálnych konceptov skôr než nadmerne zastupuje bežné kategórie. Po zhlukovaní ďalší krok vyhľadávania rozširuje semená množiny z kurátorských súborov údajov (ImageNet-1k, ImageNet-22k, Google Landmarks a súbory údajov pre jemnú klasifikáciu) nájdením najbližších susedov v priestore vložení DINOv2. Konečný súbor údajov LVD-1689M kombinuje 1 489 miliónov zhlukovo vyvážených obrázkov s 200 miliónmi obrázkov rozšírených vyhľadávaním, všetky filtrované cez detekciu NSFW, deduplikáciu PCA hash a rozmazanie tvárí.
Konfigurácia tréningu. Učiteľský model ViT-7B, najväčší samoriadený vizuálny model, aký bol kedy trénovaný (k roku 2025), bol trénovaný na 256 NVIDIA GPU (A100 80GB SXM4) s veľkosťou dávky 4096 (16 obrázkov na GPU). Optimalizácia používa optimalizátor AdamW s konštantnou rýchlosťou učenia 4x10^-4, úbytkom váh 0,04 a hybnosťou EMA 0,999 po 100 000-krokovej zahrievacej perióde. Tréning prebieha 1 milión iterácií so stratégiou viacnásobných orezov: 2 globálne orezy v rozlíšení 256x256 a 8 lokálnych orezov v rozlíšení 112x112, celkovo 10 pohľadov na obrázok na iteráciu. Počas 1M iterácií s veľkosťou dávky 4096 model vidí približne 2,56 miliardy jedinečných kombinácií obrázok-orez. Celý tréningový proces spotrebuje odhadom 10 000-15 000 GPU-dní výpočtov. Počas tréningu je 10% dávok homogénnych ťahov z ImageNet-1k (na udržanie výkonu na štandardných benchmarkoch), zatiaľ čo 90% je heterogénnych ťahov z celého fondu LVD-1689M, čo je ablačne demonštrovaný optimálny pomer miešania.
Tréningové ciele. Stratová funkcia predtréningu DINOv3 kombinuje tri zložky. DINO strata (L_DINO) aplikuje Sinkhorn-Knopp zhlukovanie v štýle SwAV na výstupy tokenov [CLS] z globálnych orezov, pričom porovnáva priradenia prototypov medzi študentom a učiteľom. Algoritmus Sinkhorn beží 3 iterácie na vytvorenie mäkkých pseudo-štítkov. iBOT strata (L_iBOT) pracuje na úrovni výrezov – náhodné výrezy v lokálnych orezoch sú maskované a študent musí predpovedať normalizované vlastnosti výrezov učiteľa pre tieto maskované pozície. Tento cieľ maskovaného modelovania obrázkov núti model učiť sa lokálne textúrne a štruktúrne informácie potrebné pre úlohy hustej predikcie. Koleo regularizátor (L_Koleo) rovnomerne rozprestiera vloženia tokenov [CLS] po hyperguli minimalizáciou súčtu kosínusových podobností medzi všetkými pármi vložení v dávke, čím bráni kolapsu reprezentácie a zabezpečuje, že priestor vlastností je dobre využitý. Kombinovaná strata predtréningu je: L_Pre = L_DINO + L_iBOT + 0,1 x L_Koleo. Po 1M iteráciách predtréningu nasleduje fáza dolaďovania 200K dodatočných iterácií, ktorá zahŕňa Gram anchoring stratu (L_Gram) s váhou 2, ktorá zachováva kvalitu hustých vlastností počas dlhého tréningu.
Destilácia do menších modelov. Keď je učiteľský model ViT-7B plne natrénovaný, je zmrazený a používa sa ako cieľ na destiláciu reprezentácií do sady menších, praktickejších modelov. Proces destilácie zrkadlí nastavenie predtréningu: študentské modely (ViT-S, ViT-B, ViT-L, ViT-H+, varianty ConvNeXt) sú trénované tak, aby zodpovedali výstupným vlastnostiam učiteľa pomocou rovnakej stratovej funkcie (L_DINO + L_iBOT + 0,1 x L_Koleo), ale s učiteľom zmrazeným a aktualizáciou EMA učiteľa vynechanou. Meta AI implementuje multi-študentskú destiláciu, ktorá efektívne trénuje viacero študentských modelov súčasne – učiteľ spracuje každý obrázok raz a všetci študenti dostanú rovnaké výstupy učiteľa, čo umožňuje paralelizáciu výpočtu dávkovej straty naprieč študentmi. To znižuje celkové výpočtové náklady na výrobu celej rodiny modelov približne o 60% v porovnaní s destiláciou každého študenta postupne. Študentský model ViT-Base (86M parametrov), ktorý TarmacView používa ako svoju základnú sieť, dosahuje 98,7% presnosti lineárnej sondy učiteľa ViT-7B na ImageNet-1k, pričom vyžaduje približne 80x menej FLOPs na inferenciu.
768-rozmerné vloženia
768-rozmerné vloženie vytvorené DINOv3 ViT-B/16 pre každý token (1 CLS + 4 registračné + 196 výrezov = 201 celkovo) predstavuje husté numerické kódovanie vizuálnej informácie vo vysokorozmernom vektorovom priestore. Každá dimenzia zachytáva špecifický vizuálny koncept alebo vlastnosť a kombinácia všetkých 768 hodnôt tvorí jedinečný podpis pre túto oblasť obrázka. Dimenziu 768 nie je ľubovoľná – vzniká z architektúry ViT-Base, kde je skrytá dimenzia nastavená na 768, čo poskytuje dostatočnú kapacitu na kódovanie zložitých vizuálnych vzorov pri zachovaní výpočtovej zvládnuteľnosti. Pre porovnanie, ViT-Small používa 384 dimenzií, ViT-Large 1024 a ViT-7B 4096.
Vloženie CLS tokenu. 768-rozmerné vloženie tokenu [CLS] na výstupe 12. vrstvy transformeru kóduje globálny obsah obrázka – celkovú scénu, dominantné objekty a sémantický kontext. Toto vloženie je extrahované a používané pre klasifikačné úlohy na úrovni obrázka. V pipeline TarmacView je vloženie CLS vložené do ľahkého lineárneho klasifikátora (768 na N tried, kde N je počet typov povrchov alebo známok kvality) trénovaného na označených súboroch údajov infraštruktúry. Vloženie CLS z DINOv3 vykazuje silné vlastnosti generalizácie domény – modely trénované na tomto vložení generalizujú na neviditeľné typy infraštruktúry výrazne lepšie ako vloženia z riadených základných sietí. Presnosť lineárnej sondy DINOv3 ViT-B/16 na ImageNet-1k dosahuje 85,1% top-1 presnosť, čím prekonáva DINOv2 (83,5%) a približuje sa riadenému ViT (86,0%) napriek tomu, že počas predtréningu nikdy nevidel žiadne štítky ImageNet.
Vloženia tokenov výrezov. Každý z 196 tokenov výrezov vytvára samostatné 768-rozmerné vloženie, ktoré tvorí priestorovú mriežku 14x14 vektorov vlastností. Tieto husté vloženia kódujú lokalizované vizuálne informácie v rámci každého výrezu 16x16 pixelov – textúru, hrany, distribúciu farieb a lokálne vzory. Vloženia výrezov sú kritickým výstupom pre úlohy hustej predikcie, ako je detekcia a segmentácia trhlín. V pipeline analýzy infraštruktúry TarmacView je mriežka vlastností 14x14 x 768-rozmerná (približne 1,5 milióna hodnôt s pohyblivou rádovou čiarkou na obrázok) spracovaná cez ľahký konvolučný dekodér, ktorý upsampluje na 224x224 a vytvára predikcie na úrovni pixelov. Každé vloženie výrezu možno interpretovať ako 768-rozmerný popis toho, ako vyzerá daná oblasť 16x16 – dva výrezy s podobným vizuálnym vzhľadom (napr. dve oblasti hladkého asfaltu) budú mať blízke vloženia v 768-rozmernom priestore (vysoká kosínusová podobnosť), zatiaľ čo vizuálne odlišné výrezy (napr. asfalt vs. betón) budú mať vzdialené vloženia (nízka kosínusová podobnosť).
Vlastnosti vložení. Vloženia DINOv3 vykazujú niekoľko vlastností, vďaka ktorým sú výnimočné pre analýzu infraštruktúry. Po prvé, sémantická hladkosť – vizuálne podobné oblasti vytvárajú blízke vloženia, ktoré tvoria spojitú varietu v 768-rozmernom priestore. To znamená, že trhliny rôznych šírok, orientácií a závažností sa všetky mapujú do spojitej oblasti priestoru vložení, vďaka čomu sú detekovateľné ako súdržná trieda skôr než ako izolované odľahlé hodnoty. Po druhé, viacúrovňová citlivosť – mechanizmus self-attention v 12 vrstvách transformeru integruje informácie naprieč rôznymi priestorovými mierkami, takže každé vloženie výrezu je informované nielen vlastným obsahom 16x16, ale aj širším kontextom okolitých výrezov a globálnej scény. Trhlina v blízkosti dilatačnej škáry je kódovaná inak ako rovnaká trhlina v strede panelu, pretože kontextové informácie sú integrované do vloženia. Po tretie, robustnosť voči osvetleniu – samoriadený tréning s rozsiahlym farebným chvením a augmentáciou zabezpečuje, že vloženia sú stabilné pri rôznych svetelných podmienkach, tieňoch a expozícii. To je kritické pre vonkajšiu inšpekciu infraštruktúry, kde sú obrázky zachytené pri nekontrolovanom prirodzenom osvetlení. Po štvrté, lineárna separovateľnosť – vloženia sú štruktúrované tak, že jednoduché lineárne klasifikátory môžu efektívne oddeliť rôzne stavy povrchu. TarmacView dosahuje 96,2% presnosť klasifikácie typu povrchu a 94,7% F1-skóre detekcie trhlín pomocou iba lineárnych sond na zmrazených vloženiach DINOv3.

Metriky vzdialenosti v priestore vložení. Voľba metriky vzdialenosti na porovnávanie vložení DINOv3 výrazne ovplyvňuje výkon následných úloh. Kosínusová podobnosť je najčastejšie používaná metrika, definovaná ako cos(theta) = (a bodka b) / (||a|| x ||b||), kde a a b sú 768-rozmerné vektory vložení. Kosínusová podobnosť sa pohybuje od -1 (opačný smer, nepravdepodobné pre vizuálne vloženia) do +1 (identický smer). Dva 768-rozmerné vektory s kosínusovou podobnosťou väčšou ako 0,9 sú vizuálne takmer identické vo svojom lokálnom obsahu, zatiaľ čo podobnosť menšia ako 0,5 indikuje podstatne odlišný vizuálny obsah. L2 (euklidovská) vzdialenosť sa tiež používa, ale vyžaduje starostlivú normalizáciu, pretože absolútna mierka vložení sa môže líšiť. Podobnosť bodového súčinu je efektívna, ale citlivá na veľkosť vektora. TarmacView používa kosínusovú podobnosť ako primárnu metriku vzdialenosti pre vyhľadávanie a porovnávanie defektov, pretože normalizuje veľkosť vloženia a zameriava sa čisto na smerové zarovnanie, ktoré je robustnejšie voči variáciám v kontraste a expozícii obrázka.
Redukcia dimenzie pre vizualizáciu. 768-rozmerný priestor vložení nemožno priamo vizualizovať, preto TarmacView aplikuje analýzu hlavných komponentov (PCA) na redukciu vložení výrezov na 3 dimenzie pre vizualizáciu a účely zabezpečenia kvality. Prvé tri hlavné komponenty vložení výrezov DINOv3 na infraštruktúrnych obrázkoch typicky zachytávajú 45-55% celkového rozptylu (PC1 približne 25%, PC2 približne 15%, PC3 približne 10%), čo naznačuje, že efektívna vnútorná dimenzionalita povrchových výrezov je oveľa nižšia ako 768. PCA vizualizácia konzistentne ukazuje odlišné zhluky pre rôzne materiály povrchu (asfalt, betón, kameninový uzáver, štrk) a spojité gradienty pre závažnosť zhoršenia povrchu (od nedotknutého po silne popraskaný). Táto vizuálna potvrditeľnosť je kritickým nástrojom zabezpečenia kvality – infraštruktúrni inžinieri môžu vizuálne skontrolovať priestor vložení, aby overili, že model správne oddeľuje relevantné stavy povrchu predtým, ako sa spoľahnú na automatizovanú klasifikáciu.
DINOv3 vs DINOv2
Evolúcia z DINOv2 na DINOv3 predstavuje komplexné škálovanie a zdokonalenie paradigmy samoriadeného vizuálneho tréningu. Pochopenie rozdielov je nevyhnutné pre odborníkov, ktorí vyberajú vhodnú základnú sieť pre svoju aplikáciu.
Rozsah tréningových údajov. Najviditeľnejším rozdielom je 12-násobný nárast tréningových údajov: LVD-142M DINOv2 (142 miliónov obrázkov) oproti LVD-1689M DINOv3 (1,689 miliardy obrázkov). Zlepšila sa však aj metodika kurácie. DINOv2 používal pipeline založený na vyhľadávaní, ktorý rozširoval kurátorské semená množiny nájdením najbližších susedov v priestore vložení ViT-H/16 predtrénovaného na ImageNet-22k. Rozšírenie začalo z 1,2 miliardy surových webových obrázkov a vytvorilo 142M kurátorských obrázkov. DINOv3 pridáva krok vyvažovania založený na zhlukovaní na vrch vyhľadávania, čím zabezpečuje, že 25 000 vizuálnych zhlukov je rovnako zastúpených. Tento krok zhlukovania bráni modelu nadmerne zastupovať vizuálne dominantné koncepty ako tváre, text a bežné objekty, zatiaľ čo podzastupuje vzácne, ale dôležité vizuálne domény, ako sú defekty infraštruktúry, lekárske snímky a satelitné pohľady.
Veľkosť a architektúra modelu. Najväčší učiteľský model DINOv2 bol ViT-g s 1 miliardou parametrov. DINOv3 škáluje toto na 7 miliárd parametrov (ViT-7B) – 7-násobný nárast kapacity modelu. Samotná architektúra bola modernizovaná. DINOv2 používal štandardné naučené absolútne pozičné vloženia, zatiaľ čo DINOv3 zavádza Rotary Position Embeddings (RoPE) pre podporu premenlivého rozlíšenia. Dopredná sieť v ViT-7B DINOv3 používa aktiváciu SwiGLU namiesto GELU, podľa architektonických inovácií z veľkých jazykových modelov. DINOv2 používal veľkosť výrezu 14 pixelov (architektúra ViT z pôvodného článku), zatiaľ čo DINOv3 používa veľkosť výrezu 16 pixelov. Táto zmena znižuje počet výrezov z 256 (224/14 = 16, 16^2 = 256) na 196 (224/16 = 14, 14^2 = 196) pre vstup 224x224, čo je 23% zníženie dĺžky sekvencie, ktoré sa premieta do približne 40% menej výpočtov self-attention (keďže pozornosť škáluje ako O(N2)). Tento architektonický zisk efektívnosti čiastočne kompenzuje zvýšené výpočtové náklady z väčších dimenzií modelu.
Kvalita hustých vlastností. Toto je najvýznamnejšie kvalitatívne zlepšenie v DINOv3. Počas dlhých tréningových harmonogramov s veľkými modelmi bolo pozorované, že vlastnosti na úrovni výrezov DINOv2 postupne degradujú – po určitom bode tréningu by mapovacie vrstvy vlastností na úrovni pixelov stratili priestorovú štruktúru a stali by sa zašumenými alebo rozmazanými, zatiaľ čo globálne vlastnosti tokenov [CLS] by sa naďalej zlepšovali. Táto degradácia robila DINOv2 menej vhodným pre úlohy hustej predikcie, ako je sémantická segmentácia a odhad hĺbky pri použití dlhých tréningových harmonogramov. Mechanizmus Gram anchoring v DINOv3 priamo rieši túto degradáciu tým, že vynucuje, aby štruktúra párovej podobnosti medzi vlastnosťami výrezov zostala stabilná počas celého tréningu. V dôsledku toho zostávajú husté vlastnosti DINOv3 ostré a sémanticky zmysluplné aj po miliónoch tréningových iterácií. Na benchmarku sémantickej segmentácie ADE20K dosahuje DINOv3 skóre mean Intersection over Union (mIoU) 54,2% so zmrazenou základnou sieťou a lineárnou sondou – zlepšenie o +6,1 bodu oproti 48,1% mIoU DINOv2. Na benchmarku párovania 3D kľúčových bodov NAVI dosahuje DINOv3 68,5% presnosť oproti 60,2% DINOv2. Na segmentácii objektov vo videu (DAVIS 2017) dosahuje DINOv3 82,3 J&F-Mean oproti 75,6 DINOv2.
| Benchmark | DINOv2 (ViT-L) | DINOv3 (ViT-B) | DINOv3 (ViT-L) | Zlepšenie |
|---|---|---|---|---|
| ImageNet-1k Lineárna sonda | 83,5% | 85,1% | 86,7% | +1,6/+3,2 |
| ADE20K Sémantická seg. (mIoU) | 48,1% | 52,3% | 54,2% | +4,2/+6,1 |
| DAVIS 2017 (J&F-Mean) | 75,6 | 79,4 | 82,3 | +3,8/+6,7 |
| Vyhľadávanie inštancií (GAP) | 42,1 | 46,8 | 53,0 | +4,7/+10,9 |
| NYU Hĺbka (RMSE dole) | 0,458 | 0,412 | 0,389 | -0,046/-0,069 |
| ObjectNet (Top-1) | 72,3% | 75,8% | 78,2% | +3,5/+5,9 |
Tabuľka vyššie demonštruje, že model ViT-Base DINOv3 (86M parametrov, používaný TarmacView) už prekonáva oveľa väčší model ViT-Large DINOv2 (304M parametrov) na každom benchmarku, pričom je 3,5x menší a výrazne výpočtovo efektívnejší pre inferenciu.
Rozdiely v licenciách. DINOv2 bol vydaný pod licenciou Apache 2.0, štandardnou open-source licenciou, ktorá povoľuje voľné používanie, úpravy a distribúciu na akýkoľvek účel vrátane komerčných aplikácií. DINOv3 je vydaný pod licenciou DINOv3, vlastnou licenciou špecifickou pre vydanie modelu Meta AI. Zatiaľ čo licencia DINOv3 povoľuje komerčné použitie, obsahuje dodatočné podmienky týkajúce sa uvedenia autorstva a prijateľného použitia. Vlastná licencia vyvolala diskusiu v komunite open-source – issue #31 na repozitári dinov3 konkrétne žiada o vydanie pod štandardnejšou licenciou, ako je Apache 2.0. Odborníci by si mali pred nasadením DINOv3 v komerčných produktoch preštudovať úplný text LICENSE.md na GitHub repozitári. Pre prípad použitia TarmacView licencia DINOv3 povoľuje zamýšľanú komerčnú aplikáciu s príslušným uvedením autorstva.
Dolaďovanie DINOv3 pre doménové úlohy
Zatiaľ čo DINOv3 dosahuje najmodernejší výkon so zmrazenou základnou sieťou (lineárna sonda alebo k-NN klasifikátor), niektoré infraštruktúrne aplikácie profitujú z dolaďovania základnej siete na doménovo špecifických údajoch. Voľba medzi zmrazeným a doladeným prístupom závisí od veľkosti súboru údajov, špecifickosti úlohy a výpočtového rozpočtu.
Zmrazená základná sieť (lineárne sondovanie). Najjednoduchším a výpočtovo najefektívnejším prístupom je zmrazenie váh DINOv3 a trénovanie iba lineárneho klasifikátora na extrahovaných vloženiach. Pre model ViT-B/16 vytvárajúci 768-rozmerné vloženia CLS pozostáva lineárny klasifikátor presne z 768 x N parametrov, kde N je počet výstupných tried. Pre 5-triednu úlohu klasifikácie typu povrchu je to len 768 x 5 = 3 840 trénovateľných parametrov – tréning konverguje v priebehu niekoľkých minút na CPU a vyžaduje len 50 označených príkladov na triedu na dosiahnutie dobrých výsledkov. Prístup so zmrazenou základnou sieťou sa odporúča, keď je cieľová doména dobre pokrytá predtréningovými údajmi DINOv3, ktoré zahŕňajú prirodzené obrázky, webové obrázky a rôzne vizuálne domény. Pre analýzu povrchu infraštruktúry používa TarmacView zmrazené vloženia DINOv3 s lineárnou sondou na klasifikáciu typu povrchu (asfalt, betón, kompozit, kameninový uzáver, štrk) a dosahuje 96,2% presnosť naprieč týmito triedami. Kľúčovou výhodou je, že základná sieť DINOv3 poskytuje univerzálne vizuálne vlastnosti, ktoré generalizujú naprieč doménami bez akéhokoľvek doménovo špecifického tréningu.
Ľahké dolaďovanie (Adapter / LoRA). Pre úlohy, kde zmrazená základná sieť nedosahuje dostatočnú presnosť – typicky vysoko špecializované domény s vizuálnymi charakteristikami výrazne odlišnými od prirodzených obrázkov – metódy parametrovovo efektívneho dolaďovania (PEFT) pridávajú malý počet trénovateľných parametrov, pričom väčšina základnej siete zostáva zmrazená. Low-Rank Adaptation (LoRA) pridáva páry matíc rozkladu hodnosti (A a B, kde aktualizácia váh delta_W = AB) k projekčným maticiam dotazu a hodnoty v každej vrstve self-attention. Pre model ViT-B/16 pridáva LoRA s hodnosťou r=8 približne 0,5M trénovateľných parametrov (menej ako 0,6% z celkových 86M) distribuovaných naprieč všetkými 12 vrstvami transformeru. Trénovanie iba týchto parametrov LoRA počas 10-50 epoch na doménovo špecifickom súbore údajov s 1 000-5 000 označenými obrázkami typicky prináša 3-8% zlepšenie presnosti oproti lineárnemu sondovaniu, pričom vyžaduje len 1-2 hodiny na jednom GPU. TarmacView používa LoRA dolaďovanie pre špecializované úlohy klasifikácie defektov, ako je rozlišovanie medzi rôznymi typmi trhlín (priečne, pozdĺžne, blokové, aligátorové, reflexné), kde nuansované vizuálne rozdiely profitujú z doménovo špecifickej adaptácie.
Úplné dolaďovanie. Keď je k dispozícii dostatok označených údajov (10 000+ obrázkov na triedu) a úloha vyžaduje maximálnu presnosť, je možné doladiť celú základnú sieť DINOv3. To aktualizuje všetkých 86M parametrov ViT-B/16 pomocou označeného súboru údajov. Úplné dolaďovanie typicky vyžaduje 4-8 GPU s 16-32GB VRAM každý, distribuovaný tréning s PyTorch DDP a starostlivé ladenie hyperparametrov (rýchlosť učenia typicky 5x10^-6 až 5x10^-5, úbytok váh 0,01-0,1, kosínusový plán rýchlosti učenia s 10% zahrievaním). Úplné dolaďovanie môže priniesť 2-5% dodatočnej presnosti oproti LoRA na vysoko špecializovaných úlohách, ale nesie riziko katastrofického zabúdania – model môže stratiť všeobecné vizuálne znalosti získané počas samoriadeného predtréningu. Na zmiernenie tohto rizika sa odporúča postupné odmrazovanie (najprv odmrazenie poslednej vrstvy, potom postupne skorších vrstiev) a diskriminácia rýchlosti učenia (nižšie rýchlosti učenia pre skoršie vrstvy, vyššie pre neskoršie). DINOv3 tiež navrhuje post-hoc protokol adaptácie na vysoké rozlíšenie pri dolaďovaní: pokračovať v tréningu 10K krokov na zmiešaných veľkostiach globálnych orezov pomocou iBOT straty a Gram anchoring, čo zabezpečuje, že základná sieť generalizuje zo štandardného rozlíšenia 224px až na veľmi vysoké rozlíšenia (4096px) pri zachovaní ostrých mapovacích vrstiev vlastností.
Rozhodovacia matica zmrazenie vs. dolaďovanie.
| Scenár | Veľkosť súboru údajov | Odporúčaný prístup | Čas tréningu | Očakávaná presnosť vs. zmrazené |
|---|---|---|---|---|
| Klasifikácia typu povrchu | 50-200 obrázkov/trieda | Zmrazené + lineárna sonda | menej ako 1 hodina CPU | Základná línia |
| Klasifikácia typu trhlín | 500-5 000 obrázkov | LoRA (hodnosť 8-16) | 1-4 hodiny GPU | +3-8% |
| Hodnotenie závažnosti defektov | 5 000-20 000 obrázkov | LoRA alebo čiastočné dolaďovanie | 4-12 hodín GPU | +5-12% |
| Detekcia nových defektov | 10 000+ obrázkov | Úplné dolaďovanie | 1-3 dni multi-GPU | +8-15% |
Úvahy o doménovej adaptácii. Snímky inšpekcie infraštruktúry sa líšia od prirodzených obrázkov v niekoľkých smeroch: konzistentné uhly kamery (nadir/dronová perspektíva), špecifické svetelné podmienky (vonkajšie, ale premenlivé), opakujúce sa vzory (textúra vozovky) a úzka vizuálna doména (cesty, dráhy, mostovky). Samoriadený predtréning DINOv3 na rôznorodých údajoch znamená, že už videl mnoho podobných vizuálnych vzorov, ale doménová medzera medzi webovými obrázkami a infraštruktúrnymi snímkami stále existuje. Experimenty TarmacView ukazujú, že zmrazené vloženia DINOv3 dosahujú 94,7% F1-skóre detekcie trhlín na obrázkoch letiskových vozoviek bez akéhokoľvek dolaďovania, čo indikuje vynikajúci doménový prenos. Avšak pre detekciu špecializovaných defektov, ako je posun škár v betónových vozovkách alebo rozpad v asfaltových obrusných vrstvách, LoRA dolaďovanie s 2 000-5 000 označenými príkladmi z cieľovej domény zlepšuje F1-skóre o 5-8 percentuálnych bodov. Doladený model tiež vykazuje zlepšenú robustnosť voči doménovo špecifickým artefaktom, ako sú stopy pneumatík, gumové usadeniny a značenie dráh, ktoré môžu zmiasť generické predtrénované vlastnosti.
DINOv3 ako extraktor vlastností
Používanie DINOv3 ako extraktora vlastností je najpriamejší a najpoužívanejší vzor nasadenia, najmä pre organizácie, ktoré nemajú výpočtové zdroje na rozsiahly tréning. V tejto paradigme DINOv3 spracuje každý obrázok jediným dopredným prechodom, čím vytvára vloženia, ktoré sú uložené do vyrovnávacej pamäte a znovu použité pre viacero následných úloh.
Pipeline extrakcie vlastností. Štandardný pipeline na extrakciu vlastností DINOv3 v pracovnom postupe analýzy infraštruktúry TarmacView funguje nasledovne. Po prvé, vstupný obrázok (typicky 4K dronový obrázok pokrývajúci 10m x 7m úsek dráhy) je rozdelený na prekrývajúce sa dlaždice 224x224 s 50% prekrytím, aby sa zabezpečilo pokrytie okrajov. Každá dlaždica je normalizovaná pomocou štandardného priemeru ImageNet (0,485, 0,456, 0,406) a štandardnej odchýlky (0,229, 0,224, 0,225). Normalizovaná dlaždica prechádza cez model DINOv3 ViT-B/16 pomocou PyTorch s presnosťou FP16 pre pamäťovú efektívnosť. Model vytvára 201 tokenov (1 CLS + 4 registračné + 196 výrezov), každý s dimenziou 768. Vloženie CLS tokenu (768-rozmerné) je extrahované pre globálnu klasifikáciu dlaždice. 196 vložení tokenov výrezov je preformátovaných do priestorovej mriežky 14x14 768-rozmerných vektorov pre hustú predikciu. Všetky vloženia zo všetkých dlaždíc sú agregované do databázy vlastností indexovanej priestorovými súradnicami, čo umožňuje analýzu naprieč dlaždicami a mapovanie veľkých plôch.
Výpočtová efektívnosť. Extrakcia vlastností so zmrazeným DINOv3 ViT-B/16 vyžaduje približne 12,5 GFLOPs na obrázok 224x224 – porovnateľné s ResNet-50 (7,7 GFLOPs) alebo EfficientNet-B4 (12,0 GFLOPs). Na NVIDIA RTX 4090 (FP16) je priepustnosť inferencie približne 180 obrázkov/sekundu. Na NVIDIA Jetson Orin NX 16GB (edge zariadenie) je priepustnosť približne 25 obrázkov/sekundu. Pre typický 4K dronový obrázok (3840x2160 pixelov), rozdelený na dlaždice 224x224 s 50% prekrytím, je potrebných približne 160 dlaždíc. Celkový čas spracovania na RTX 4090 je menej ako 1 sekunda na 4K obrázok. Náklady na extrakciu vlastností sú jednorazovým výdavkom – akonáhle sú vloženia uložené, každá následná úloha (klasifikácia, segmentácia, vyhľadávanie) pridáva zanedbateľnú dodatočnú výpočtovú záťaž (milisekundy na obrázok).
Faiss Embedding Database pre vyhľadávanie podobnosti. TarmacView ukladá extrahované vloženia DINOv3 v indexe FAISS (Facebook AI Similarity Search) pre efektívne vyhľadávanie a analýzu založenú na podobnosti. FAISS je knižnica vyvinutá Meta AI pre efektívne vyhľadávanie podobnosti a zhlukovanie hustých vektorov, schopná prehľadávať databázy v miliardovej mierke v milisekundách. Databáza vložení indexuje dlaždice povrchu dráhy podľa ich 768-rozmerných vložení CLS DINOv3. Keď príde nový inšpekčný obrázok, jeho vloženie je vypočítané a porovnané s celou databázou, aby sa našli najviac vizuálne podobné historické dlaždice. To umožňuje analýzu trendov stavu – nájdenie podobných stavov povrchu, ktoré sa vyskytli v minulosti, a ich následných trajektórií zhoršovania. Index FAISS používa IVF (Inverted File) so 4096 centroidmi a graf HNSW (Hierarchical Navigable Small World) pre hrubý kvantizátor, čím dosahuje viac ako 99% recall pri čase dopytu 10ms pre databázu 10 miliónov vložení dlaždíc. Pre všetky porovnania vložení sa používa metrika kosínusovej podobnosti.
Detekcia defektov z niekoľkých príkladov (Few-Shot). Vloženia DINOv3 umožňujú efektívnu detekciu defektov z niekoľkých príkladov – identifikáciu nových typov defektov z iba 1-5 príkladových obrázkov. Keď sa v teréne vyskytne nový typ poškodenia povrchu (napr. špecifický vzor trhlín alebo povrchová usadenina), inšpektor zachytí 1-5 príkladových obrázkov a označí oblasti defektov. Vloženia výrezov DINOv3 z týchto príkladových oblastí sú spriemerované, čím sa vytvorí prototypový vektor defektu (768-rozmerný). Nové obrázky sú potom spracované a každé vloženie výrezu je porovnané s prototypom pomocou kosínusovej podobnosti. Výrezy s podobnosťou nad prahom (typicky 0,75-0,85, stanovené empiricky) sú označené ako zodpovedajúce typu defektu. Tento prístup založený na prototypoch dosahuje 89-93% presnosť detekcie pre nové defekty z iba 3 príkladov, bez akéhokoľvek pretrénovania alebo dolaďovania. To je kritické pre inšpekciu infraštruktúry, kde sa často stretávame s novými, neočakávanými typmi poškodení, ktoré musia byť zdokumentované bez oneskorenia pracovného postupu inšpekcie kvôli zberu tréningových údajov.
Husté tokeny výrezov pre segmentáciu
196 vložení tokenov výrezov vytvorených DINOv3 pre obrázok 224x224 tvorí priestorovú mriežku 14x14 768-rozmerných vektorov vlastností. Táto mriežka je primárnou reprezentáciou pre úlohy hustej predikcie – sémantickú segmentáciu, detekciu trhlín a lokalizáciu defektov – kde musí byť každý pixel vo vstupnom obrázku klasifikovaný.
Štruktúra mriežky a rozlíšenie. Pre vstup 224x224 pixelov s výrezmi 16x16 pokrýva každý z 196 tokenov výrezov oblasť 16x16 pixelov vstupu. Výsledná mriežka 14x14 má krok 16 pixelov medzi stredmi susedných výrezov. To znamená, že mapa vlastností DINOv3 má približne 1/256 priestorového rozlíšenia vstupného obrázka (14x14 = 196 vs 224x224 = 50 176 pixelov). Mechanizmus self-attention kompenzuje túto priestorovú kompresiu integráciou informácií naprieč výrezmi – každé vloženie výrezu je informované okolitou mriežkou 14x14 prostredníctvom multi-head attention, čo poskytuje efektívne povedomie o kontexte. Pre segmentačné úlohy musí byť mriežka 14x14 upsamplovaná na pôvodné rozlíšenie obrázka. TarmacView používa ľahký konvolučný dekodér s 3 vrstvami: transponovaná konvolúcia (14x14 na 28x28, 384 kanálov), transponovaná konvolúcia (28x28 na 56x56, 192 kanálov), bilineárne upsamplovanie (56x56 na 224x224) a finálna 1x1 konvolúcia na logity na triedu. Tento dekodér pridáva len 2,3M parametrov k základnej sieti s 86M parametrami.
Kvalita hustých vlastností DINOv3 vs DINOv2. Kritická inovácia v DINOv3 – Gram anchoring – priamo cieli na kvalitu týchto hustých vlastností výrezov. Počas dlhých tréningových behov by vlastnosti výrezov DINOv2 vykazovali to, čo autori opisujú ako degradáciu hustých mapovacích vrstiev: vloženia výrezov by sa stali menej sémanticky zmysluplnými, štruktúra podobnosti výrez-výrez by degradovala a kvalita segmentácie by sa ustálila alebo dokonca znížila napriek pokračujúcemu zlepšovaniu globálnej klasifikácie. Gram anchoring zachováva Gramovu maticu vlastností výrezov (štruktúra párovej podobnosti) jej zarovnaním s referenciou z raného tréningu, čím zabezpečuje, že priestorové a sémantické vzťahy medzi výrezmi zostanú stabilné. Praktickým výsledkom je, že vlastnosti výrezov DINOv3 zostávajú ostré a sémanticky koherentné aj pri vysokých rozlíšeniach. Článok DINOv3 demonštruje PCA vizualizácie vlastností výrezov DINOv3 pre vysokorozlíšené letecké snímky – cesty, budovy, vegetácia a vodné plochy sú jasne separovateľné v priestore vlastností, čo demonštruje výnimočnú kvalitu vlastností pre pochopenie scény.

Sémantická segmentácia s lineárnymi sondami. Jednou z najpôsobivejších schopností DINOv3 je vykonávanie sémantickej segmentácie pomocou iba lineárnych sond na zmrazených vlastnostiach výrezov – bez dolaďovania základnej siete. Lineárna segmentačná hlava aplikuje 1x1 konvolúciu (alebo ekvivalentne, lineárnu vrstvu na výrez) na mapovanie každého vloženia výrezu z 768 dimenzií na C výstupných tried. To vytvára segmentačnú mapu 14x14, ktorá je upsamplovaná na rozlíšenie obrázka. Napriek jednoduchosti tohto prístupu (iba 768 x C trénovateľných parametrov pre celú segmentačnú hlavu) dosahuje DINOv3 52,3% mIoU na ADE20K s ViT-B, čím prekonáva mnohé metódy, ktoré dolaďujú celú základnú sieť. To je umožnené výnimočnou lineárnou separovateľnosťou vlastností výrezov DINOv3 – priestor vložení je už štruktúrovaný tak, že rôzne sémantické kategórie zaberajú odlišné, lineárne separovateľné oblasti.
Segmentácia trhlín v infraštruktúre. TarmacView aplikuje husté tokeny výrezov DINOv3 na segmentáciu trhlín na úrovni pixelov v obrázkoch dráh a vozoviek. Mriežka 14x14 768-rozmerných vložení výrezov zachytáva lokálnu textúru trhlín (v rámci každého výrezu 16x16) aj kontextové informácie (ktoré výrezy trhlina spája). Segmentačná hlava je ľahká sieť s 3 transponovanými konvolučnými vrstvami, ktoré upsamplujú mriežku vlastností 14x14 na rozlíšenie 224x224. Tréning vyžaduje približne 500 označených obrázkov segmentácie trhlín (dlaždice 224x224 s maskami trhlín na úrovni pixelov) a konverguje za 2-3 hodiny na jednom RTX 3060 GPU. Výsledný model dosahuje 94,7% F1-skóre pre detekciu trhlín v porovnaní s 88,2% pri ResNet-50 a 91,3% pri DINOv2 za rovnakých tréningových podmienok. F1-skóre sa zlepšuje na 96,8% pri použití protokolu adaptácie na vysoké rozlíšenie (dolaďovanie DINOv3 pri vstupnom rozlíšení 512px s odporúčaným 10K krokovým harmonogramom). Presnosť odhadu šírky trhlín (meraná ako stredná absolútna chyba v mm) je 0,8mm pre DINOv3 oproti 1,4mm pre DINOv2 a 2,1mm pre ResNet-50.
Registračné tokeny pre absorpciu pozadia. 4 registračné tokeny DINOv3 zohrávajú špecifickú úlohu v kvalite hustých vlastností. Tieto tokeny sú ďalšie naučiteľné tokeny (dimenzie 768), ktoré sú pridané na začiatok sekvencie spolu s CLS tokenom. Počas self-attention môžu registračné tokeny venovať pozornosť a byť adresované všetkými tokenmi výrezov. Kľúčovým poznatkom je, že niektoré vizuálne výrezy v obrázku obsahujú odľahlé informácie alebo informácie o pozadí – obloha, vzdialené objekty alebo jednotvárne oblasti bez textúry – ktoré, ak by boli nútené byť kódované tokenmi výrezov, by degradovali kvalitu priestoru vlastností. Registračné tokeny fungujú ako absorpčné pamäťové sloty, ktoré zachytávajú tento neinformatívny obsah, čo umožňuje tokenom výrezov zamerať sa na sémanticky zmysluplné oblasti obrázka. Praktickým efektom je merateľné zlepšenie kvality hustých vlastností: +1,8 mIoU na ADE20K a výrazne čistejšie mapy podobnosti výrezov, najmä pre obrázky s veľkými jednotvárnymi oblasťami pozadia. Pre inšpekciu infraštruktúry, kde obrázky často obsahujú veľké plochy jednotvárnej textúry vozovky, pomáhajú registračné tokeny udržiavať čisté vlastnosti výrezov, ktoré sa zameriavajú na vzory poškodenia skôr než na textúru pozadia.
MPS a GPU tréning
Infraštruktúra tréningu a inferencie DINOv3 podporuje viacero hardvérových backendov, od veľkých GPU klastrov po edge zariadenia a Apple Silicon Mac.
GPU tréning vo veľkom meradle. Učiteľský model ViT-7B bol trénovaný na 256 NVIDIA A100 80GB SXM4 GPU s NVLink prepojeniami, poskytujúcimi približne 20 TB/s agregovanej šírky pásma GPU pamäte a 25 PFLOPS FP16 výpočtov. Tréning používa Fully Sharded Data Parallel (FSDP) – natívnu stratégiu PyTorch na rozdeľovanie, ktorá rozdeľuje parametre modelu, gradienty a stavy optimalizátora naprieč všetkými GPU. S FSDP a tréningom so zmiešanou presnosťou (BF16) sa 7B model zmestí do agregovanej pamäte 256 GPU (256 x 80GB = 20,48 TB), aj keď každý jednotlivý GPU pojme len približne 2-3% parametrov modelu. Knižnica xFormers (vyvinutá Meta AI) poskytuje pamäťovo efektívne implementácie pozornosti vrátane pamäťovo efektívnej pozornosti (znižuje pamäť pozornosti z O(N2) na O(N)) a blokovo-riedkych vzorov pozornosti. Kombinácia FSDP, BF16, xFormers a gradient checkpointing znižuje požiadavku na pamäť na GPU pre ViT-7B z odhadovaných 250GB (plná presnosť, bez optimalizácií) na približne 65GB, čo sa zmestí do kapacity 80GB A100.
Inferencia na jednom GPU. Pre praktické nasadenie beží DINOv3 ViT-B/16 (86M parametrov) efektívne na jednom NVIDIA GPU. Pri presnosti FP32 vyžaduje model približne 344MB pamäte pre parametre (86M x 4 bajty na float). S aktiváciami pre veľkosť dávky 1 (obrázok 224x224) je celková spotreba pamäte približne 1,2-1,5GB (parametre + aktivácie + medziľahlé tenzory). Pri presnosti FP16 klesá pamäť parametrov na 172MB a celková spotreba na približne 0,8-1,0GB. To znamená, že DINOv3 ViT-B/16 beží pohodlne na GPU s tak malou pamäťou VRAM ako 4GB, vrátane starších kariet ako NVIDIA GTX 1650 a NVIDIA Jetson Xavier NX. Priepustnosť na RTX 3060 (12GB) pri FP16 je približne 100 obrázkov/sekundu. Na NVIDIA A100 presahuje priepustnosť 400 obrázkov/sekundu, čo umožňuje spracovanie 4K dronových snímok v reálnom čase pri rýchlostiach dekompozície dlaždíc.
Podpora Apple Silicon (MPS). DINOv3 je plne kompatibilný s backendom Metal Performance Shaders (MPS) v PyTorch, ktorý poskytuje GPU akcelerovanú inferenciu na Apple Silicon Macoch (M1, M2, M3, M4 séria). Backend MPS mapuje PyTorch operácie na architektúru GPU Apple prostredníctvom frameworku Metal. Výkon na M2 Pro MacBook Pro (19-jadrové GPU, 32GB unified memory) dosahuje približne 25-35 obrázkov/sekundu pre ViT-B/16 pri presnosti FP16 – dostatočné pre dávkové spracovanie veľkých kolekcií obrázkov. Na M2 Ultra Mac Studio (76-jadrové GPU, 192GB unified memory) dosahuje priepustnosť približne 70-90 obrázkov/sekundu. Spotreba pamäte je efektívna, pretože architektúra unified memory Apple eliminuje réžiu prenosu údajov medzi CPU a GPU. TarmacView používa MPS akcelerovaný DINOv3 na spracovanie údajov na mieste v teréne, čo umožňuje inšpektorom spúšťať inferenciu priamo na ich MacBookoch bez potreby špecializovaného GPU hardvéru. Väčšia unified memory Apple Silicon (až 192GB na M2 Ultra) tiež umožňuje spracovanie obrázkov s veľmi vysokým rozlíšením bez dlaždíc – obrázok 4096x4096 vytvára 256x256 výrezov = 65 536 tokenov, čo vyžaduje približne 8GB pamäte ekvivalentnej VRAM v združenom pamäťovom fonde.
Distribuovaná inferencia. Pre rozsiahle projekty inšpekcie infraštruktúry spracúvajúce milióny obrázkov je potrebná distribuovaná inferencia naprieč viacerými GPU alebo strojmi. DINOv3 podporuje PyTorch DistributedDataParallel (DDP) pre multi-GPU inferenciu na jednom serveri, modelový paralelizmus (pipeline paralelizmus pre ViT-7B) a Ray (open-source framework pre distribuované výpočty) pre viacuzlovú distribuovanú inferenciu. Nasadenie TarmacView používa Kubernetes s GPU uzlovými fondmi spúšťajúcimi inferenciu DINOv3 ako škálovateľnú mikroslužbu. Každý inferenčný pod beží na jednom T4 GPU (16GB VRAM) a spracúva približne 70 obrázkov/sekundu. Klaster 50 podov dosahuje priepustnosť 3 500 obrázkov/sekundu, čo umožňuje spracovanie 500-obrázkovej obhliadky dráhy za menej ako 3 sekundy. Inferenčný server používa TorchServe na obsluhu modelu s dynamickým dávkovaním (veľkosti dávok 4-16 v závislosti od objemu požiadaviek) a presnosťou FP16 na maximalizáciu priepustnosti.
Edge nasadenie s NVIDIA Jetson. Pre terénne nasadené inšpekčné systémy používajúce drony alebo pozemné vozidlá môže byť DINOv3 ViT-B/16 nasadený na NVIDIA Jetson edge zariadeniach. Modul Jetson Orin NX 16GB (100 TOPS AI výkon) dosahuje 15-25 obrázkov/sekundu s DINOv3 ViT-B/16 pri FP16, v závislosti od režimu napájania (15W vs 25W vs 40W). Model je optimalizovaný pomocou TensorRT – optimalizátora inferencie hlbokého učenia NVIDIA, ktorý spája vrstvy, optimalizuje výber jadier a kvantizuje na FP16 alebo INT8. S TensorRT INT8 kvantizáciou sa rýchlosť inferencie zvyšuje na 30-40 obrázkov/sekundu na Jetson Orin NX s menej ako 1% degradáciou presnosti v porovnaní s FP32. Jetson Xavier NX (21 TOPS) dosahuje 8-12 obrázkov/sekundu s TensorRT FP16. Toto edge nasadenie umožňuje detekciu trhlín v reálnom čase počas letu dronu – kamera dronu zachytáva obrázky a DINOv3 ich spracúva na palube, pričom označuje potenciálne defekty v priebehu niekoľkých sekúnd od zachytenia bez potreby cloudového pripojenia.
Open-Source dostupnosť a licencovanie
DINOv3 bol vydaný spoločnosťou Meta AI v roku 2025 ako open-source projekt, čím pokračuje v tradícii spoločnosti verejne vydávať najmodernejšie výskumné modely AI. Pochopenie licenčných a distribučných podmienok je nevyhnutné pre organizácie plánujúce nasadiť DINOv3 v komerčných produktoch.
Kód a váhy modelu. Kompletný kód DINOv3 je k dispozícii na GitHub na adrese facebookresearch/dinov3 (10 700+ hviezdičiek k polovici roku 2025). Repozitár obsahuje kompletný tréningový a vyhodnocovací kód (PyTorch), definície modelov, pipeline spracovania údajov, vyhodnocovacie skripty a predtrénované váhy pre všetkých 12 vydaných variantov modelu. Váhy modelu sú tiež k dispozícii na Hugging Face Hub pod menným priestorom facebook/dinov3-*, vrátane: facebook/dinov3-vits16-pretrain-lvd1689m (ViT-Small, 21M parametrov) facebook/dinov3-vitb16-pretrain-lvd1689m (ViT-Base, 86M parametrov) – primárny model používaný TarmacView facebook/dinov3-vitl16-pretrain-lvd1689m (ViT-Large, 304M parametrov) facebook/dinov3-vith16-pretrain-lvd1689m (ViT-H+, ~1,5B parametrov) facebook/dinov3-vit7b-pretrain-lvd1689m (ViT-7B, 7B parametrov) Plus varianty ConvNeXt (T, S, B, L) a satelitne špecifické modely (SAT-493M)
Prístup na Hugging Face vyžaduje, aby používatelia súhlasili s podmienkami Meta a poskytli kontaktné informácie, ktoré sú zhromažďované, ukladané a spracúvané v súlade so Zásadami ochrany osobných údajov Meta. Váhy modelu sú distribuované ako súbory PyTorch state_dict kompatibilné s knižnicou Hugging Face Transformers (integrácia dostupná cez AutoModel.from_pretrained()).
Licencia DINOv3. DINOv3 je vydaný pod licenciou DINOv3, vlastnou open-source licenciou vyvinutou Meta AI špecificky pre toto vydanie modelu. To sa líši od DINOv2, ktorý bol vydaný pod štandardnou licenciou Apache 2.0. Licencia DINOv3 povoľuje: Používanie, reprodukciu, úpravy a distribúciu modelu a kódu Komerčné použitie vrátane integrácie do produktov a služieb Sublicencovanie odvodených diel za rôznych podmienok
Licencia DINOv3 zahŕňa špecifické požiadavky na uvedenie autorstva (musia byť zachované autorské práva) a zásady prijateľného použitia, ktoré zakazujú používanie modelu na určité účely, vrátane dohľadu, ktorý porušuje ľudské práva, autonómnych zbraní a porušovania platných zákonov. Licencia vyvolala diskusiu v komunite vývojárov – issue #31 na repozitári dinov3 konkrétne žiada o vydanie pod štandardnejšou licenciou, ako je Apache 2.0, aby sa zjednodušila právna zhoda pre podniky so zavedenými politikami open-source licencií. TarmacView preskúmalo licenciu DINOv3 a určilo, že aplikácie inšpekcie infraštruktúry a detekcie defektov sú plne povolené pod jej podmienkami.
Porovnanie s licenciami iných základných sietí.
| Základná sieť | Licencia | Komerčné použitie | Vyžaduje uvedenie autorstva | Vlastné podmienky |
|---|---|---|---|---|
| DINOv3 | Licencia DINOv3 | Áno | Áno | Áno |
| DINOv2 | Apache 2.0 | Áno | Áno | Nie |
| ViT (Google) | Apache 2.0 | Áno | Áno | Nie |
| CLIP (OpenAI) | MIT | Áno | Áno | Nie |
| OpenCLIP | MIT | Áno | Áno | Nie |
| SAM (Meta) | Apache 2.0 | Áno | Áno | Nie |
| ConvNeXt | MIT | Áno | Áno | Nie |
Výpočtové náklady reprodukcie. Náklady na tréning DINOv3 ViT-7B sa odhadujú na 2-5 miliónov USD (približne 15 000 GPU-dní na A100-80GB pri cloudových cenách na požiadanie). Destilované menšie modely (ViT-B, ViT-L) sú výrazne lacnejšie na reprodukciu, ale stále vyžadujú podstatný výpočtový výkon – destilácia ViT-Base z ViT-7B na LVD-1689M vyžaduje približne 500-800 GPU-dní. Avšak pre odborníkov dostupnosť predtrénovaných váh eliminuje potrebu akéhokoľvek tréningového výpočtu – váhy je možné stiahnuť a okamžite použiť na inferenciu za cenu jedného GPU akejkoľvek generácie. Táto dostupnosť je základnou hodnotovou ponukou základných modelov: obrovské tréningové náklady sú amortizované naprieč všetkými následnými používateľmi.
Komunitná a ekosystémová integrácia. DINOv3 profituje zo širokej integrácie do ekosystému: Hugging Face Transformers poskytuje API na pripojenie a hneď funguje, PyTorch Hub podporuje načítanie modelu cez torch.hub.load() a model je zahrnutý v zbierke modelov Torchvision pre jednoduchý prístup. Integrácia s Weights & Biases, MLflow a Neptune.ai pre sledovanie experimentov je podporovaná prostredníctvom štandardných PyTorch háčikov. Export do formátu ONNX (Open Neural Network Exchange) je podporovaný pre nasadenie do prostredí mimo PyTorch, vrátane TensorRT pre NVIDIA edge zariadenia, CoreML pre Apple zariadenia a TFLite pre mobilné nasadenie. Platforma inšpekcie infraštruktúry TarmacView integruje DINOv3 prostredníctvom pipeline Hugging Face Transformers s optimalizáciou TensorRT pre edge nasadenie na Jetson Orin NX a akceleráciou MPS pre terénne notebooky macOS.
Záver. DINOv3 predstavuje generačný skok v samoriadených vizuálnych základných modeloch, dosahujúc najmodernejší výkon naprieč globálnymi a hustými predikčnými úlohami prostredníctvom bezprecedentného rozsahu (1,689 miliardy obrázkov, 7 miliárd parametrov) a inovácie Gram anchoring, ktorá zachováva kvalitu hustých vlastností. Pre analýzu povrchov infraštruktúry poskytuje variant DINOv3 ViT-B/16 768-rozmerný priestor vložení s výnimočnou sémantickou štruktúrou – typy povrchov, vzory trhlín a vlastnosti defektov sú lineárne separovateľné v priestore vložení, čo umožňuje presnú klasifikáciu a detekciu s inferenciou so zmrazenou základnou sieťou. Open-source dostupnosť, široká hardvérová podpora (GPU, MPS, Edge) a povoľujúce licencovanie robia z DINOv3 optimálnu základnú sieť pre automatizovanú platformu inšpekcie infraštruktúry TarmacView, ktorá poskytuje najmodernejšiu presnosť detekcie defektov s minimálnymi doménovo špecifickými tréningovými údajmi a výpočtovými požiadavkami.
Často kladené otázky
- Aký je rozdiel medzi DINOv3 a DINOv2?
- DINOv3 predstavuje významný skok v škálovaní oproti DINOv2 vo viacerých dimenziách. Po prvé, tréningové dáta: DINOv2 bol trénovaný na 142 miliónoch kurátorských obrázkov (LVD-142M), zatiaľ čo DINOv3 škáluje na 1,689 miliardy obrázkov (LVD-1689M), čo je 12-násobný nárast. Po druhé, veľkosť modelu: najväčší učiteľský model DINOv2 mal 1 miliardu parametrov (ViT-g), zatiaľ čo DINOv3 trénuje učiteľa so 7 miliardami parametrov (ViT-7B). Po tretie, veľkosť výrezu: DINOv2 používal veľkosť výrezu 14 pixelov, čím vznikalo 256 tokenov výrezov na obrázok 224x224, DINOv3 používa veľkosť výrezu 16 pixelov, čím vzniká 196 tokenov výrezov. Po štvrté, pozičné vloženia: DINOv2 používal štandardné naučené absolútne pozičné kódovania, zatiaľ čo DINOv3 zavádza Rotary Position Embeddings (RoPE) s náhodným posunom boxu pre lepšiu odolnosť voči rôznym pomerom strán. Po piate, kľúčová inovácia Gram anchoring v DINOv3 zachováva kvalitu hustých mapovacích vrstiev počas dlhých tréningových harmonogramov – problém, ktorý spôsoboval degradáciu vlastností výrezov DINOv2 pri predĺženom tréningu. Po šieste, DINOv3 dosahuje +6 mIoU zlepšenie na ADE20K sémantickej segmentácii, +6,7 J a F-Mean na sledovaní videa a +10,9 GAP na vyhľadávaní inštancií v porovnaní s DINOv2.
- Ako TarmacView používa DINOv3 na analýzu povrchov infraštruktúry?
- TarmacView nasadzuje základnú sieť DINOv3 ViT-B/16 ako primárny engine na extrakciu vlastností vo svojom pipeline inšpekcie infraštruktúry. Keď dron alebo kamera zachytí obrázok povrchu dráhy, mostovky alebo cestnej vozovky, obrázok sa zmení na veľkosť 224x224 pixelov a rozdelí sa na 196 neprekrývajúcich sa výrezov 16x16. Každý výrez je lineárne vložený do 768-rozmerného vektora a spolu s CLS tokenom prechádzajú cez 12 vrstiev transformer enkodéra s multi-head self-attention. Výsledné 768-rozmerné vloženie CLS tokenu zachytáva globálne charakteristiky povrchu používané na klasifikáciu typu povrchu (asfalt, betón, kameninový uzáver atď.) a celkovej známky kvality. Súčasne 196 vložení tokenov výrezov (každé 768-rozmerné) kóduje lokalizované textúrne informácie na úrovni výrezu, ktoré TarmacView používa na detekciu trhlín na úrovni pixelov, identifikáciu vydutín, posúdenie rozpadu a meranie posunu škár. Prístup so zmrazenou základnou sieťou znamená, že váhy DINOv3 zostávajú fixné, zatiaľ čo ľahké hlavy špecifické pre úlohu (lineárne sondy alebo plytké MLP) sú trénované na označených súboroch údajov infraštruktúry. To znižuje náklady na tréning približne o 90% v porovnaní s úplným dolaďovaním pri dosahovaní najmodernejšej presnosti detekcie defektov.
- Aký hardvér je potrebný na spustenie inferencie DINOv3?
- DINOv3 ponúka modely v rôznych veľkostiach, aby vyhovovali rôznym hardvérovým obmedzeniam. Variant ViT-B/16 (86 miliónov parametrov) používaný TarmacView beží efektívne na jedinom NVIDIA GPU s aspoň 8 GB VRAM, pričom dosahuje rýchlosť inferencie 50-100 snímok za sekundu na RTX 3060 alebo vyššom. Na Apple Silicon Macoch (M1/M2/M3) poskytuje backend MPS (Metal Performance Shaders) hardvérovo akcelerovanú inferenciu približne 20-40 FPS na M2 Pro. Pre edge nasadenie beží destilovaný variant ViT-Small (21M parametrov) na NVIDIA Jetson Orin NX pri 15-30 FPS. Najväčší variant, ViT-7B, vyžaduje 4-8 NVIDIA A100 (80GB) GPU na inferenciu. DINOv3 podporuje inferenciu so zmiešanou presnosťou (FP16), ktorá znižuje spotrebu pamäte približne o 50% so zanedbateľnou stratou presnosti. Model je k dispozícii v PyTorch cez Hugging Face Transformers, pričom kontrolný bod facebook/dinov3-vitb16-pretrain-lvd1689m je štandardným vstupným bodom.
- Čo je Gram anchoring v DINOv3?
- Gram anchoring je nová regularizačná technika zavedená v DINOv3 na vyriešenie degradácie hustých mapovacích vrstiev počas dlhých tréningových harmonogramov samoriadeného učenia. Počas predĺženého tréningu štýlom DINOv2 s veľkými modelmi (ViT-L a vyššie) sa pozorovalo, že vlastnosti na úrovni výrezov strácajú svoju priestorovú štruktúru a sémantický význam – presnosť lineárnej sondy na globálnych úlohách by sa zlepšila, ale mapovacie vrstvy vlastností výrezov by sa stali zašumenými a stratili by lokalizačnú schopnosť. Gram anchoring zavádza dodatočný člen L2 straty, ktorý zarovnáva Gramovu maticu vlastností výrezov študenta so zmrazenou Gramovou maticou z raného EMA snímku učiteľa. Konkrétne, pri L2-normalizovanej matici výrezov študenta X_S a Gramovej matici učiteľa X_G (raný EMA snímok) je strata L_Gram = ||X_S X_S^T - X_G X_G^T||_F^2. Táto strata zachováva štruktúru párovej podobnosti výrezov skôr než vynucuje absolútne pozície vlastností, čo pôsobí ako priestorový regularizátor. Integrovaný po 1M tréningových iteráciách s váhou 2 a aktualizáciami učiteľa každých 10k krokov, Gram anchoring prináša +2 mIoU zlepšenie na ADE20K segmentácii a lepšiu RMSE odhadu hĺbky bez degradácie globálnych metrík.
- Ako sa 768-rozmerné vloženia DINOv3 používajú na detekciu defektov povrchu?
- Variant DINOv3 ViT-B/16 vytvára 768-rozmerné vloženie pre každý z 196 výrezov plus jeden CLS token na obrázok 224x224. Pre analýzu povrchu infraštruktúry slúžia tieto vloženia na dva odlišné účely. Pre globálnu klasifikáciu (typ povrchu, celková známka kvality) je vloženie CLS tokenu vložené do ľahkého lineárneho klasifikátora alebo 2-vrstvovej MLP hlavy, ktorá mapuje 768 dimenzií na N výstupných tried. Pre úlohy hustej predikcie (segmentácia trhlín na úrovni pixelov) tvorí 196 vložení tokenov výrezov priestorovú mriežku 14x14 768-rozmerných vektorov. Táto mriežka prechádza cez segmentačnú hlavu (typicky ľahký konvolučný dekodér s 1-3 vrstvami), ktorá upsampluje mapu vlastností 14x14 na pôvodné rozlíšenie 224x224. Vloženie každého pixelu možno porovnať s prototypmi defektov pomocou kosínusovej podobnosti – výrezy s vloženiami blízkymi prototypom trhlín (stanovené pomocou niekoľkých príkladov) sú označené ako defekty. TarmacView dosahuje F1-skóre detekcie trhlín 94,7% pomocou zmrazených vložení DINOv3 s ľahkou segmentačnou hlavou v porovnaní s 88,2% pri ResNet-50 a 91,3% pri DINOv2 za rovnakých vyhodnocovacích podmienok.