AnyThermal: Towards Learning Universal Representations for Thermal Perception
Autori originali: Parv Maheshwari, Jay Karhade, Yogesh Chawla, Isaiah Adu, Florian Heisen, Andrew Porco, Andrew Jong, Yifei Liu, Santosh Pitla, Sebastian Scherer, Wenshan Wang
Autori originali: Parv Maheshwari, Jay Karhade, Yogesh Chawla, Isaiah Adu, Florian Heisen, Andrew Porco, Andrew Jong, Yifei Liu, Santosh Pitla, Sebastian Scherer, Wenshan Wang
Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo
Sintesi Tecnica: AnyThermal e TartanRGBT
1. Problema
Le immagini termiche offrono robustezza rispetto alle condizioni di illuminazione e meteorologiche, rendendole critiche per l'autonomia resiliente nella ricerca e soccorso, nella guida autonoma e nella sorveglianza. Tuttavia, a differenza dei dati RGB, i dati termici soffrono di una grave scarsità di dataset su larga scala e diversificati. Gli attuali estrattori di caratteristiche termiche si affidano tipicamente all'addestramento specifico per il compito con dati su piccola scala o adattano backbone RGB pre-addestrati. Questi approcci producono modelli che sono limitati a specifici ambienti e compiti. Inoltre, sebbene la distillazione della conoscenza da modelli fondativi visivi (ad es. DINOv2) verso i domini termici sia stata esplorata, i lavori precedenti sono stati limitati dalla mancanza di dati di addestramento diversificati, affidandosi spesso a dataset di un singolo ambiente, il che limita la generalizzabilità dei risultanti encoder termici.
2. Metodologia
A. AnyThermal: Encoder Termico Task-Agnostic
Il contributo principale è AnyThermal, un backbone termico progettato per catturare caratteristiche robuste e task-agnostic.
- Architettura: AnyThermal si basa sul Vision Transformer (ViT-B/14) di DINOv2.
- Strategia di Addestramento (Distillazione della Conoscenza): Gli autori impiegano un framework di distillazione teacher-student.
- Teacher: Una rete DINOv2 congelata, inizializzata con pesi pre-addestrati, che elabora immagini RGB.
- Student: Una rete DNOv2 addestraibile (AnyThermal), inizializzata con gli stessi pesi, che elabora immagini termiche (convertite da scala di grigi a 3 canali).
- Funzione di Perdita: Una perdita contrastiva viene applicata ai token CLS dell'ultimo strato. Questo allinea la semantica globale delle coppie RGB-termiche corrispondenti senza richiedere indizi a basso livello come il colore. Questo approccio riduce i vincoli sulla perfetta registrazione o sincronizzazione dell'immagine, rendendolo adatto a dataset in cui la registrazione perfetta non è disponibile.
- Dati di Addestramento: La distillazione utilizza una combinazione di cinque dataset che coprono quattro ambienti distinti: Urbano (ViVID++, STheReO, Freiburg), Aereo (Boson Nighttime), Indoor e Off-road.
B. Piattaforma e Dataset TartanRGBT
Per affrontare il divario di diversità nei dati RGB-Thermal (RGB-T) esistenti, gli autori hanno sviluppato:
- Piattaforma TartanRGBT: Un payload di raccolta dati open-source, sincronizzato via hardware. Integra una telecamera stereo RGB ZEDx e due telecamere termiche stereo FLIR Boson 640+, tutte sincronizzate temporalmente tramite un impulso di trigger da una scheda di acquisizione. Il sistema gira su un NVIDIA Jetson AGX Orin ed è alloggiato in un case personalizzato stampato in 3D con raffreddamento attivo.
- Dataset TartanRGBT: Un dataset diversificato e bilanciato contenente 16.943 coppie RGB-T sincronizzate raccolte in quattro ambienti: residenziale/campus (urbano), indoor, off-road e sentieri/parchi.
- Elaborazione dei Dati: Il dataset include dati stereo RGB, stereo termici e IMU. Per l'addestramento, gli autori generano coppie RGB-T registrate utilizzando FoundationStereo per stimare la profondità densa dall'RGB, che viene poi utilizzata per retroproiettare e allineare i pixel termici.
C. Adattamento ai Compiti a Valle (Downstream Tasks)
AnyThermal è valutato come estrattore di caratteristiche combinato con teste specifiche per il compito:
- Riconoscimento del Luogo Cross-Modale (VPR): Utilizza una testa SALAD addestrata con perdita di margine triplet (triplet margin loss).
- Segmentazione Termica: Utilizza una testa MLP non lineare a due strati addestrata con perdita Dice.
- Stima della Profondità Termica Monoculare: Adatta il framework MiDaS, sostituendo il backbone EfficientNet con AnyThermal e utilizzando patch multi-scala.
3. Contributi Chiave
- AnyThermal: Un estrattore di caratteristiche termiche task-agnostic che raggiunge prestazioni allo stato dell'arte attraverso diversi ambienti e compiti senza l'addestramento specifico del backbone per il compito.
- Piattaforma TartanRGBT: La prima piattaforma di raccolta dati open-source per catturare simultaneamente immagini stereo RGB e stereo termiche sincronizzate.
- Dataset TartanRGBT: Un dataset diversificato e bilanciato che copre ambienti indoor, aerei, off-road e urbani, progettato per colmare il divario di diversità dei dati per la ricerca termica.
4. Risultati
Gli autori valutano AnyThermal su benchmark zero-shot e specifici per compito, dimostrando miglioramenti significativi rispetto ai baseline esistenti:
- Riconoscimento del Luogo Cross-Modale: Su diversi dataset zero-shot (CART, MS2, OdomBeyondVision), AnyThermal con una testa VPR supera tutti i baseline, inclusi DINOv2 congelato, ImageBind e SGM. Notevolmente, raggiunge fino al 36% di miglioramento nel Recall@1 rispetto ai baseline in determinati ambienti. I risultati evidenziano che gli estrattori RGB congelati sono subottimali per query termiche e che la distillazione su dati diversificati è cruciale.
- Segmentazione Termica: Sul dataset MF-Net, AnyThermal raggiunge un mIoU allo stato dell'arte del 53,47%, superando il precedente migliore (MCNET con 51,95%) pur essendo 3,6 volte più veloce (6,79 FPS rispetto a 1,88 FPS) su un NVIDIA ORIN AGX.
- Stima della Profondità Monoculare: Sul dataset MS2, AnyThermal raggiunge le metriche di errore più basse (AbsRel: 0,0883) rispetto ai backbone EfficientNet-lite3 e DINOv2 congelati.
- Diversità dei Dati vs. Scala: Uno studio di ablazione sulla scalabilità dei dati di pre-addestramento rivela che l'aggiunta di più dati da domini simili (ad es. più dati urbani) produce rendimenti decrescenti. Al contrario, l'aggiunta del dataset diversificato TartanRGBT migliora costantemente le prestazioni in tutti i compiti e gli ambienti, confermando che la diversità dei dati è più critica della scala per costruire estrattori di caratteristiche termiche robusti.
5. Significato e Rivendicazioni
L'articolo sostiene che AnyThermal colma con successo il divario tra l'abbondanza di modelli fondativi RGB e la scarsità di dati termici. Sfruttando la distillazione della conoscenza attraverso un insieme diversificato di ambienti, gli autori dimostrano che un singolo backbone termico può generalizzare efficacemente a compiti come il riconoscimento del luogo, la segmentazione e la stima della profondità senza richiedere l'addestramento del backbone per il compito specifico.
L'introduzione della piattaforma e del dataset TartanRGBT è presentata come un passo fondamentale per abbassare la barriera per la comunità di ricerca nella raccolta di dati RGB-T sincronizzati di alta qualità. Gli autori affermano che il loro lavoro stabilisce un nuovo standard per la percezione termica, passando da modelli ristretti e specifici per l'ambiente verso rappresentazioni universali e robuste. Concludono che, sebbene esistano guadagni di prestazione dalla scalabilità dei dati, il driver primario per la generalizzazione è la diversità degli ambienti di addestramento, un principio validato dalla prestazione superiore dei modelli addestrati sul dataset combinato e diversificato che include TartanRGBT.
Sommerso dagli articoli nel tuo campo?
Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.
Ricevi i migliori articoli di AI ogni settimana.
Scelto da ricercatori di Stanford, Cambridge e dell'Accademia francese delle scienze.
Controlla la tua casella di posta per confermare l'iscrizione.
Qualcosa è andato storto. Riprovare?
Niente spam, cancellati quando vuoi.