AnyThermal: Towards Learning Universal Representations for Thermal Perception
Ursprüngliche Autoren: Parv Maheshwari, Jay Karhade, Yogesh Chawla, Isaiah Adu, Florian Heisen, Andrew Porco, Andrew Jong, Yifei Liu, Santosh Pitla, Sebastian Scherer, Wenshan Wang
Ursprüngliche Autoren: Parv Maheshwari, Jay Karhade, Yogesh Chawla, Isaiah Adu, Florian Heisen, Andrew Porco, Andrew Jong, Yifei Liu, Santosh Pitla, Sebastian Scherer, Wenshan Wang
Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen
Technisches Resümee: AnyThermal und TartanRGBT
1. Problemstellung
Thermografie bietet Robustheit gegenüber Lichtverhältnissen und Wetterbedingungen, was sie entscheidend für die resiliente Autonomie in der Suche und Rettung, beim autonomen Fahren und in der Überwachung macht. Im Gegensatz zu RGB-Daten leidet die thermische Datenverarbeitung jedoch unter einem gravierenden Mangel an groß angelegten, vielfältigen Datensätzen. Bestehende thermische Merkmalsextraktoren verlassen sich typischerweise auf aufgabenspezifisches Training mit kleinskaligen Daten oder passen vortrainierte RGB-Backbones an. Diese Ansätze führen zu Modellen, die auf spezifische Umgebungen und Aufgaben beschränkt sind. Darüber hinaus wurde die Wissensdestillation von visuellen Foundation-Modellen (z. B. DINOv2) auf den thermischen Bereich bereits untersucht, doch bisherige Arbeiten wurden durch einen Mangel an vielfältigen Trainingsdaten eingeschränkt, die oft auf Datensätze eines einzelnen Umfelds angewiesen waren, was die Generalisierbarkeit der resultierenden thermischen Encoder einschränkt.
2. Methodik
A. AnyThermal: Aufgabenagnostischer thermischer Encoder
Der Kernbeitrag ist AnyThermal, ein thermischer Backbone, der darauf ausgelegt ist, robuste, aufgabenagnostische Merkmale zu erfassen.
- Architektur: AnyThermal basiert auf dem DINOv2 Vision Transformer (ViT-B/14).
- Trainingsstrategie (Wissensdestillation): Die Autoren verwenden ein Teacher-Student-Distillations-Framework.
- Teacher: Ein eingefrorenes DINOv2-Netzwerk, das mit vortrainierten Gewichten initialisiert wurde und RGB-Bilder verarbeitet.
- Student: Ein trainierbares DINOv2-Netzwerk (AnyThermal), das mit denselben Gewichten initialisiert wurde und thermische Bilder (von Graustufen in 3 Kanäle konvertiert) verarbeitet.
- Verlustfunktion: Ein kontrastiver Verlust wird auf die CLS-Token-Merkmale der letzten Schicht angewendet. Dies richtet die globale Semantik korrespondierender RGB-Thermografie-Paare aus, ohne auf niedrigwertige Hinweise wie Farben angewiesen zu sein. Dieser Ansatz lockert die Anforderungen an eine exakte Bildausrichtung oder Synchronisation, was ihn für Datensätze geeignet macht, bei denen eine perfekte Registrierung nicht verfügbar ist.
- Trainingsdaten: Die Destillation nutzt eine Kombination aus fünf Datensätzen, die vier verschiedene Umgebungen abdecken: Urban (ViVID++, STheReO, Freiburg), Luftaufnahmen (Boson Nighttime), Innenräume und Offroad.
B. TartanRGBT Plattform und Datensatz
Um die Diversitätslücke in bestehenden RGB-Thermografie-Daten (RGB-T) zu schließen, haben die Autoren entwickelt:
- TartanRGBT Plattform: Eine Open-Source, hardware-synchronisierte Datenerfassungslast. Sie integriert eine ZEDx Stereo-RGB-Kamera und zwei FLIR Boson 640+ Stereo-Thermografie-Kameras, die alle über einen Trigger-Puls einer Capture-Card zeitlich synchronisiert sind. Das System läuft auf einem NVIDIA Jetson AGX Orin und ist in einem maßgeschneiderten 3D-gedruckten Gehäuse mit aktiver Kühlung untergebracht.
- TartanRGBT Datensatz: Ein vielfältiger, ausgewogener Datensatz mit 16.943 synchronisierten RGB-T Paaren, die in vier Umgebungen gesammelt wurden: Wohngebiet/Campus (Urban), Innenräume, Offroad sowie Pfade/Parks.
- Datenverarbeitung: Der Datensatz enthält Stereo-RGB, Stereo-Thermografie und IMU-Daten. Für das Training generieren die Autoren registrierte RGB-T Paare unter Verwendung von FoundationStereo, um eine dichte Tiefe aus RGB zu schätzen, welche dann genutzt wird, um thermische Pixel zurückzuprojizieren und auszurichten.
C. Anpassung an Downstream-Aufgaben
AnyThermal wird als Merkmalsextraktor in Kombination mit aufgabenspezifischen Heads evaluiert:
- Cross-Modal Place Recognition (VPR): Verwendet einen SALAD-Head, der mit Triplet-Margin-Loss trainiert wurde.
- Thermische Segmentierung: Verwendet einen zwei-lagigen nichtlinearen MLP-Head, der mit Dice-Loss trainiert wurde.
- Monokulare thermische Tiefenschätzung: Adaptiert das MiDaS-Framework, wobei der EfficientNet-Backbone durch AnyThermal ersetzt wird und Multiskala-Patch-Features genutzt werden.
3. Kernbeiträge
- AnyThermal: Ein aufgabenagnostischer thermischer Merkmalsextraktor, der eine State-of-the-Art-Leistung über diverse Umgebungen und Aufgaben hinweg erzielt, ohne dass ein aufgabenspezifisches Vortraining des Backbones erforderlich ist.
- TartanRGBT Plattform: Die erste Open-Source-Datenerfassungsplattform zur gleichzeitigen Erfassung synchronisierter Stereo-RGB- und Stereo-Thermografie-Bilder.
- TartanRGBT Datensatz: Ein vielfältiger, ausgewogener Datensatz, der Innenräume, Luftaufnahmen, Offroad- und urbane Settings abdeckt und darauf ausgelegt ist, die Lücke in der Datendiversität für die thermische Forschung zu schließen.
4. Ergebnisse
Die Autoren evaluieren AnyThermal auf Zero-Shot- und aufgabenspezifischen Benchmarks und demonstrieren signifikante Verbesserungen gegenüber bestehenden Baselines:
- Cross-Modal Place Recognition: Auf diversen Zero-Shot-Datensätzen (CART, MS2, OdomBeyondVision) übertrifft AnyThermal mit einem VPR-Head alle Baselines, einschließlich gefrorenem DINOv2, ImageBind und SGM. Bemerkenswerterweise erzielt es in bestimmten Umgebungen eine Verbesserung des Recall@1 um bis zu 36 % im Vergleich zu den Baselines. Die Ergebnisse verdeutlichen, dass gefrorene RGB-Extraktoren suboptimal für thermische Abfragen sind und dass eine Destillation auf diversen Daten entscheidend ist.
- Thermische Segmentierung: Auf dem MF-Net Datensatz erreicht AnyThermal ein State-of-the-Art mIoU von 53,47 %, womit es das bisherige Bestleistung (MCNET mit 51,95 %) übertrifft, während es auf einem NVIDIA ORIN AGX 3,6-mal schneller läuft (6,79 FPS vs. 1,88 FPS).
- Monokulare Tiefenschätzung: Auf dem MS2 Datensatz erreicht AnyThermal die niedrigsten Fehlermetriken (AbsRel: 0,0883) im Vergleich zu EfficientNet-lite3 und gefrorenen DINOv2-Backbones.
- Datendiversität vs. Skalierung: Eine Ablationsstudie zur Skalierung der Trainingsdaten zeigt, dass das bloße Hinzufügen von mehr Daten aus ähnlichen Domänen (z. B. mehr urbane Daten) nur abnehmende Erträge liefert. Im Gegensatz dazu verbessert das Hinzufügen des vielfältigen TartanRGBT Datensatzes die Leistung über alle Aufgaben und Umgebungen hinweg konsistent, was bestätigt, dass Datendiversität kritischer ist als die reine Skalierung, um robuste thermische Merkmalsextraktoren zu bauen.
5. Bedeutung und Ansprüche
Das Paper behauptet, dass AnyThermal die Lücke zwischen der Fülle an RGB-Foundation-Modellen und der Knappheit an thermischen Daten erfolgreich schließt. Durch die Nutzung von Wissensdestillation über ein breites Spektrum an Umgebungen hinweg zeigen die Autoren, dass ein einziger thermischer Backbone effektiv auf Aufgaben wie Ortserkennung, Segmentierung und Tiefenschätzung generalisieren kann, ohne dass ein aufgabenspezifisches Training des Backbones selbst notwendig ist.
Die Einführung der TartanRGBT Plattform und des Datensatzes wird als grundlegender Schritt präsentiert, um die Barriere für die Forschungsgemeinschaft zur Sammlung hochwertiger, synchronisierter RGB-T Daten zu senken. Die Autoren behaupten, dass ihre Arbeit einen neuen Standard für die thermische Wahrnehmung setzt und sich von engen, umgebungsspezifischen Modellen hin zu universellen, robusten Repräsentationen bewegt. Sie kommen zu dem Schluss, dass, obwohl Leistungssteigerungen durch Skalierung existieren, der primäre Treiber für Generalisierung die Diversität der Trainingsumgebungen ist – ein Prinzip, das durch die überlegene Leistung von Modellen validiert wurde, die auf dem kombinierten, diversen Datensatz inklusive TartanRGBT trainiert wurden.
Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?
Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.
Erhalten Sie die besten AI Papers jede Woche.
Vertraut von Forschern in Stanford, Cambridge und der Französischen Akademie der Wissenschaften.
Prüfen Sie Ihr Postfach, um Ihr Abonnement zu bestätigen.
Etwas ist schiefgelaufen. Nochmal versuchen?
Kein Spam, jederzeit abbestellbar.