AnyThermal: Towards Learning Universal Representations for Thermal Perception
Autores originales: Parv Maheshwari, Jay Karhade, Yogesh Chawla, Isaiah Adu, Florian Heisen, Andrew Porco, Andrew Jong, Yifei Liu, Santosh Pitla, Sebastian Scherer, Wenshan Wang
Autores originales: Parv Maheshwari, Jay Karhade, Yogesh Chawla, Isaiah Adu, Florian Heisen, Andrew Porco, Andrew Jong, Yifei Liu, Santosh Pitla, Sebastian Scherer, Wenshan Wang
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
Resumen Técnico: AnyThermal y TartanRGBT
1. Planteamiento del Problema
La imaginería térmica ofrece robustez frente a las condiciones de iluminación y el clima, lo que la hace crítica para la autonomía resiliente en búsqueda y rescate, conducción autónoma y vigilancia. Sin embargo, a diferencia de los datos RGB, los datos térmicos sufren de una severa escasez de conjuntos de datos a gran escala y diversos. Los extractores de características térmicas existentes suelen depender de un entrenamiento específico para cada tarea con datos de pequeña escala o adaptan backbones RGB preentrenados. Estos enfoques resultan en modelos que están limitados a entornos y tareas específicas. Además, aunque se ha explorado la destilación de conocimiento desde modelos fundacionales visuales (por ejemplo, DINOv2) hacia los dominios térmicos, el trabajo previo se ha visto constreñido por la falta de datos de entrenamiento diversos, dependiendo a menudo de conjuntos de datos de un solo entorno, lo que limita la generalizabilidad de los codificadores térmicos resultantes.
2. Metodología
A. AnyThermal: Codificador Térmico Agnóstico a la Tarea
La contribución central es AnyThermal, un backbone térmico diseñado para capturar características robustas y agnósticas a la tarea.
- Arquitectura: AnyThermal se basa en el Vision Transformer (ViT-B/14) de DINOv2.
- Estrategia de Entrenamiento (Destilación de Conocimiento): Los autores emplean un marco de destilación profesor-estudiante.
- Profesor: Una red DINOv2 congelada inicializada con pesos preentrenados, que procesa imágenes RGB.
- Estudiante: Una red DINOv2 entrenable (AnyThermal), inicializada con los mismos pesos, que procesa imágenes térmicas (convertidas de escala de grises a 3 canales).
- Función de Pérdida: Se aplica una pérdida contrastiva a los tokens CLS de la última capa. Esto alinea la semántica global de los pares RGB-térmicos correspondientes sin requerir pistas de bajo nivel como el color. Este enfoque relaja las restricciones sobre la alineación exacta o la sincronización de la imagen, lo que lo hace adecuado para conjuntos de datos donde la registro perfecto no está disponible.
- Datos de Entrenamiento: La destilación utiliza una combinación de cinco conjuntos de datos que abarcan cuatro entornos distintos: Urbano (ViVID++, STheReO, Freiburg), Aéreo (Boson Nighttime), Interior y Off-road.
B. Plataforma y Conjunto de Datos TartanRGBT
Para abordar la brecha de diversidad en los datos RGB-T (RGB-Thermal) existentes, los autores desarrollaron:
- Plataforma TartanRGBT: Una carga útil de recolección de datos de código abierto y sincronizada por hardware. Integra una cámara estéreo RGB ZEDx y dos cámaras térmicas estéreo FLIR Boson 640+, todas sincronizadas temporalmente mediante un pulso de disparo de una tarjeta de captura. El sistema se ejecuta en una NVIDIA Jetson AGX Orin y está alojado en una carcasa personalizada impresa en 3D con enfriamiento activo.
- Conjunto de Datos TartanRGBT: Un conjunto de datos diverso y equilibrado que contiene 16,943 pares RGB-T sincronizados recolectados en cuatro entornos: residencial/campus (urbano), interior, off-road y senderos/parques.
- Procesamiento de Datos: El conjunto de datos incluye datos estéreo RGB, estéreo térmico y datos de IMU. Para el entrenamiento, los autores generan pares RGB-T registrados utilizando FoundationStereo para estimar la profundidad densa a partir de RGB, que luego se utiliza para retroproyectar y alinear los píxeles térmicos.
C. Adaptación a Tareas de Destino (Downstream Tasks)
AnyThermal se evalúa como un extractor de características combinado con cabezales específicos para cada tarea:
- Reconocimiento de Lugares Cross-Modal (VPR): Utiliza un cabezal SALAD entrenado con pérdida de margen de triplete (triplet margin loss).
- Segmentación Térmica: Utiliza un cabezal MLP no lineal de dos capas entrenado con pérdida Dice.
- Estimación de Profundidad Monocular Térmica: Adapta el marco MiDaS, reemplazando el backbone EfficientNet por AnyThermal y utilizando características de parches multiescala.
3. Contribuciones Clave
- AnyThermal: Un extractor de características térmicas agnóstico a la tarea que logra un rendimiento de vanguardia (state-of-the-art) a través de diversos entornos y tareas sin necesidad de un preentrenamiento de la tarea para el backbone.
- Plataforma TartanRGBT: La primera plataforma de recolección de datos de código abierto para capturar simultáneamente imágenes estéreo RGB y estéreo térmicas sincronizadas.
- Conjunto de Datos TartanRGBT: Un conjunto de datos diverso y equilibrado que cubre entornos interiores, aéreos, off-road y urbanos, diseñado para cerrar la brecha de diversidad de datos para la investigación térmica.
4. Resultados
Los autores evalúan AnyThermal en benchmarks zero-shot y específicos de tareas, demostrando mejoras significativas sobre las líneas base existentes:
- Reconocimiento de Lugares Cross-Modal: En diversos conjuntos de datos zero-shot (CART, MS2, OdomBeyondVision), AnyThermal con un cabezal VPR supera a todas las líneas base, incluyendo DINOv2 congelado, ImageBind y SGM. Notablemente, logra una mejora de hasta el 36% en Recall@1 en comparación con las líneas base en ciertos entornos. Los resultados resaltan que los extractores RGB congelados son subóptimos para consultas térmicas y que la destilación sobre datos diversos es crucial.
- Segmentación Térmica: En el conjunto de datos MF-Net, AnyThermal logra un mIoU de vanguardia del 53.47%, superando al mejor anterior (MCNET con 51.95%) mientras corre 3.6 veces más rápido (6.79 FPS vs 1.88 FPS) en una NVIDIA ORIN AGX.
- Estimación de Profundidad Monocular: En el conjunto de datos MS2, AnyThermal logra las métricas de error más bajas (AbsRel: 0.0883) en comparación con los backbones EfficientNet-lite3 y DINOv2 congelado.
- Diversidad de Datos vs. Escala: Un estudio de ablación sobre el escalado de datos de preentrenamiento revela que simplemente añadir más datos de dominios similares (por ejemplo, más datos urbanos) produce rendimientos decrecientes. En contraste, añadir el conjunto de datos diverso TartanRGBT mejora consistentemente el rendimiento en todas las tareas y entornos, confirmando que la diversidad de los datos es más crítica que la escala para construir extractores de características térmicas robustos.
5. Significado y Reivindicaciones
El artículo afirma que AnyThermal cierra con éxito la brecha entre la abundancia de los modelos fundacionales RGB y la escasez de datos térmicos. Al aprovechar la destilación de conocimiento a través de un conjunto diverso de entornos, los autores demuestran que un único backbone térmico puede generalizarse eficazmente a tareas como el reconocimiento de lugares, la segmentación y la estimación de profundidad sin necesidad de un entrenamiento específico de la tarea para el backbone.
La introducción de la plataforma y el conjunto de datos TartanRGBT se presenta como un paso fundamental para reducir la barrera de la comunidad de investigación para recolectar datos RGB-T de alta calidad y sincronizados. Los autores aseguran que su trabajo establece un nuevo estándar para la percepción térmica, alejándose de modelos estrechos y específicos de un entorno hacia representaciones universales y robustas. Concluyen que, si bien existen ganancias de rendimiento al escalar los datos, el principal motor para la generalización es la diversidad de los entornos de entrenamiento, un principio validado por el rendimiento superior de los modelos entrenados con el conjunto de datos combinado y diverso que incluye TartanRGBT.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.
Recibe los mejores artículos de AI cada semana.
Utilizado por investigadores de Stanford, Cambridge y la Academia Francesa de Ciencias.
Revisa tu bandeja de entrada para confirmar tu suscripción.
Algo salió mal. ¿Intentar de nuevo?
Sin spam, cancela cuando quieras.