AnyThermal: Towards Learning Universal Representations for Thermal Perception
Autores originais: Parv Maheshwari, Jay Karhade, Yogesh Chawla, Isaiah Adu, Florian Heisen, Andrew Porco, Andrew Jong, Yifei Liu, Santosh Pitla, Sebastian Scherer, Wenshan Wang
Autores originais: Parv Maheshwari, Jay Karhade, Yogesh Chawla, Isaiah Adu, Florian Heisen, Andrew Porco, Andrew Jong, Yifei Liu, Santosh Pitla, Sebastian Scherer, Wenshan Wang
Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo
Resumo Técnico: AnyThermal e TartanRGBT
1. Declaração do Problema
A imagética térmica oferece robustez contra condições de iluminação e clima, tornando-se crítica para a autonomia resiliente em busca e salvamento, condução autônoma e vigilância. No entanto, ao contrário dos dados RGB, os dados térmicos sofrem com uma severa escassez de conjuntos de dados (datasets) de grande escala e diversificados. Os extratores de características térmicas existentes geralmente dependem de treinamento específico para tarefas com dados de pequena escala ou adaptam backbones RGB pré-treinados. Essas abordagens resultam em modelos que são limitados a ambientes e tarefas específicas. Além disso, embora a destilação de conhecimento de modelos de fundação visual (ex: DINOv2) para domínios térmicos tenha sido explorada, trabalhos anteriores foram limitados pela falta de dados de treinamento diversos, frequentemente dependendo de datasets de um único ambiente, o que limita a generalização dos encoders térmicos resultantes.
2. Metodologia
A. AnyThermal: Encoder Térmico Agnóstico à Tarefa
A contribuição central é o AnyThermal, um backbone térmico projetado para capturar características robustas e agnósticas à tarefa.
- Arquitetura: O AnyThermal é baseado no DINOv2 Vision Transformer (ViT-B/14).
- Estratégia de Treinamento (Destilação de Conhecimento): Os autores empregam um framework de destilação professor-aluno (teacher-student).
- Professor (Teacher): Uma rede DINOv2 congelada, inicializada com pesos pré-treinados, processando imagens RGB.
- Aluno (Student): Uma rede DINOv2 treinável (AnyThermal), inicializada com os mesmos pesos, processando imagens térmicas (convertidas de tons de cinza para 3 canais).
- Função de Perda (Loss Function): Uma perda contrastiva é aplicada aos tokens CLS da última camada. Isso alinha a semântica global dos pares RGB-térmicos correspondentes sem exigir pistas de baixo nível como cor. Esta abordagem relaxa as restrições sobre o alinhamento exato ou sincronização da imagem, tornando-a adequada para datasets onde o registro perfeito não está disponível.
- Dados de Treinamento: A destilação utiliza uma combinação de cinco datasets abrangendo quatro ambientes distintos: Urbano (ViVID++, STheReO, Freiburg), Aéreo (Boson Nighttime), Interno (Indoor) e Fora de Estrada (Off-road).
B. Plataforma e Dataset TartanRGBT
Para abordar a lacuna de diversidade nos dados RGB-T (RGB-Thermal) existentes, os autores desenvolveram:
- Plataforma TartanRGBT: Um payload de coleta de dados de código aberto e sincronizado por hardware. Ele integra uma câmera estéreo RGB ZEDx e duas câmeras térmicas estéreo FLIR Boson 640+, todas sincronizadas temporalmente via um pulso de gatilho de uma placa de captura. O sistema roda em um NVIDIA Jetson AGX Orin e é alojado em um estojo personalizado impresso em 3D com resfriamento ativo.
- Dataset TartanRGBT: Um dataset diverso e equilibrado contendo 16.943 pares sincronizados RGB-T coletados em quatro ambientes: residencial/campus (urbano), interno, fora de estrada e trilhas/parques.
- Processamento de Dados: O dataset inclui dados estéreo RGB, estéreo térmico e IMU. Para o treinamento, os autores geram pares RGB-T registrados usando o FoundationStereo para estimar profundidade densa a partir do RGB, que é então usada para retroprojetar e alinhar os pixels térmicos.
C. Adaptação para Tarefas de Avaliação (Downstream Tasks)
O AnyThermal é avaliado como um extrator de características combinado com cabeças específicas para cada tarefa:
- Reconhecimento de Lugar Cross-Modal (VPR): Utiliza uma cabeça SALAD treinada com perda de margem de triplet (triplet margin loss).
- Segmentação Térmica: Utiliza uma cabeça MLP não linear de duas camadas treinada com perda Dice.
- Estimativa de Profundidade Monocular Térmica: Adapta o framework MiDaS, substituindo o backbone EfficientNet pelo AnyThermal e utilizando características de patch multiescala.
3. Principais Contribuições
- AnyThermal: Um extrator de características térmicas agnóstico à tarefa que alcança desempenho de estado da arte em diversos ambientes e tarefas sem a necessidade de pré-treinamento do backbone para tarefas específicas.
- Plataforma TartanRGBT: A primeira plataforma de coleta de dados de código aberto para capturar simultaneamente imagens estéreo RGB e estéreo térmicas sincronizadas.
- Dataset TartanRGBT: Um dataset diverso e equilibrado cobrindo ambientes aéreos, internos, fora de estrada e urbanos, projetado para reduzir a lacuna de diversidade de dados para pesquisa térmica.
4. Resultados
Os autores avaliam o AnyThermal em benchmarks zero-shot e específicos de tarefa, demonstrando melhorias significativas em relação às linhas de base (baselines) existentes:
- Reconhecimento de Lugar Cross-Modal: Em diversos datasets zero-shot (CART, MS2, OdomBeyondVision), o AnyThermal com uma cabeça VPR supera todas as baselines, incluindo DINOv2 congelado, ImageBind e SGM. Notavelmente, ele alcança até 36% de melhoria no Recall@1 em comparação com as baselines em certos ambientes. Os resultados destacam que extratores RGB congelados são subótimos para consultas térmicas e que a destilação em dados diversos é crucial.
- Segmentação Térmica: No dataset MF-Net, o AnyThermal alcança um mIoU de estado da arte de 53,47%, superando o melhor anterior (MCNET com 51,95%), enquanto roda 3,6x mais rápido (6,79 FPS vs 1,88 FPS) em um NVIDIA ORIN AGX.
- Estimativa de Profundidade Monocular: No dataset MS2, o AnyThermal alcança as métricas de erro mais baixas (AbsRel: 0,0883) em comparação com os backbones EfficientNet-lite3 e DINOv2 congelado.
- Diversidade de Dados vs. Escala: Um estudo de ablação sobre o escalonamento de dados de pré-treinamento revela que simplesmente adicionar mais dados de domínios similares (ex: mais dados urbanos) gera retornos decrescentes. Em contraste, adicionar o dataset diverso TartanRGBT melhora consistentemente o desempenho em todas as tarefas e ambientes, confirmando que a diversidade de dados é mais crítica do que a escala para construir extratores de características térmicas robustos.
5. Significância e Alegações
O artigo afirma que o AnyThermal consegue preencher a lacuna entre a abundância de modelos de fundação RGB e a escassez de dados térmicos. Ao aproveitar a destilação de conhecimento através de um conjunto diversificado de ambientes, os autores demonstram que um único backbone térmico pode generalizar efetivamente para tarefas como reconhecimento de lugar, segmentação e estimativa de profundidade sem a necessidade de treinamento do backbone para tarefas específicas.
A introdução da plataforma e do dataset TartanRGBT é apresentada como um passo fundamental para reduzir a barreira para a comunidade de pesquisa na coleta de dados RGB-T de alta qualidade e sincronizados. Os autores afirmam que seu trabalho estabelece um novo padrão para a percepção térmica, movendo-se de modelos estreitos e específicos de ambiente para representações universais e robustas. Eles concluem que, embora existam ganhos de desempenho ao escalar dados, o principal motor para a generalização é a diversidade dos ambientes de treinamento, um princípio validado pelo desempenho superior dos modelos treinados com o dataset combinado e diversificado que inclui o TartanRGBT.
Afogado em artigos na sua área?
Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.
Receba os melhores artigos de AI toda semana.
Confiado por pesquisadores de Stanford, Cambridge e da Academia Francesa de Ciências.
Verifique sua caixa de entrada para confirmar sua inscrição.
Algo deu errado. Tentar novamente?
Sem spam, cancele quando quiser.