← 最新论文
💻 computer science

Thermo-VL: Extending Vision-Language Models to Thermal Infrared Perception

Thermo-VL 是一种新型视觉语言模型,通过将可训练的热成像编码器与文本引导的双注意力融合模块集成到冻结的 Molmo-7B 骨干网络中,以增强低光照感知能力,并借助新引入的 RGB-热成像数据集与基准测试,实现鲁棒的跨光谱推理。

原作者: Rusiru Thushara, Yasiru Ranasinghe, Jay Paranjape, Vishal M. Patel

发布于 2026-05-22
📖 1 分钟阅读☕ 轻松阅读

原作者: Rusiru Thushara, Yasiru Ranasinghe, Jay Paranjape, Vishal M. Patel

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你有一位非常聪明、博览群书的机器人助手,名叫Molmo。这位机器人擅长查看在正常日光下拍摄的照片(RGB 图像)并回答相关问题。它知道狗长什么样,能定位停放的汽车,还能优美地描述日落。

然而,有一个问题:Molmo 在黑暗中是“失明”的。 如果你给它看一张在夜间、浓雾中或烟雾里拍摄的照片,它就会感到困惑。因为它完全依赖反射光,而在这种环境下反射光并不存在,所以它无法看见站在阴影中的人,也看不见汽车温暖的引擎。

Thermo-VL 就是研究人员为了解决这个问题而构建的方案。以下是其工作原理的通俗解释:

1. “夜视仪”升级

研究人员并没有试图从头开始教整个机器人在黑暗中视物(那样做既缓慢,又可能导致它忘记如何在白天视物),而是给 Molmo 配备了一副特殊的夜视仪

  • 这副“夜视仪”(热成像编码器): 它看到的不是光,而是“热量”。即使在完全黑暗中,它也能发现温暖的人体或发热的汽车。
  • 策略: 研究人员将原有的“日光之眼”(RGB 部分)保持冻结且 untouched(未作改动)。他们只训练了新的“夜视”部分。这样一来,Molmo 既不会丧失在阳光下的视物能力,又获得了在黑暗中视物的能力。

2. “智能翻译官”(融合模块)

你不能简单地把夜视图像叠加在日光图像上,就指望机器人能理解。机器人需要知道何时使用热成像,以及该寻找什么

这就是文本引导融合发挥作用的地方。你可以把它想象成一位智能翻译官,或者交响乐团中的指挥家

  • 问题是乐谱: 当你问机器人“路上有人吗?”时,这个问题就像一份乐谱。
  • 指挥家的职责: 融合模块会“听”你的问题。如果你问的是人,它就会指示“热成像”部分专注于温暖的形状;如果你问的是汽车,它就会聚焦于引擎的热量。
  • 门控残差连接: 这位“翻译官”并不会取代日光图像,而是将热量信息注入其中。这就像往汤里加一撮盐。你不是用盐代替汤,而是加入适量的盐来提升风味。机器人看到的仍是原始场景,但现在在问题所要求的位置,有了“热成像高亮”。

3. “训练健身房”(数据集)

为了训练这个新系统,研究人员不能只使用旧照片,因为大多数照片都没有附带问题。他们为机器人建造了一个健身房

  • 锻炼项目: 他们创建了成千上万对图像:一张普通照片和一张完全相同场景的“热成像”照片。
  • 教练: 他们利用人工智能为这些图像对生成问题和答案,涵盖诸如“有多少人?”或“道路是否畅通?”等内容。
  • 考试(Thermo-VL-Bench): 他们还建立了一套严格的测试。他们人工核查了这些问题,以确保机器人无法通过猜测来作弊。这项测试专门考察机器人是否能在黑暗中,或在同时拥有光线和热成像数据时解决难题。

4. 结果:为何这很重要

当研究人员对 Thermo-VL 进行测试时:

  • 在白天: 它的表现与原始机器人(Molmo)一样好。新的“夜视仪”并没有让它感到困惑。
  • 在黑暗中: 它在发现原始机器人遗漏的目标方面有了显著提升。
  • 组合效果: 当机器人能同时使用日光照片和热成像照片时,它就变成了一位“超级侦探”。它能够回答以前完全无法处理的问题。

核心结论

该论文声称,Thermo-VL 是一种方法,旨在赋予原本只能在日光下视物的智能机器人以在黑暗中视物的能力,同时不破坏其现有的智能。它通过添加一个“热感应”大脑来实现这一点,该大脑会倾听你的问题,仅向机器人展示它所需的热成像细节,从而确保机器人其余部分的知识和能力完好无损。

论文中的重要提示: 作者警告称,这目前仍是一个研究原型。它是理解低光照场景的有力工具,但尚未成为适用于关键安全任务(如自动驾驶)的完美、可立即部署的系统,因为它依赖于成对图像,且仍可能犯错。他们还指出,用于训练该模型的数据部分由其他人工智能生成,因此可能存在一些特性或偏差。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →