想象一下,你有一位非常聪明、博览群书的机器人助手,名叫Molmo。这位机器人擅长查看在正常日光下拍摄的照片(RGB 图像)并回答相关问题。它知道狗长什么样,能定位停放的汽车,还能优美地描述日落。
然而,有一个问题:Molmo 在黑暗中是“失明”的。 如果你给它看一张在夜间、浓雾中或烟雾里拍摄的照片,它就会感到困惑。因为它完全依赖反射光,而在这种环境下反射光并不存在,所以它无法看见站在阴影中的人,也看不见汽车温暖的引擎。
Thermo-VL 就是研究人员为了解决这个问题而构建的方案。以下是其工作原理的通俗解释:
1. “夜视仪”升级
研究人员并没有试图从头开始教整个机器人在黑暗中视物(那样做既缓慢,又可能导致它忘记如何在白天视物),而是给 Molmo 配备了一副特殊的夜视仪。
- 这副“夜视仪”(热成像编码器): 它看到的不是光,而是“热量”。即使在完全黑暗中,它也能发现温暖的人体或发热的汽车。
- 策略: 研究人员将原有的“日光之眼”(RGB 部分)保持冻结且 untouched(未作改动)。他们只训练了新的“夜视”部分。这样一来,Molmo 既不会丧失在阳光下的视物能力,又获得了在黑暗中视物的能力。
2. “智能翻译官”(融合模块)
你不能简单地把夜视图像叠加在日光图像上,就指望机器人能理解。机器人需要知道何时使用热成像,以及该寻找什么。
这就是文本引导融合发挥作用的地方。你可以把它想象成一位智能翻译官,或者交响乐团中的指挥家。
- 问题是乐谱: 当你问机器人“路上有人吗?”时,这个问题就像一份乐谱。
- 指挥家的职责: 融合模块会“听”你的问题。如果你问的是人,它就会指示“热成像”部分专注于温暖的形状;如果你问的是汽车,它就会聚焦于引擎的热量。
- 门控残差连接: 这位“翻译官”并不会取代日光图像,而是将热量信息注入其中。这就像往汤里加一撮盐。你不是用盐代替汤,而是加入适量的盐来提升风味。机器人看到的仍是原始场景,但现在在问题所要求的位置,有了“热成像高亮”。
3. “训练健身房”(数据集)
为了训练这个新系统,研究人员不能只使用旧照片,因为大多数照片都没有附带问题。他们为机器人建造了一个健身房:
- 锻炼项目: 他们创建了成千上万对图像:一张普通照片和一张完全相同场景的“热成像”照片。
- 教练: 他们利用人工智能为这些图像对生成问题和答案,涵盖诸如“有多少人?”或“道路是否畅通?”等内容。
- 考试(Thermo-VL-Bench): 他们还建立了一套严格的测试。他们人工核查了这些问题,以确保机器人无法通过猜测来作弊。这项测试专门考察机器人是否能在黑暗中,或在同时拥有光线和热成像数据时解决难题。
4. 结果:为何这很重要
当研究人员对 Thermo-VL 进行测试时:
- 在白天: 它的表现与原始机器人(Molmo)一样好。新的“夜视仪”并没有让它感到困惑。
- 在黑暗中: 它在发现原始机器人遗漏的目标方面有了显著提升。
- 组合效果: 当机器人能同时使用日光照片和热成像照片时,它就变成了一位“超级侦探”。它能够回答以前完全无法处理的问题。
核心结论
该论文声称,Thermo-VL 是一种方法,旨在赋予原本只能在日光下视物的智能机器人以在黑暗中视物的能力,同时不破坏其现有的智能。它通过添加一个“热感应”大脑来实现这一点,该大脑会倾听你的问题,仅向机器人展示它所需的热成像细节,从而确保机器人其余部分的知识和能力完好无损。
论文中的重要提示: 作者警告称,这目前仍是一个研究原型。它是理解低光照场景的有力工具,但尚未成为适用于关键安全任务(如自动驾驶)的完美、可立即部署的系统,因为它依赖于成对图像,且仍可能犯错。他们还指出,用于训练该模型的数据部分由其他人工智能生成,因此可能存在一些特性或偏差。
技术摘要:Thermo-VL
问题陈述
视觉 - 语言模型(VLMs)通过在大规模 RGB 数据集上进行指令微调,已在开放式图像理解和视觉问答(VQA)方面取得了显著成功。然而,这些模型继承了可见光传感的失效模式。在低光照、眩光、雾霾或烟雾条件下,RGB 图像往往会丢失关键的场景证据,导致标准 VLM 在夜间驾驶、搜救和低能见度检查等安全关键场景中表现脆弱。
虽然热红外(IR)图像在可见线索退化时能保留互补的场景结构(例如人类、动物、温暖车辆),但目前将热数据整合到 VLM 中的方法并非最优。常见的权宜之计是将热图像转换为伪 RGB 图像,然后再输入到基于 RGB 训练的 VLM 中。这种基于转换的流水线引入了生成瓶颈,存在幻觉出可见光风格细节的风险,并抑制了那些在 RGB 空间中无法自然表示的模态特定信息。此外,现有的 RGB-热数据集(如 KAIST、FLIR-ADAS)主要设计用于检测或跟踪,缺乏指令微调和开放式推理所需的语言监督。
方法论
作者提出了Thermo-VL,这是一种基于Molmo-7B-D骨干网络构建的波长感知 VLM。该架构旨在整合对齐的 RGB 和热输入,同时不破坏预训练的 RGB-语言接口,也无需对整个骨干网络进行昂贵的重新训练。
架构
双视觉编码器:
- RGB 流: 使用冻结的 Molmo 预训练视觉塔(ϕR)。
- 热流: 使用 ViT-L/14 编码器(ϕT),该编码器基于在混合多波段红外语料库(KAIST、FLIR-ADAS、OSU/OTCBVS、NIRSCENE)上预训练的掩码自编码器(MAE)初始化。为了保持与 Molmo 三通道输入期望的兼容性,单通道热图像被复制并填充至三个通道。
- 参数效率: 在训练期间,RGB 编码器和语言模型(LLM)保持冻结。仅更新热编码器的最后 Nℓ=4 个 Transformer 块、热层归一化(LayerNorm)以及融合模块。
文本引导的双注意力融合模块:
核心创新是一个融合块,该模块在将热特征注入冻结的 RGB 流之前,根据语言提示和 RGB 上下文对热特征进行条件化。
- 输入: 对齐的 RGB 令牌(R)、热令牌(T)和提示嵌入(P)。
- 双注意力: 热令牌通过两个并行注意力路径进行细化:
- 文本引导路径: Ttxt=MHA(Tˉ,Pˉ,Pˉ)
- RGB 引导路径: Trgb=MHA(Tˉ,Rˉ,Rˉ)
- 细化: 将这些路径与原始热特征合并,以生成细化表示 T^。
- 门控残差注入: 模型不是替换 RGB 令牌,而是从 T^ 预测残差 ΔR,并使用逐令牌门控 α 对其进行调制。最终融合令牌计算如下:
R†=R+α⊙ΔR
该设计确保融合是查询感知的,在保留预训练 RGB-语言接口的同时,允许定向注入热证据。
训练目标
该模型使用复合损失函数进行优化:
L=LLM+λalignLalign+λcontrLcontr+λgateLgate
- LLM: 语言建模任务的标准自回归交叉熵损失。
- Lalign: RGB 和热特征之间的令牌级 L2 对齐,以强制跨模态一致性。
- Lcontr: 对比损失(InfoNCE),用于对齐 RGB、热和文本的全局语义表示。
- Lgate: 门控机制的熵正则化,以防止门控饱和(即防止模型完全忽略某一模态)。
- 数据增强: 训练期间采用块状 RGB 掩码策略,随机掩码 10% 的 RGB 图像区域,以减少对可见光谱的过度依赖。
主要贡献
- 波长感知 VLM: 提出了 Thermo-VL,它通过带有逐令牌门控残差注入的文本引导双注意力融合模块,整合配对的 RGB 和热输入,同时保持 RGB 塔和 LLM 冻结。
- 参数高效适配: 一种微调策略,仅更新热编码器的最后几个块和融合参数,并通过令牌级对齐、对比监督和门控熵进行正则化。
- 统一的 RGB-热语言监督:
- 数据集: 一个像素级对齐的 RGB-热指令微调数据集,包含约 19,500 对图像和约 54K 个问答对,由公共数据集构建,并在 PixMo-cap-qa 数据上使用合成热增强(利用 F-ViTA)生成。
- 基准测试: Thermo-VL-Bench,一个经过人工筛选的二元 VQA 基准测试,包含约 3,148 对图像和约 15K 个问答对,专为低光照和跨光谱推理设计。
实验结果
实验在Thermo-VL-Bench和外部RGB-Th Bench上进行。
Thermo-VL-Bench:
- RGB+ 热: 当提供两种模态时,Thermo-VL 达到了**88.96%**的准确率,相比 Molmo 基线(75.79%)有显著提升。
- 仅热: 从 81.20%(Molmo)提升至82.23%。
- 仅 RGB: 性能保持在88.67%,与基线持平,证明融合机制不会降低现有的 RGB 能力。
- 总体: Thermo-VL 在所有对比模型(包括 InternVL、Qwen2.5-VL 和 LLaVA-Next)中取得了最高的综合得分(86.37%)。
RGB-Th Bench:
- Thermo-VL 在仅 RGB 文本任务上与 Molmo 基线持平(77.25%),但在 RGB-热文本任务上显著提升了性能,从 60.84% 上升至69.15%。
消融研究:
- 移除文本引导注意力导致性能下降最大(88.96% → 82.34%),证实了问题感知融合的重要性。
- 移除门控残差或 RGB 引导注意力也会降低性能,验证了该设计在整合热数据的同时保留 RGB 接口的作用。
- 辅助损失(Lcontr 和 Lgate)被证明对跨模态一致性和防止模态崩溃至关重要。
意义与主张
论文主张,显式的、提示条件的多光谱融合允许热线索在模型内部融合时有效补充 RGB 数据,而不是在输入级别附加或转换为伪 RGB。Thermo-VL 证明了在不破坏其预训练 RGB-语言接口的前提下,将强大的预训练 VLM 扩展到热感知是可行的。
作者将 Thermo-VL 定位为研究原型,而非可直接部署的系统。他们承认了局限性,包括假设输入在空间上对齐、使用模型生成的问答监督可能引入伪影,以及 Thermo-VL-Bench 是人工筛选的模型生成基准而非完全由人工编写的基准。这项工作旨在支持低光照条件下的多光谱视觉 - 语言学习和指令微调研究,而不是作为安全关键决策的独立基础。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。