← 最新论文
💻 computer science

UNIV: Unified Foundation Model for Infrared and Visible Modalities

本文介绍了 UNIV,这是一个针对红外和可见光模态的统一基础模型,它利用补丁跨模态对比学习(PCCL)来克服由模式捷径引起的跨模态退化,并引入了新的 MVIP 基准,在红外任务上实现了卓越性能,同时保持了具有竞争力的 RGB 精度。

原作者: Fangyuan Mao, Shuo Wang, Jilin Mei, Shun Lu, Chen Min, Fuyang Liu, Xiaokun Feng, Meiqi Wu, Yu Hu

发布于 2026-05-14
📖 1 分钟阅读☕ 轻松阅读

原作者: Fangyuan Mao, Shuo Wang, Jilin Mei, Shun Lu, Chen Min, Fuyang Liu, Xiaokun Feng, Meiqi Wu, Yu Hu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你有两双不同的眼睛试图看清世界。

一双眼睛在可见光下视物(就像你正常的眼睛)。它在白天能清晰地看到颜色、纹理和细节,但在黑暗或下雨时会感到困惑。
另一双眼睛在红外光下视物(就像夜视仪)。它能看见热信号,在黑暗中表现极佳,但它“色盲”,且常常错过纹理等精细细节。

很长一段时间里,科学家们为这两双眼睛分别构建了两个独立的“大脑”(AI 模型)。一个大脑仅从可见光中学习,另一个仅从热信号中学习。问题在于:当你试图用“可见光大脑”去查看热图像时,它会感到困惑。它试图寻找那些根本不存在的颜色。当你用“热大脑”去查看普通照片时,它会因缺乏热信号模式而感到困惑。它们就像两个说着不同语言的人,无法就“汽车”或“人”实际上长什么样达成一致。

这篇论文介绍了UNIV(统一基础模型),这是一种新型 AI 大脑,旨在同时流利地掌握这两种语言。

问题:“捷径”陷阱

作者发现,现有的 AI 模型走了一条“捷径”。

  • 可见光 AI变得懒惰:它学会了“车是红色的”或“草是绿色的”。如果你给它看一张黑白照片,它会惊慌失措,因为颜色的捷径消失了。
  • 红外 AI变得懒惰:它学会了“人是一团团明亮的白色”。如果你给它看一张普通照片,它会感到困惑,因为亮度捷径行不通了。

它们关注的是传感器模式(颜色或热量),而不是实际含义(物体的形状和结构)。

解决方案:“通用翻译器”

UNIV 通过迫使 AI 学习事物的含义,而不仅仅是传感器模式,从而解决了这一问题。它使用一种名为补丁跨模态对比学习(PCCL)的巧妙训练技巧来实现这一点。

以下是其工作原理,借助一个类比:

  1. “冻结的教师”:研究人员从一个非常聪明、仅知晓可见光的预训练 AI 开始(就像一位精通艺术的导师)。这位教师是“冻结”的,意味着我们不改变它的大脑;我们仅将其作为参考。
  2. “补丁”游戏:想象将一张照片切成成千上万个微小的拼图块(补丁)。
    • 教师查看一张可见光照片,说道:“这个拼图块是一个车轮,那个是轮胎。它们属于一起。”
    • 教师同时也查看匹配的红外照片(看起来像模糊的热斑),并说道:“尽管这看起来不同,但这个热斑是一个车轮。”
  3. 对齐:新的 UNIV 模型被训练去排列它自己的拼图块,使得可见光照片中的“车轮”和红外照片中的“车轮”最终在它记忆中的同一位置相遇。
    • 它将相似的事物拉近(如两个车轮)。
    • 它将不同的事物推远(如车轮和人)。

通过这样做,AI 学习了一个统一特征空间。将其想象为一个单一的、共享的文件柜,无论文件来自彩色相机还是热成像相机,“汽车”都存储在同一个抽屉里。AI 不再关心颜色或热量,而是开始关心形状和结构

新数据集:“巨型图书馆”

为了训练这个 AI,作者构建了一个名为MVIP的大型新图书馆。

  • 它包含近99,000 对完美匹配的可见光和红外照片。
  • 这些照片涵盖了从高速公路驾驶到监控摄像头观察,再到无人机飞行的各种场景。
  • 在此之前,研究人员不得不将小型、杂乱的数据集拼凑在一起。现在,他们拥有一个干净、巨大的图书馆用于训练。

结果:集两者之长

当他们测试 UNIV 时,结果令人印象深刻:

  • 更好的红外视觉:在诸如在黑暗中寻找汽车(目标检测)或勾勒物体轮廓(分割)等任务上,UNIV 击败了所有先前的模型。它显著提高了准确率。
  • 日间表现无损:至关重要的是,教会 AI 理解热量并没有让它看颜色的能力变差。它保持了与以往一样敏锐的“日间视觉”。
  • 高效性:他们仅通过微调模型大脑的一小部分(使用一种称为 LoRA 的技术)就取得了这些结果,使其训练非常高效。

总结

简而言之,UNIV是一种新型 AI,它不再将可见光和红外视为两个分离的世界。通过利用“教师”进行引导,并借助一个包含配对照片的大型新图书馆,它学会了洞察物体的本质。无论是白天还是黑夜,是颜色还是热量,UNIV 现在都能理解它所看到的内容,使其在现实世界应用中更加稳健和可靠。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →