← 最新论文
💻 computer science

P2Fusion: Prompt-based Progressive Infrared-Visible Image Fusion via Dual-Prior Distillation

本文介绍了 P2Fusion,这是一种基于提示(prompt-based)的新型框架,它利用双重内在先验(dual intrinsic priors)和带有门控动态专家重校准(gated dynamic expert recalibration)的教导融合(Teach-to-Fuse)机制,以实现最先进的红外与可见光图像融合性能,并显著增强下游目标检测的鲁棒性。

原作者: Yi Shi, Huichao Xie, Yuqing Wang, Mingyu Wang, Kaihui Yang, Yu Liu, Ruitao Lu, Lizhe Li, Junwei Han, Dingwen Zhang

发布于 2026-08-14
📖 1 分钟阅读☕ 轻松阅读

原作者: Yi Shi, Huichao Xie, Yuqing Wang, Mingyu Wang, Kaihui Yang, Yu Liu, Ruitao Lu, Lizhe Li, Junwei Han, Dingwen Zhang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图拍出一张完美的、充满雾气的幽暗夜晚的照片。你有两台相机:一台能像蝙蝠一样在黑暗中观察(红外成像),它擅长发现热源,如人和汽车,但画面看起来模糊且缺乏细节;另一台是普通相机(可见光成像),它能看到清晰的纹理,如树枝和路标,但在黑暗或烟雾面前会完全“致盲”。图像融合是将这两张照片完美结合成一张“超级图像”的艺术,它兼具两者的优点。多年来,科学家们一直试图开发能够自动完成这一过程的计算机。其目标是帮助机器人、自动驾驶汽车和无人机在恶劣天气、夜晚或烟雾中清晰地“看见”,从而避免碰撞或错过重要目标。然而,教导计算机如何融合这两种截然不同的视觉方式而不破坏细节,一直是一个棘手的难题。

这项研究背后的研究人员开发了名为 P²Fusion 的系统,他们决定不再强迫计算机遵循死板、预设的规则。相反,他们发明了一种新的方法,通过使用“动态提示”(dynamic prompts)来教导 AI 如何融合图像——这些提示就像是灵活变化的启发,而非严格的指令。他们将这种方法称为“教导式融合”(Teach-to-Fuse)。

这里存在的问题是:过去,科学家们尝试通过给计算机提供静态的“先验知识”来引导它,比如关于物体“应该”出现在哪里나的固定地图,或者像“始终保持边缘锐利”这样的硬性规则。作者认为,这就像是在开车时使用一张永远不会更新的地图;如果道路发生了变化,驾驶员就会感到困惑。其他方法尝试使用大规模的预训练 AI 模型(例如识别猫或狗的模型)来提供提示,但作者发现这些提示往往过于笼统和高层化,缺失了完美照片所需的微观像素级细节。

为了解决这个问题,P²Fusion 采用了巧妙的两步走策略。首先,它扮演着一个聪明的老师的角色,它不只是直接给出答案,而是教导 AI 如何从图像本身中学习。它使用了两位“老师”:

  1. 热成像老师(The Thermal Teacher): 这位老师观察红外图像,并标出需要保留的“热点”(如人或汽车)。
  2. 质量老师(The Quality Teacher): 这位老师观察可见光图像,并指出哪些部分清晰锐利,哪些部分模糊或黑暗。

系统并没有将这些提示进行硬编码,而是将它们转化为“提示”——即灵活的、可学习的信号,用以引导 AI 工作。这就像一位指挥家在领导一支管弦乐队:指挥家并不是在每一秒都告诉每位乐手该演奏哪个音符(这既死板又容易出错),而是根据音乐实际呈现出的效果给出动态线索,帮助乐手进行实时调整。

他们发明的第二部分是一个名为 GDER(门控动态专家重校准)的特殊模块。想象一下一个由两名专家组成的解谜小组:一名专家擅长寻找“热目标”(模态专家),另一名专家擅长观察整体结构与纹理(注意力专家)。在许多旧系统中,这两者只是简单地将想法混在一起,往往会导致混乱。P²Fusion 使用了一种“门控”机制——一个聪明的裁判——来决定在每一时刻给予每位专家多少权重。如果场景中有烟雾,裁判可能会更多地听取热成像专家的意见;如果场景明亮但杂乱,它则可能更多地听取纹理专家的意见。这使得系统能够自我纠错,并在两种视觉类型之间实现完美的平衡。

作者在五个不同的数据集上测试了他们的新系统,包括重烟雾、极端亮度以及夜间驾驶场景。结果显示,P²Fusion 的表现始终优于现有的最佳方法。事实上,在这些测试中,它在 20 个关键测量类别中的 14 个 中都名列前茅。它不仅看起来更好,实际上还提高了计算机检测物体的准确度。例如,在利用其辅助无人机识别车辆时,它在一个数据集上将检测准确度提升了 3.2%,在另一个数据集上提升了 0.9%。即使在面对完全陌生的环境(如从未见过的航拍无人机画面)时,该系统依然表现稳健,没有出现崩溃或失效的情况。

简而言之,这篇论文表明,通过放弃死板、静态的规则,转而使用由智能、自校正专家团队引导的灵活、基于图像的“提示”,我们可以创造出更好的在黑暗或浓雾中观察的工具。作者相信,这种方法解决了保持图像锐利与保留重要目标可见性之间的冲突,为未来的自主机器提供了一种更具适应性的解决方案。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →