← 最新论文
💻 computer science

Fusion in Your Way: Aligning Image Fusion with Heterogeneous Demands via Direct Preference Optimization

本文提出了 DPOFusion,这是一个直接偏好优化框架,它集成了属性对齐且偏好可控的潜在扩散模型,以实现能够适应异构人机视觉需求的自适应红外与可见光图像融合。

原作者: Weijian Su, Songqian Zhang, Yuqi Han, Jian Zhuang, Yongdong Huang, Qiang Zhang

发布于 2026-05-08
📖 1 分钟阅读☕ 轻松阅读

原作者: Weijian Su, Songqian Zhang, Yuqi Han, Jian Zhuang, Yongdong Huang, Qiang Zhang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你有两台相机同时拍摄同一场景。一台是可见光相机(如你的手机),它能呈现出色的色彩和纹理,但在黑暗中表现不佳。另一台是红外相机,它在黑暗中能清晰捕捉热信号,但成像看起来像模糊的黑白热幽灵。

图像融合就是将这两张照片融合成一张完美图像的艺术,使其兼具两者的优点。

问题:“一刀切”行不通

论文指出现有融合方法的一个主要痛点:它们过于僵化

想象你请一位厨师烹饪牛排。

  • 人类可能会说:“我要五分熟,带点焦香。”
  • 保安可能会说:“我不在乎味道;我只需要看清人脸以便识别。”
  • 自动驾驶汽车可能会说:“我需要完美看清道路边缘,以避免撞到行人。”

现有的融合模型就像只会按一种特定方式烹饪的厨师。如果你想要不同的结果,就必须聘请一位全新的厨师(训练一个全新的 AI 模型),使用新的食谱。这既缓慢、昂贵,又不灵活。

解决方案:“按你的方式融合”

作者提出了一种名为DPOFusion的新系统。你可以将其想象为一位带有“味觉”调节旋钮的超级厨师

这位厨师无需为每位顾客从头制作新菜肴,而是以一道高质量的基础菜为起点,然后根据你确切的要求即时调整。

以下是其工作原理的简化步骤:

1. “品尝菜单”生成器(PALDM)

首先,系统生成多种不同融合结果的“品尝菜单”。

  • 它接收两张源照片(可见光和红外)。
  • 它利用一种特殊的 AI(潜在扩散模型)生成各种各样的融合图像。有些可能 90% 是红外,有些是 50/50 混合,有些增强纹理,有些提升对比度。
  • 类比:想象一位画家快速绘制了 50 幅不同的风景草图,每幅在光照或焦点上略有不同。这为系统提供了一个巨大的选项池供其选择。

2. “味觉测试”(收集偏好)

现在,系统需要知道哪个版本是“最佳”的。但“最佳”取决于提问者是谁。

  • 对于人类:一个人查看草图并说:“我喜欢这里汽车的纹理,但天空看起来很奇怪。”他们会标记出好的部分和坏的部分。
  • 对于机器:一个安防摄像头(目标检测 AI)查看草图并说:“我在这一张里看不见人,但在另一张里能看清。”
  • 对于 AI 评论家:一个智能语言模型(VLM)扮演美食评论家的角色,根据技术质量(清晰度、无噪点、自然色彩)对图像进行排名。

3. “魔法旋钮”(直接偏好优化 - IDPO)

这是论文的秘诀。他们不使用重新训练整个厨师的方法,而是采用一种称为**直接偏好优化(DPO)**的技术。

  • 旧方法:要让模型学习新的偏好,通常需要从底层重新训练它,这就像把厨师送回烹饪学校学习一年。
  • DPO 方法:系统查看“获胜”图像(你喜欢的)和“落选”图像(你不喜欢的)。然后,它对厨师的“大脑”进行微小而精确的调整,使下一张图像更像获胜者。

“掩码”技巧(实例直接偏好优化):
有时你只想改变图像的一部分

  • 示例:“让汽车更清晰,但不要动天空。”
  • 系统使用掩码(像模板一样)。它告诉 AI:“只调整模板内的像素以符合偏好。模板外的所有内容保持完全不变。”
  • 这确保了如果你要求更好的汽车细节,就不会意外破坏天空或背景。

结果

论文在真实世界数据集(如夜间街景)上测试了这个“魔法旋钮”系统。

  • 人类反馈:当被要求让图像看起来更自然时,系统完美地调整了颜色和纹理。
  • 机器反馈:当被要求帮助自动驾驶汽车“看得更清楚”时,系统调整图像以突出行人和车辆,使汽车的检测软件更加准确。
  • 多功能性:同一个基础模型只需更改提示词,即可在“人类模式”、“安防模式”和“驾驶模式”之间切换,而无需重新训练。

总结

DPOFusion 是一个灵活的图像融合器,它从反馈中学习。无论你是想要一张漂亮照片的人类、需要清晰细节的安防系统,还是需要避开障碍的机器人,该系统都能即时调整融合结果以满足你的特定需求,同时保持图像其余部分的完美。它将我们从“一个模型适用于所有人”转变为“按你的方式融合”。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →