Bringing Multimodal Large Language Models to Infrared-Visible Image Fusion Quality Assessment
本文提出了 FuScore,这是一种新颖的红外 - 可见光图像融合质量评估框架,它利用多模态大语言模型生成连续质量评分,并采用带有软标签的三部分目标,从而通过克服现有离散和标量评估方法的局限性,实现了与人类视觉偏好最先进的相关性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
以下是论文《将多模态大语言模型引入红外 - 可见光图像融合质量评估》(FuScore)的通俗解释,辅以生动的类比。
宏观图景:将两台相机合二为一
想象你在夜间拍摄同一场景时,有两台相机同时工作。
- 相机 A(红外): 感知热量。它能发现躲在黑暗中的人,因为人体是温暖的,但画面模糊且缺乏细节。
- 相机 B(可见光): 感知光线。它能呈现树枝或路标等清晰的细节,但如果光线太暗,画面就会一片漆黑。
图像融合就是将这两张照片合二为一,生成一张兼具热成像能力和清晰细节的“超级照片”。这对于自动驾驶或安防系统等应用至关重要。
问题所在:我们如何判断这张“超级照片”好不好?
该论文指出,目前评估这些“超级照片”的方法存在缺陷。
- 旧方法(数学公式): 科学家过去使用僵硬的数学公式(例如计算图像中包含多少“信息”)来评估。论文认为,这就像仅通过计算胡萝卜和土豆的数量来评判一道汤的食谱。你可能有很多食材,但汤的味道可能依然糟糕透顶。这些公式往往会给丑陋、模糊的图像打出高分。
- “独热”式 AI 方法: 最近,人们尝试利用人工智能(大语言模型)来评估照片。但他们强迫 AI 像学校成绩单一样给出一个等级:"1、2、3、4 或 5"。
- 缺陷: 想象两名学生分别得了 94.5 分和 94.8 分。如果你强迫他们将分数归入"A"或"B"类,你就会失去细微的差别。论文指出,强迫 AI 选择一个单一的整数等级(如"4 级”),会使其忽略两张极其相似的图像之间微小但重要的差异。这就像因为一幅画得了"4 分”而另一幅得了"3 分”,就断言这两幅几乎相同的画作属于完全不同的艺术画廊。
解决方案:FuScore
作者们开发了 FuScore,这是一种更像人类专家的新型 AI 评估员。
1. “连续评分”类比
FuScore 不再问 AI:“这是 4 分还是 5 分?”,而是问:“在 1 到 5 分的量表中,它具体落在哪里?”
- 旧 AI: “这是 4 分。”(离散)
- FuScore: “这是 4.75 分。”(连续)
这使得 AI 能够区分两张几乎相同的图像,这对于微调融合技术至关重要。
2. “群体共识”类比
FuScore 如何知道其评分应该有多精确?它依据用于评估这些图像的 四个具体标准:
- 热保留度: 是否保留了热斑?
- 纹理: 细节是否清晰?
- 伪影: 是否存在奇怪的故障或噪点?
- 清晰度: 图像是否清晰?
- 情景 A(一致): 如果四个标准都说:“这是一张很棒的图像”,FuScore 就会给出一个非常精确、自信的分数(例如 4.8)。
- 情景 B(分歧): 如果图像热保留度很好但伪影严重,这四个标准就会相互争论。FuScore 会意识到:“嗯,人类可能会对此产生分歧。”因此,它会给出一个更宽泛、更模糊的分数范围,以反映这种不确定性。这就像一位老师说:“这篇作文不错,但由于语法和故事情节相互矛盾,我无法 100% 确定该给它打多少分。”
3. “三部分训练”
为了训练这个 AI,作者们没有一次只展示一张照片。他们采用了一种三部分训练策略:
- 第一部分(个体): 教导 AI 基于四个标准的“共识”,对单张照片给出正确的分数。
- 第二部分(同一场景): 向 AI 展示由不同方法生成的同一场景的两张照片。问它:“哪一张更好?”这教会它公平地排名各种方法。
- 第三部分(不同场景): 向 AI 展示来自 不同 场景的照片(例如森林与城市)。这教会它,某些场景本身就比其他场景更难融合,因此它不会因背景的难易程度而感到困惑。
结果
论文将 FuScore 与以下对象进行了测试:
- 旧的数学公式。
- 其他 AI 评估员。
- 人类专家。
结果: FuScore 比其他任何方法都更贴合人类的偏好。它特别擅长发现其他方法所忽略的高质量图像之间的微小差异。它还证明,当四个标准(热、纹理等)出现分歧时,人类专家的分歧也会更大,这证实了 FuScore 的“不确定性”功能是真实且有用的。
总结
FuScore 是一种用于融合图像的新型 AI 评估员,它不再将质量评估视为多项选择题。相反,它像一位细致的人类评论家,给出精确的小数分数,并承认当图像的各个部分相互冲突时,图像难以评估。它通过观察不同质量因素之间的一致性,并通过并排比较图像进行学习,从而构建出一个比旧数学公式或僵硬的 AI 评分器更能理解人类品味的系统。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。