← 最新论文
💻 computer science

SQCAFusion: Multi-Scale Scene-Query Cross-Attention for Illumination-Adaptive Infrared and Visible Image Fusion

本文提出了 SQCAFusion,一种光照自适应的红外与可见光图像融合框架,该框架采用具有可学习场景标记的多尺度场景查询交叉注意力机制,在早期编码阶段动态调节特征,从而解决场景盲性问题并提升不同光照条件下的融合质量。

原作者: Yunfei Chen, Juan Zhang, Yongbin Gao, Bo Huang

发布于 2026-09-22
📖 1 分钟阅读☕ 轻松阅读

原作者: Yunfei Chen, Juan Zhang, Yongbin Gao, Bo Huang

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在机器视觉领域,摄像机经常受到光物理特性的限制。标准摄像机看到的景象与人类眼睛非常相似,能够捕捉丰富的色彩和细腻的纹理,但在阳光西下或烟雾弥漫时却显得力不从心。相比之下,热成像摄像机探测的是热量而非光线,这使得它们即使在完全黑暗的环境中也能清晰地看到生物,但其生成的图像往往模糊且呈灰色,缺乏普通照片那样的锐利细节。几十年来,工程师们一直试图将这两类图像合并成一张完美的图像——既拥有白天的清晰度,又具备夜视设备的感热能力。这一被称为“图像融合”的过程,对于从在雾天行驶的自动驾驶汽车到在敌对环境中进行军事监视等各种应用都至关重要。然而,一个持久的问题一直困扰着这些尝试:大多数旨在合并这些图像的计算机程序都是“场景盲”的。它们对晴朗的白昼和漆黑的夜晚采取完全相同的处理方式,未能意识到合并图像的规则应当根据光照情况而改变。这种盲目性经常导致结果出现问题:例如,黑夜的黑暗放大了静态噪声,或者晴朗白天的鲜艳色彩被冲淡,导致最终图像变得浑浊且混乱。

上海工程技术大学的研究团队开发了一种新方法来解决这一特定问题,创建了一个名为 SQCAFusion 的系统。该方法并非等到处理过程结束才去调整光照条件,而是要求计算机在最开始阶段就理解环境。想象一位翻译官,在读一本书之前,先检查当天的时间以决定使用正式还是随意的语言;类似地,这个新系统首先分析场景,以确定是白天还是黑夜。然后,它利用这种知识,从一开始就主动引导融合过程,而不是仅仅在最后进行补救。研究人员发现,通过将这种“场景感知”直接注入特征提取的早期阶段,计算机可以动态地决定在可见光图像与热成像图像之间分配多少权重。如果可见光图像昏暗且充满噪声,系统会学会更多地信任热数据,同时仍保留可见世界的锐利边缘。如果场景明亮,它则会优先考虑标准摄像机的丰富纹面向和色彩。

这项创新的核心是一个充当动态滤波器的机制。系统生成一组代表场景光照条件的数字标记(tokens)。这些标记随后充当查询指令,询问计算机哪些图像特征是重要的,哪些仅仅是噪声。这一过程跨越多个尺度进行,这意味着系统同时检查物体的宏观轮廓和纹理的微观细节。通过这种方式,计算机可以在不模糊重要目标(如行人或车辆)的前提下,抑制经常困扰低光照照片的颗粒状噪声。研究人员还引入了一种聪明的训练策略,以应对从劣质数据中学习的难度。当计算机针对极暗图像进行训练时,噪声有时会误导学习过程,使其认为颗粒状的静电噪声实际上是真实的边缘或物体。为了防止这种情况,系统被教导在检测到黑暗场景时,自动降低对可见光图像质量的预期。这使得模型能够忽略噪声,同时依然能忠实地捕捉到场景的真实结构。

该新框架的研究结果通过多个数据集(包括城市街道场景、军事伪装场景和复杂的道路环境)与多种现有方法进行了对比测试。在针对一千多对图像对进行的标准测试中,该方法在信息保留和视觉清晰度的关键指标上均优于以往所有最先进的算法。它成功地保留了更多的细节,并创造出了比竞争对手对比度更高的图像。或许更令人印象深刻的是,该系统展示了卓越的泛化能力。当研究人员将其应用于从未见过的全新数据集(从高清晰度道路交通场景到单通道军事热成像图像)时,该模型无需重新训练或调整。它保持了高性能,生成的图像清晰锐利,既能使热目标保持突出,又能保留背景的自然外观。在其他方法产生模糊光晕或丢失细节的低光照条件下,这种新方法保持了物体边缘的清晰以及背景的洁净。

这项研究证实,提升图像融合效果的关键不仅在于拥有强大的硬件,还在于赋予软件理解其工作上下文的能力。通过从僵化的“一刀切”模式转向能够实时适应光照条件的动态系统,研究人员创造出了一种在现实应用中更加鲁棒的工具。这项工作表明,未来的视觉系统需要具备上下文感知能力,以应对物理世界中不可预测的特性。虽然目前的模型依赖于对场景的全局理解,但研究人员指出,未来的迭代可以专注于更精细的细节,从而可能实现更复杂环境下的实时自适应。目前,该方法代表了在使机器视觉在黑暗中变得可靠方面迈出的重要一步,确保关键细节不会消失在阴影之中。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →