在计算机视觉领域,机器往往难以像人类那样观察世界,尤其是在光线变暗或天气恶劣的情况下。为了解决这个问题,科学家们长期以来一直将两种不同类型的摄像传感器结合在一起:一种能够看到具有颜色和纹理的可视世界,另一种则能探测到物体散发出的不可见热量。其目标是将这两种视图合并成一张图像,从而兼具两者的优势:既有白天的丰富细节,又具备在全黑环境下发现热源人体的能力。然而,简单地融合这些图像并非易事。当计算机尝试进行组合时,人或汽车的热量往往会渗入周围的背景中,产生一种模糊且发光的晕影,从而遮蔽了细节。此外,修复这些问题所需的复杂数学运算往往需要极高的计算能力,这会降低实时应用的效率,使得该技术在许多应用场景中变得不切实际。
哈尔滨工业大学的研究人员开发了一种名为 AdaFuse 的新方法来解决这些特定问题。他们的方法侧重于在数据合并之前进行更智能的数据处理。该系统不再对图像的每个部分都投入同样的沉重计算量,而是首先分析可见光图像,以判断哪些部分是简单的,哪些是复杂的。如果图像的一个区域比较简单,系统会通过一条浅层路径对其进行快速处理;如果一个区域包含复杂的细节或显著的色彩变化,它则会被引导至一条更深、更密集的处理路径。这种自适应策略使计算机能够通过不对图像的简单部分过度用力来节省能量,同时仍为需要仔细处理的复杂区域投入必要的资源。
这项工作的一项重大创新是旨在解决“光晕”问题的技术。在以往的方法中,目标的明亮热特征往往会在黑暗背景中不受控制地扩散,从而冲淡了周围环境的纹理。这种新算法使用了一种类似于精确边界的校准方法。它识别出图像中最热的部分,然后刻意抑制其紧邻区域的信号。通过这种方式,系统确保热目标保持明亮且清晰,而背景则保持锐利并真实还原其原始外观。这防止了那些常使融合图像看起来不自然或模糊的人造晕影现象。
为了确保最终结果对机器和人类都具有良好的视觉效果,研究人员还构建了一个专门的训练系统。该系统充当一名严格的裁判,通过将融合后的图像与原始来源进行对比,以确保没有丢失或扭曲任何重要细节。它密切关注边缘和纹理,确保建筑物的线条或树叶的轮廓依然清晰锐利。团队在包含数千对图像对的公开数据集上测试了他们的方法,这些图像拍摄于各种条件下,从晴朗的白天到雾蒙蒙的夜晚。结果表明,他们的方法不仅产生了对比度更高、更清晰的图像,而且处理速度比许多现有方法都要快得多。平均而言,新系统处理一张图像仅需 0.0065 秒,这一速度使其在实时应用中具有可行性。
实验表明,该方法在平衡两种类型信息方面表现尤为出色。在其他方法在色彩平衡方面表现挣扎或产生过多噪声的测试中,AdaFuse 在突出热目标的同时保持了自然的外观。例如,在有烟雾或低光照的场景中,该系统成功地突出了行人和车辆,同时没有丢失环境的结构细节。研究人员发现,通过仔细控制热信息的扩散方式,他们可以达到以往方法无法企及的细节度和清晰度。这项工作表明,通过更有选择性地决定如何以及在哪里应用计算能力,并严格控制热特征与背景的相互作用,我们可以创造出既具有高度信息量又具有视觉可靠性的融合图像。
技术摘要:AdaFuse
1. 问题陈述
跨模态图像融合,特别是红外(IR)与可见光(VIS)图像之间的融合,面临两个主要挑战:
- 特征贡献失衡: 融合图像经常受到一种模态(通常是高能红外)的主导,导致颜色失真、过度饱和以及可见光纹理细节的丢失。
- 计算效率低下: 现有的深度学习方法(例如使用残差连接或密集拼接的方法)往往会导致中间张量维度显著增加。这导致了高昂的计算成本和复杂的通道拼接操作,在没有必然提升融合质量的情况下阻碍了效率。
此外,传统方法难以应对“高亮污染”问题,即热能从高温区域不加区分地扩散到周围的非热区域,从而产生伪晕(pseudo-halo)伪影并削弱目标显著性。
2. 方法论:AdaFuse
作者提出了 AdaFuse,一种基于**负值校准(Negative Value Calibration)和自适应分层激活(Adaptive Hierarchical Activation)**的跨模态图像融合算法。该框架旨在动态分配计算资源并精确控制热特征的扩散。
2.1 自适应分层激活
AdaFuse 没有通过统一的深度网络处理所有图像特征,而是采用了分层特征感知策略:
- 通道分析: 算法分析可见光图像中 RGB 通道的平均强度偏差。
- 动态路由:
- 深层路径(Deep Path): 平均偏差较高的通道(表示显著的灰度信息或潜在的色彩偏差)被路由至深层网络分支,进行高层语义特征提取。
- 浅层路径(Shallow Path): 偏差较低的通道由浅层网络处理,以保留基础细节。
- 残差连接: 浅层网络的输出作为一个连接层,与经过深度处理的特征进行对齐。这种设计取代了传统的 ResNet 层,简化了通道拼接并减少了中间张量的数量。
2.2 负值校准与扩散控制
为了解决热能扩散(高亮污染)问题,论文引入了负值校准机制:
- 热源分割: 通过阈值分割从红外图像中提取热目标掩码(MIR)。
- 对称校准: 对于高温度像素,算法定义了一个热窗口和一个对称的非热背景窗口。它应用了距离衰减调制(Distance-Decay Modulation),将热响应的增强限制在目标区域内。
- 抑制: 周围非热背景中的像素受到对称抑制响应(1−β⋅FIR)的影响,其中 β 是基于距离热边界距离的、可学习的抑制系数。这防止了“晕圈”效应,并保持了热区域与非热区域之间清晰的梯度对比。
2.3 网络架构与判别器
- PTS 生成器: 精准热源(PTS)模块在局部窗口内使用轻量级的卷积块注意力模块(CBAM)来生成热显著性掩码,从而引导融合过程。
- CA-Net 判别器: 双分支判别器(RGB 分支和梯度感知分支)结合了**跨模态注意力(CA-Net)**机制。
- 可见光灰度特征作为查询项(Query, Q),而红外特征作为键项(Key, K)和值项(Value, V)。
- 这使得判别器能够自适应地在红外主导区域(如热边缘)权衡梯度约束,同时在可见光主导区域保留纹理细节。
2.4 损失函数
训练目标由一个综合损失系统引导:
- 自适应激活损失(LAAM): 根据局部内容权重(α)动态平衡红外与可见光特征之间的输出。
- 精准热源分割损失(Lmod): 由三部分组成:
- 中心约束: 确保热目标与红外响应保持一致。
- 邻域约束: 管理目标周围的过渡结构,以防止突变。
- 背景约束: 确保远端背景区域主要依赖可见光特征,以防止不自然的变暗或过度增强。
- 边缘损失: 显式加强热边界处的梯度对比度。
3. 核心贡献
- 自适应计算分配: 引入了基于信息密度路由特征的分层激活策略,与统一处理所有通道的方法相比,显著降低了计算负载(FLOPs)。
- 负值校准: 一种用于抑制热能不受控扩散的新机制,有效地消除了伪晕伪影并保持了背景保真度。
- 跨模态判别器(CA-Net): 该判别器设计利用跨模态注意力提供模态特定的监督,增强了结构保真度和纹理保留。
- 综合损失框架: 一个多项损失函数,共同优化热显著性、梯度保持和色彩平衡。
4. 实验结果
该方法在 MSRS 和 M3FD 数据集上进行了评估,并与包括 DDcGAN、SwinFusion、CrossFusion、DenseFusion 和 FreeFusion 在内的最先进方法进行了对比。
- 定量性能:
- 在 MSRS 数据集上,AdaFuse 比最佳基准方法的熵(EN)提高了 7.83%。
- 结构相似度(SSIM)提高了 4.23%,基于梯度的融合性能(QAB/F)提升了 14.96%。
- 在 M3FD 数据集上,该方法展示了卓越的泛化能力。针对单幅图像的具体结果包括 SSIM 为 0.8916(图像 04037)和 0.8932(图像 01443),VIF 分数分别为 0.8463 和 0.8584。
- 定性性能:
- 可视化结果显示,热目标增强与可见光细节保留之间达到了更好的平衡。
- 该方法有效地减少了色彩偏差(例如,过度的绿色通道主导)并防止了其他方法中出现的“晕圈”伪影。
- 在烟雾和低光场景下,AdaFuse 在保持目标可辨识性的同时,比竞争对手更好地保留了背景结构细节。
- 效率:
- 自适应路由机制允许计算成本根据输入复杂度而变化。对于通道间偏差较低的图像,成本显著降低。
- 平均推理时间为每张图像 0.0065 秒,优于 SwinFusion(0.0344s)等多个重型基准模型。
5. 意义与主张
论文声称,由于其分层感知和精确控制的框架,AdaFuse 为高光谱和医学图像融合等更广泛的任务提供了方法论参考。
作者断言,其方法:
- 在计算效率和融合质量方面均显著优于现有方法。
- 解决了模态贡献失衡和中间张量膨胀的特定问题。
- 通过有效处理热目标扩散而不牺牲可见光纹理,为复杂环境(黑夜、雾、雨)提供了鲁棒的解决方案。
- 在红外显著性增强与可见光纹理保留之间提供了良好的平衡,使其适用于下游视觉任务(如目标检测),在这些任务中,清晰的目标轮廓和背景保真度至关重要。
研究结论认为,所提出的框架有效地提高了结构清晰度和视觉质量,为智能感知系统的实际应用提供了强有力的支持。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。