Current Injection Spiking Neural Network for Infrared and Visible Image Fusion
本文提出了 CIS-Fuse,这是一种能效型脉冲神经网络,它通过一种新颖的电流注入算子在膜电位层面进行跨模态整合,解决了红外与可见光图像融合中二进制脉冲造成的信息丢失问题,在实现最先进融合质量的同时,其推理能耗显著低于同类基于人工神经网络(ANN)的方法。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图为机器人构建一个终极摄像头,让它能在任何情况下都能完美视觉。你有两只不同的眼睛:一只“可见光”之眼,能看到惊人的色彩和纹理,就像人类一样,但它在黑暗或烟雾中会变盲;另一只“红外线”之眼,能感知热量,因此可以在全黑或浓雾中发现人影,但看起来就像一个模糊的灰色热成像团块,缺乏精细细节。目标是通过**图像融合(Image Fusion)**将这两只眼睛融合成一个超级视觉系统,从而兼具两者的优点。
长期以来,科学家们一直尝试使用**人工神经网络(ANN)**来实现这一点。你可以把它们想象成一个超级快速、却又极其疲惫的会计师,无论数字多么微小或不重要,他都会把每一项都加起来。这种方法效果很好,但非常耗能,就像为了检查邮件而跑了一场马拉松。
**脉冲神经网络(SNN)**登场了。它们的设计灵感源自我们真实的脑部结构。与其不断地进行数值累加,它们更像是一个充满等待“呐喊”的人群。只有当发生了一些有趣的事情时,它们才会发出一个信号(即脉冲)。这使得它们具有极高的能效,就像一盏只有在有人走入房间时才会亮起的灯泡。然而,这里有一个陷나:因为它们只有在声音足够大时才会“呐喊”,所以可能会错过重要的微弱信息。如果一个热信号太弱,不足以让神经元“呐喊”,它就会被忽略,导致机器人丢失关键细节。
这就是一篇新论文发挥作用的地方。研究人员(由 Rui Zhao 及其同事领导)提出了一个聪明的技巧,叫做 CIS-Fuse。他们不再等待神经元在“呐喊”(发出脉冲)之后才进行两种视觉的混合,而是在“呐喊”发生之前就进行混合。他们使用了一种称为**电流注入(Current Injection)**的机制,将来自另一只眼睛的微弱信号轻轻注入到另一侧神经元的“电池”(膜电位)中。这样一来,即使某个红外信号太微弱,无法独自触发呐喊,它仍然可以通过与另一侧眼睛的信号结合,帮助将神经元推向触发呐喊的临界点。
其结果是,该系统既保留了“呐喊式”大脑超低的能耗,又不会丢失精细细节。团队在四个数据集上进行了测试,发现他们的方法生成的融合图像与那些沉重且耗能的“会计师”(ANN)一样出色,但运行能耗却降低了约 10 倍。他们还展示了使用这些融合图像的机器人,在黑暗中识别汽车和人的能力得到了提升,证明了你并不需要通过消耗大量电力来获得清晰的视野。
问题所在:“太安静而无法呐喊”的困境
要理解为什么这篇论文意义重大,我们需要观察两种截然不同的信息处理方式之间的张力。
一方面,是驱动现代 AI 的人工神经网络(ANN)。它们就像是一股巨大的、连续的水流。每一滴水(每一份数据)都会被测量并混合在一起。这对于捕捉每一个微小的细节(无论是强光还是微弱阴影)都非常出色,但代价昂贵。它需要大量的计算能力,会迅速消耗电池。对于像无人机或自动驾驶汽车这类需要在有限电力下全天运行的设备来说,这是一个问题。
另一方面,是脉冲神经网络(SNN)。它们是神经系统的数字化版本。SNN 中的神经元在接收到足够的输入并跨越“阈值”之前会保持静默。一旦跨过这条线,它们就会发出一个单一的、二进制的脉冲(1)。如果没能跨过这条线,它们就会保持沉默(0)。这种方式极其高效,因为系统只在有趣的事情发生时才做功。
当尝试使用 SNN 进行图像融合时,问题就出现了。融合需要提取红外相机中的微弱信号(例如一个人的微弱热特征)和可见光相机中的强信号(例如树木的纹理),并将它们完美地融合。在标准的 SNN 中,如果红外信号太弱,不足以让神经元发出脉冲,它就会被丢弃。这就像试图将耳语与呐喊混合在一起:如果你只听呐喊,就会错过耳语。论文指出,这种“二进制”特性丢弃了正是让融合变得有用的互补信息。
解决方案:在呐喊之前进行混合
本文作者提出的 CIS-Fuse 意识到,解决方案在于膜电位(Membrane Potential)。在生物神经元(以及 S สNN)中,在神经元发出脉冲之前,它会在其“电池”(膜电位)中积累电荷。这个电池可以保留输入信号,即使该信号还不足以触发一次呐喊。
论文提出了一种名为**电流注入脉冲(Current Injection Spiking, CIS)**的新算子。简单来说,它的工作原理如下:
- 设置: 想象两条数据流:一条来自红外相机,一条来自可见光相机。
- 注入: 系统并没有让它们互相竞争谁能发出脉冲,而是将“辅助”流(例如红外)作为“门控电流”注入到“主”流(例如可见光)的“电池”中。
- 门控: 有一个聪明的门控器(学习型门控)决定允许多少辅助信号进入。它还为每一路信息通道配备了一个特殊的旋钮(可学习的缩放因子),允许系统说:“嘿,这个特定的细节很重要,让我们增强它,”或者“这个不需要,保持低水平。”
- 融合: 两路信号在神经元决定是否发出脉冲之前,就在“电池”内部进行了混合。这意味着,即使可见光信号本身不足以触发脉冲,一个微弱的红外信号也能帮助将神经元推向触发状态。
这种方法保留了那些原本会被丢弃的“细粒度”响应。这就像是一个团队,如果一个人站在大声说话的人旁边,即便他声音很小,依然能对最终决策做出贡献,而不是因为没先开口说话就被忽视。
架构设计:带有专业驾驶员的双车道高速公路
为了有效地实现这一目标,研究人员构建了一个特定的网络架构。他们并没有随意混合想法,而是设计了一个带有巧妙转折的双分支系统。
他们创建了两条平行的路径(分支)来处理图像:
- 浅层分支(The Shallow Branch): 该路径层数较少(仅包含一个特殊的融合模块块)。
- 深层分支(The Deep Branch): 该路径较长,将三个融合模块块堆叠在一起。
起初你可能会想:“为什么要设计两个不同长度的路径?”论文指出,这种不对称性使得网络能够自然地实现专业化。经过训练后,“浅层”分支和“深层”分支的行为开始出现差异。浅层分支学会了进行轻微的混合,而深层分支则学会了进行强力的、高强度的混合。这就像厨房里的两位厨师:一位是动作快速、手法轻盈的搅拌者,另一位则是重型搅拌机。两者结合,便能应对所有情况。
论文还引入了一个重参数化输出头(Reparameterized Output Head)。这是一个在技术上让系统在训练期间更聪明、在实际使用时更简单的技巧。在训练期间,系统使用复杂的、多分支的结构来学习如何组合图像的最佳方式。但在训练完成后,系统会将所有这些分支“坍缩”为一个简单的卷积层。这意味着最终产品就像标准层一样快速简单,没有额外的复杂负担。
结果:高质量,低能耗
研究人员在四个基准测试(红外与可见光图像数据集)上测试了 CIS-Fuse,并将其与包括 Text-IF、DCEvo 和 S4Fusion 在内的 15 种其他最先进的方法进行了对比。
视觉质量:
结果显示,CIS-Fuse 生成的融合图像与最优秀的基于 ANN 的方法一样出色。事实上,在所有指标的平均性能方面,它位居榜首。
- 它保留了黑暗中人物和车辆清晰的热成像轮廓。
- 它保留了可见光图像中树木和路标的精细纹理。
- 它不会像其他方法那样导致细节“冲淡”或使图像变得模糊。
下游任务:
论文并不仅仅停留在制作漂亮的图片。他们还测试了这些融合图像是否真的能帮助机器人看得更清楚。
- 目标检测: 他们使用融合后的图像来训练一个 YOLOv8s 检测器(一种寻找物体的系统)。CIS-Fuse 帮助该检测器达到了最高的精度(mAP 为 59.8),优于所有其他方法。它在困难条件下识别人和汽车的能力尤为突出。
- 语义分割: 他们还测试了一个对每个像素进行标注(类似于涂色书)的系统。CIS-Fuse 取得了最佳的整体得分(mIoU 为 74.3),这意味着它比竞争对手更能准确地勾勒出汽车、护栏和行人等物体的轮廓。
能效:
这是本论文的“杀手锏”。由于 CIS-Fuse 使用脉冲神经元,它只在产生脉冲时才做功。
- 研究人员测量了神经元的“发放率”(firing rate),发现平均而言,在任何给定时间,只有约 14.48% 的神经元在发放脉冲。
- 使用标准的能量模型,他们估计 CIS-Fuse 的能耗大约比规模相似的 ANN 方法(特别是 DCEvo)低出一个数量级(10 倍)。
- 随着图像分辨率的增加,这种节能效果变得更加显著。
本文排除了哪些方案
论文明确指出了哪些方法不如其方法有效:
- 简单相加: 仅仅将两张图像相加(逐元素相加)或将它们堆叠并通过一个简单的滤波器,表现明显较差。它忽略了信号之间应如何相互作用的细微差别。
- 单向融合: 仅在一个方向进行信号混合(例如,仅从红外到可见光,而非双向)的效果比双向混合差。论文认为,两种模态都需要相互优化。
- 对称分支: 使用长度完全相同的两个分支(对称设计)的效果不如其不对称(浅层 vs 深层)设计。论文指出,不对称性是让网络实现专业化并学习不同角色的关键。
- 简单神经元: 使用较旧、较简单的神经元模型(如没有可学习参数的标准集成发放模型或漏电集成发放模型)会导致性能下降。论文强调,能够学习“时间常数”(即神经元记忆信号的时长)的能力至关重要。
总结
CIS-Fuse 论文表明,我们不必在能量效率和高质量图像融合之间做选择。通过将混合过程移至“膜电位”阶段——即在神经元决定呐喊之前进行信号混合——研究人员创造了一个既高效又极其有效的系统。
他们通过实验证明,该方法在视觉质量上可以媲美最先进、最耗能的 AI 模型,同时仅使用极少的电力。这为在无人机、机器人和自动驾驶汽车等电池供电设备上部署智能视觉系统迈出了重要一步,因为在这些领域,每一焦耳的能量都至关重要。作者对他们的研究结果充满信心,已在多个数据集和任务中进行了验证,并公开了代码供他人验证和进一步开发。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。