← 最新论文
💻 computer science

SMM Transformer: Leveraging Spiking Neural Networks for Multimodal Tasks

本文介绍了 SMM Transformer,这是一种利用具有稳定训练机制和脉冲驱动注意力的脉冲神经网络的新型多模态框架,旨在实现具有竞争力的准确率,同时与传统的 ANN 基准相比显著降低计算能耗。

原作者: Xiubo Liang, Jinxing Han, Yuke Li, Haoqi Zhu, Yu Zhao, Hongzhi Wang

发布于 2026-08-04
📖 1 分钟阅读☕ 轻松阅读

原作者: Xiubo Liang, Jinxing Han, Yuke Li, Haoqi Zhu, Yu Zhao, Hongzhi Wang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一个这样的世界:计算机不再仅仅是像永不满足的计算器那样进行枯燥的数据运算,而是像人类大脑中的神经元一样,发射出微小的电火花。这就是脉冲神经网络(Spiking Neural Networks, SNNs)的世界。与传统的 AI 不同,传统 AI 即使在没有新信息时也会不断地吞噬数据,而 SNNs 是“事件驱动”的。它们只有在发生有趣的事情时才会苏醒并发送信号,这使得它们具有极高的能效。这就像是一个只有在你走进房间时才会开启的灯开关,而不是一个 24 小时常亮的灯泡。

然而,这里有一个难点。虽然这些基于“火花”的大脑在节省能量方面表现出色,但在处理复杂的、多感官的任务(例如观察一张图片并写一段关于它的故事)时却显得力不从心。目前这类任务的“金标准”使用的是一种被称为“注意力机制”(attention)的沉重且耗能的方法,它强迫计算机将每一个单词与每一个单词进行比较,将每一个像素与每一个像素进行比较。这就像是在一场盛大的派对上,在大家开始交谈之前,必须先让在场的每一个人都逐一向其他所有人做自我介绍。这篇论文提出了一个问题:我们能否构建一个基于“火花”的大脑,既能处理这些复杂的、多感官的工作,又不会消耗掉所有的能量?

于是,由 Xiubo Liang 及其团队提出的新框架——SMM Transformer 应运而生。他们不仅仅是试图让旧有的基于“火花”的系统运行得更好一点,而是从底层进行了重构,以应对图像与文本混合带来的混乱。

首先,他们解决了深层复杂网络的问题。标准的脉冲神经元在堆叠过高时非常脆弱且难以训练。团队发明了一种新型神经元,称为 PLMP。如果把标准神经元比作一根单一且僵硬的管道,让水流(信息)通过;那么 PLMP 就像是一捆大小不一、并行的管道,每根管道都有自己的调节阀。这使得系统能够更稳定地学习如何处理不同速度和模式的信息。他们还创造了一种特殊的训练方法 P-STBP,来教这种新神经元如何在不产生混乱的情况下进行学习。

接下来,他们必须解决“注意力”问题。旧的注意力方式就像一个拥挤的房间,每个人都在同时向其他人大声喊出自己的名字——嘈杂、混乱且极其耗能。团队用 SMSA(脉冲 MLP 自注意力机制)取代了它。SMSA 不再是那种混乱的喊叫赛,而是像黑暗房间里的一系列手电筒光束。它会检查图像中的一个“闪烁”(脉冲)是否与文本中的一个“闪烁”相匹配。如果它们同时亮起,它们就会建立连接;如果不是,则保持黑暗。这跳过了将所有事物相互比较的繁重数学运算。为了确保这种稀疏性不会导致丢失重要细节,他们增加了一个“自我补偿”分支,充当一个安全网,捕捉可能从缝隙中溜走的信息。

最后,为了处理图像与文字的结合,他们引入了 SMoE(脉冲专家混合模型)。可以将它想象成繁忙路口的一个智能交通控制器。它不会强迫每一辆车(数据)都走同一条路,而是将图像密集型数据引导至“视觉专家”车道,将文本密集型数据引导至“语言专家”车道,并将混合型数据引导至专门的“视觉-语言”车道。这使得不同类型的信息既不会互相碰撞,又能保持互动。

结果如何?SMM Transformer 是一个强有力的竞争者。在描述图像或实现图文匹配等任务测试中,它取得了足以媲美那些沉重且耗能的传统模型的准确率。事实上,在图像描述任务中,SMM Transformer-Large 模型取得了 45.33 的 BLEU-4 分数128.72 的 CIDEr 分数,这些数字是非常具有竞争力的。但真正的魔力在于节能。研究人员估计,通过使用他们的新型注意力方法,模型中注意力部分的能耗降低了高达 97%。即便看整个模型,能耗也实现了 21.6% 的稳健下降,且模型的运行速度提升了约 13.6%

这篇论文并不声称这是一个适用于所有未来可能用途的完美、最终成品,但它指明了一条清晰的前行路径。它证明了你可以构建出深层的、复杂的、多感官的 AI 系统,而这些系统是运行在“火花”而非“洪流”般的电力之上的。通过将沉重、密集的数学运算替换为稀疏、事件驱动的脉冲,SMM Transformer 表明我们可以既拥有高准确率,又拥有低能耗,为开发更智能、更环保的 AI 铺平了道路,这种 AI 有朝一日或许能在智能手表或眼镜这样微小的设备上运行。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →