← 最新论文
🤖 machine learning

Plug-and-Play Spiking Operators: Breaking the Nonlinearity Bottleneck in Spiking Transformers

本文提出了一种即插即用框架,通过模块化群体计算和位移缩放实现关键非线性算子(如 Softmax 和归一化)的脉冲友好近似,从而支持大型语言模型的免训练 ANN 到 SNN 转换,在无需微调的情况下实现了与原始模型近乎一致的精度。

原作者: Xinzhe Yuan (IASM, Harbin Institute of Technology), Xiang Peng (IASM, Harbin Institute of Technology), Bin Gu (School of Artificial Intelligence, Jilin University), Huan Xiong (IASM, Harbin Institute
发布于 2026-05-21
📖 1 分钟阅读☕ 轻松阅读

原作者: Xinzhe Yuan (IASM, Harbin Institute of Technology), Xiang Peng (IASM, Harbin Institute of Technology), Bin Gu (School of Artificial Intelligence, Jilin University), Huan Xiong (IASM, Harbin Institute of Technology)

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你拥有一个超级聪明的机器人大脑(一个大语言模型),它目前运行在标准计算机上。它非常擅长思考,但也非常耗电。现在,想象你想将这个大脑迁移到一种特殊的、超高效的“神经形态”芯片上——这是一种更像生物大脑工作的硬件,它使用微小的电脉冲(称为“脉冲”),而不是持续且沉重的电流。

问题在于,虽然机器人的“肌肉”(执行繁重计算的数学部分)可以轻松地被转换以适配这些脉冲,但其“大脑功能”(决定下一步说什么的复杂逻辑)却仍被困在旧系统中。这些功能,例如Softmax(帮助机器人选择最佳词汇)、SiLU(一种平滑滤波器)和RMSNorm(防止数值变得过大或过小),需要涉及除法和平方根等繁重的数学运算。基于脉冲的硬件非常排斥这些操作;这就像要求一辆自行车去参加高速赛车比赛一样。

解决方案:一个“即插即用”的适配器套件

本文的作者构建了一个即插即用工具包,充当翻译器。他们找到了方法,用“脉冲友好型”版本替换那些繁重且与脉冲不兼容的数学函数,使新硬件能够实际运行这些函数,而无需重新训练机器人或改变其大脑结构。

以下是他们如何做到的,使用了简单的类比:

1. “除法”问题:爆米花比赛

标准除法(如 10÷210 \div 2)对基于脉冲的大脑来说很难。作者创建了一个特殊的神经元组(“除法神经元组”),它就像一个爆米花比赛

  • 工作原理:想象你有一桶爆米花玉米粒(分子)和一个关于多少粒玉米粒能装进杯子的规则(分母)。你不需要做数学运算,只需将玉米粒倒入一排大小递增的杯子中。
  • 结果:你只需计算有多少个杯子被装满。这个计数就是除法的答案。这是一个巧妙的技巧,将一道困难的数学题变成了一个硬件喜爱的简单计数游戏。

2. “平方根”问题:CORDIC 梯子

计算对角线的长度(即平方根)对这些芯片来说也是另一个头疼的问题。作者使用了一种称为CORDIC的方法,他们将其描述为一个数字梯子

  • 工作原理:你不是通过一次巨大的跳跃来计算精确长度,而是通过只使用加法和减法(以及移位,这就像移动小数点)的小而简单的步骤,一步步爬上梯子。
  • 结果:在爬过几级梯级后,你利用硬件可用的简单工具,得出了一个非常准确的长度估计值。

3. “指数”问题:查找作弊表

计算 exe^x(指数)在计算上非常昂贵。作者用分段线性指数单元替换了它。

  • 工作原理:想象你需要知道一天中每个小时的温度,但你没有温度计。相反,你有一张预先写好的作弊表(查找表),上面写着:“如果是下午 1 点,温度大约是 75 度。”
  • 结果:机器人只需在其小型、高效的内存中查找答案,而不是当场进行复杂的计算。

为什么这很重要

本文声称,通过将机器人大脑的这些特定“重型”部分替换为其“轻量级”的脉冲友好型版本,他们现在可以在节能硬件上运行这些先进的人工智能模型。

  • 无需重新训练:你不必教机器人任何新东西。你只需更换部件,就像给汽车换轮胎,使其在沙地上跑得更快一样。
  • 极小的精度损失:当他们在著名的人工智能模型(如 LLaMA 和 Qwen)上测试时,机器人的性能几乎没有下降——精度差异不到 1%。这就像将高端发动机更换为稍微更高效的发动机,而几乎不损失速度。
  • 通用适配:这套工具包适用于不同类型的人工智能模型,并能融入现有的转换流程中。

核心结论

作者解决了一个主要瓶颈:他们找到了一种方法,使现代人工智能模型的“思考”部分与未来的“基于脉冲”的硬件兼容。他们并没有发明一个新的大脑;他们只是构建了一套适配器,让旧大脑能在新的、节能的引擎上运行。

注意:本文严格专注于数学转换和软件模拟。它并未声称已在物理硬件上部署此技术,也未讨论医疗或临床应用。其目标纯粹是使这些模型能够在未来的神经形态芯片上运行。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →