← 最新论文
🤖 machine learning

SAGE: Surrogate-gradient Adaptation via Attention-Guided Entropy for Spiking Transformers

本文介绍了 SAGE,一种用于脉冲神经网络 Transformer 的不确定性调制代理梯度机制,该机制通过利用自注意力熵在训练期间动态调整梯度斜率,从而在不改变推理模型的情况下,实现相对于固定代理基准的一致性准确率提升。

原作者: Kiran Nair, Rodrigue Rizk, KC Santosh

发布于 2026-08-17
📖 1 分钟阅读☕ 轻松阅读

原作者: Kiran Nair, Rodrigue Rizk, KC Santosh

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一个这样的世界:计算机不再是以一种稳定、低鸣的节奏进行数字运算,而是像一座繁忙的萤火虫之城那样进行交流。在这个世界里,信息不再是持续的数据流,而是一系列快速、尖锐的闪烁——要么发生,要么不发生的火花。这就是脉冲神经网络(Spiking Neural Networks, SNNs)的领域,一种受我们自身大脑工作方式启发的类人工智能。这些网络并不使用沉重且耗能的计算,而是仅在必要时发送微小的、二进制的“脉冲”(就像 1 或 0)。这有点像一个社区,你只有在有急事要说时才会去敲门,而不是每隔五分钟就按一次门铃。这使得它们极其高效,非常适合那些需要快速思考却又不想耗尽电池的电池驱动设备或机器人。

然而,教导这些“萤火虫大脑”学习是一件棘手的事情。在传统的 AI 中,我们可以使用平滑的数学方法来确定如何改进网络的预测。但在脉冲网络中,“敲门”是一个全或无(all-or-nothing)的事件;你无法朝着“敲门”迈出一小步,你要么做了,要么没做。这导致学习的数学逻辑失效了。为了解决这个问题,科学家们使用了一个被称为“代理梯度”(surrogate gradient)的巧妙技巧。把它想象成一个训练假人或一个影子,它模仿那次“敲门”,以便老师能够弄清楚如何调整网络。多年来,无论大脑实际在看什么,大家都在为每一个部分使用相同的“影子”。但如果大脑的某些部分感到困惑,需要与那些已经确信的部分不同种类的帮助,该怎么办呢?这就是这篇论文试图解决的谜题。

于是,SAGE(基于注意力引导熵的代理梯度自适应,Surrogate-gradient Adaptation via Attention-Guided Entropy)登场了,这是一种旨在让这些脉冲网络学得更聪明、而非更辛苦的新方法。SAGE 背后的研究人员注意到,在被称为“Transformer”的现代 AI 模型中,网络会以不同的方式关注图像的不同部分。有时,网络对它所看到的东西非常自信(比如一张清晰的猫脸),有时则完全迷失了方向(比如模糊的背景)。旧训练方法的问题在于,它将自信的部分和困惑的部分视为完全相同,使用一个僵化、不变的“影子”来引导学习。

SAGE 改变了游戏规则,它扮演着一位观察团队专注力的睿智教练。它观察网络的注意力是如何分布在不同的“头”(head,可以理解为观察同一场景的不同侦察兵)之中的。如果侦察兵们都看向同一个方向,网络就是自信的;如果他们看向四面八方,网络就是不确定的。SAGE 利用这种“不确定性信号”来实时调整训练中的“影子”。当网络感到困惑时,SAGE 会让训练信号变得更宽泛、更具探索性,允许网络尝试新的事物。当网络感到自信时,SAGE 则会收紧信号,进行精确且细致的调整。

最棒的部分是什么?这种魔法只发生在网络在“教室”里的时候(即训练期间)。一旦网络完成学习并准备好走向现实世界(即推理期间),SAGE 就会消失。网络的运行方式与之前完全一样,没有任何额外的能量消耗,也不会降低速度。在 CIFAR-10 和 CIFAR-100 等图像数据集的测试中,这种方法帮助网络提升了识别图片的能力,与旧有的僵化方法相比,准确率提高了约 1% 到 2%。这是一个微小但意义深远的胜利,表明通过倾听网络自身的困惑,我们可以教导这些高效节能的“萤火虫大脑”更清晰地观察世界。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →