← 最新论文
🤖 machine learning

Attention Drift: What Autoregressive Speculative Decoding Models Learn

本文将“注意力漂移”识别为自回归推测解码模型的关键局限,即由于未归一化的残差路径导致注意力从提示词转移到生成的令牌,并提出了诸如后置归一化和每隐藏状态 RMSNorm 等架构改进方案,这些方案显著提升了在不同任务和上下文长度下的接受长度。

原作者: Doğaç Eldenk, Payal Mohapatra, Yigitcan Comlek, Kaan Oktay, Hongyang Zhang, Stephen Xia

发布于 2026-05-12
📖 1 分钟阅读☕ 轻松阅读

原作者: Doğaç Eldenk, Payal Mohapatra, Yigitcan Comlek, Kaan Oktay, Hongyang Zhang, Stephen Xia

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图加速一位非常聪明但动作缓慢的图书管理员(即目标模型)撰写故事的过程。为了节省时间,你雇佣了一位速度快但经验不足的助手(即草稿模型),让它先猜测接下来的几个词,再由图书管理员进行核对。如果助手猜对了,图书管理员只需说声“干得好”便继续推进,从而跳过构思这些词的缓慢过程。这被称为推测解码

然而,这篇论文发现这些助手的工作方式中存在一个奇怪的故障,作者将其称为"注意力漂移"。

问题所在:助手变得自我中心

想象图书管理员正在讲述一个关于龙的故事。助手本应紧盯图书管理员的指令(即提示词)来猜测接下来的词。

但实际情况是,当助手尝试猜测一长串词(如“龙”、“飞”、“过”、“了”、“山”)时,会发生以下情况:

  1. 开始:在最初阶段,助手会查看图书管理员的指令。
  2. 漂移:一旦助手开始猜测它自己生成的词,它就会分心。它不再关注图书管理员最初的指令,而是开始死死盯着它刚刚写下的词
  3. 结果:助手变得对自己最近的输出着迷。它忘记了故事的上下文。如果你改变故事的引入方式(即“模板扰动”)或者让故事变得非常长,助手就会完全困惑,停止正确猜测。

论文将这种现象称为注意力漂移。助手的注意力从原始材料上“漂移”开去,并被困在它自己最近的思绪中。

为什么会发生这种情况?“音量旋钮”类比

作者深入数学原理,探究了为什么会发生这种情况。他们发现助手的大脑(即其内部数据状态)中存在一个隐藏的“音量旋钮”问题。

  • 当前设计(Pre-norm):想象助手有一个麦克风,每说一个词,音量就会变大。
    • 第 1 个词:正常音量。
    • 第 2 个词:稍微大一点。
    • 第 10 个词:大喊大叫。
    • 第 20 个词:震耳欲聋。

由于助手每猜测一个词,其内部“音量”(即隐藏状态的幅度)就会不断增大,它开始感觉像是在图书管理员之上叠加了越来越多的复杂层。它不再像一个简单的猜测者,而是表现得像一个全新的、更深层的模型,试图“优化”之前的猜测。这种不断增大的音量使其失去平衡,忘记了最初的指令。

解决方案:“重置按钮”(Post-norm)

作者提出了一个简单的修复方案:Post-norm

这相当于在助手猜测每个词之后,添加一个“音量重置”按钮。

  • 在助手猜测下一个词之前,系统会检查其内部音量,并将其归一化回标准水平。
  • 这防止了“音量”变得震耳欲聋。
  • 它迫使助手保持脚踏实地,将每一次猜测视为全新的、独立的预测,而不是之前猜测的混乱堆积。

他们还在助手开始猜测之前,对来自图书管理员的数据添加了类似的“重置”,确保起始信号不会过大或失衡。

结果:更稳健的助手

通过添加这些“重置按钮”(Post-norm),助手的工作表现有了显著提升:

  • 更少分心:它不再偏离原始指令。
  • 更稳健:即使你改变故事的格式(例如删除特定标签或更改问候语),助手也不会崩溃。它处理这些变化的能力比旧版本提高了 2 倍
  • 更长的故事:它能够处理更长的故事而不会感到困惑。
  • 更快的训练:由于助手更加稳定,他们可以在更短的序列上对其进行训练,而它在稍后处理更长序列时依然表现良好。

核心结论

论文认为,这些助手在现实世界混乱场景中失败的原因,不仅仅是因为它们“笨”。而是因为它们的内部设计导致它们在工作过程中变得“音量过大”且自我中心。通过简单地添加一个归一化步骤来保持其内部音量稳定,它们就能变得可靠、一致,并大大加快协助大模型写作的速度。

简而言之:论文发现,AI 草稿模型之所以会被自己的工作分心,是因为其内部“音量”不断上升。通过一个简单的架构修复来降低这个音量,就能让它们更好地胜任工作。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →