← 最新论文
🤖 machine learning

Attention Sinks and Outliers in Attention Residuals

本文介绍了 OASIS,一种利用层间零信号来缓解 AttnResidual 架构中注意力汇聚和激活异常值的新颖技术,从而显著提升推理稳定性、量化鲁棒性以及下游任务性能。

原作者: Haozheng Luo, Haoran Dai, Shaoyang Zhang, Xi Chen, Eric Hanchen Jiang, Yijiang Li, Jingyuan Huang, Chenghao Qiu, Chenwei Xu, Zhenyu Pan, Haotian Zhang, Binghui Wang, Yan Chen

发布于 2026-05-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Haozheng Luo, Haoran Dai, Shaoyang Zhang, Xi Chen, Eric Hanchen Jiang, Yijiang Li, Jingyuan Huang, Chenghao Qiu, Chenwei Xu, Zhenyu Pan, Haotian Zhang, Binghui Wang, Yan Chen

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一座巨大且超级聪明的图书馆(即 AI 模型),其中成千上万名图书管理员(即层)协同工作以回答你的问题。为了变得更好,这些图书馆开始采用一种名为AttnResidual的新系统。该系统允许图书管理员不仅阅读书籍,还能在图书馆的不同楼层之间传递便条,以完善他们的答案。

然而,本文作者发现这个新系统存在一个故障。它导致了两个主要问题:

  1. “海妖”效应(注意力汇聚): 在旧系统中,书架上的第一本书(即第一个 token)会获得所有关注,从而淹没其他所有内容。在新系统中,这个问题变得更加严重。图书管理员们过于专注于那第一本书,以至于不再倾听故事的其他部分。
  2. “大声喊叫”问题(异常值): 有时,一名图书管理员会因过于兴奋或困惑而尖叫(即产生一个“异常值”),其声音之大足以破坏用于存储便条的精密设备(即量化)。这使得图书馆变得脆弱,在尝试压缩其内存时容易崩溃。

论文声称,新系统加剧了这些问题,因为它迫使图书管理员将注意力分配给真实的书籍和真实的楼层。如果他们想说“这里没有什么新内容要补充”,就不得不将这种“无”强行塞入一本真实的书中,这导致数值变得异常巨大且不稳定。

解决方案:OASIS(“静默休息”按钮)

作者提出了一种名为OASIS的修复方案。可以将 OASIS 想象为在图书馆系统中添加了一个特殊的**“静默休息”按钮**。

以下是使用简单类比的工作方式:

  • “空”通道(休息室): 与其强迫图书管理员对着真实的书籍大喊“没有!”(从而引发“大声喊叫”问题),OASIS 为他们提供了一个专用的休息室。如果图书管理员没有什么有用的内容要添加,他们只需走进休息室。这保持了真实书籍的安静,并使数值保持稳定。
  • “团队领导”信号(Token 到深度的耦合): 在旧系统中,楼层经理(深度路由)并不知道某位图书管理员是否只是在休息。OASIS 增加了一个信号:“嘿,整个团队目前都在休息室里。”楼层经理随后就会知道停止向该团队分配工作,转而专注于那些真正在工作中的团队。

论文发现

研究人员在两个流行的图书馆模型(Llama 和 Qwen)上测试了这种新的“休息室”系统,发现:

  • 更安静的图书管理员: “尖叫”的数值(异常值)下降了约84%。图书馆变得更加平静。
  • 减少执念: 图书管理员不再执着于第一本书。“海妖”效应显著减弱。
  • 更坚固的设备: 由于数值更加平稳,他们可以更紧密地压缩图书馆的内存(就像压缩文件一样)而不会将其破坏。
    • 当他们重度压缩内存(降至 4 位)时,图书馆解决数学问题(GSM8K)的能力实际上比旧系统提高了 23%
    • 当他们使用中等压缩(8 位)时,图书馆犯错的次数(困惑度)降低了约73%

结论

论文认为,通过为 AI 提供一个放置“无”的特定位置(即空通道),并让系统知晓其某一部分正在“无所事事”,我们可以防止 AI 陷入困惑、尖叫或执着于第一个词。这使得 AI 更加稳定,更易于缩小以适应手机或小型计算机,并且在解决难题方面表现更佳,而无需从头重新训练整个图书馆。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →