← 最新论文
💬 NLP

A Single Layer to Explain Them All:Understanding Massive Activations in Large Language Models

本文在大语言模型中识别出一个特定的“大规模涌现层”,大规模激活由此产生并传播,导致表示多样性降低,并提出了一种方法来缓解这种僵化性和注意力汇聚现象,以提升各种任务的性能。

原作者: Zeru Shi, Zhenting Wang, Fan Yang, Qifan Wang, Ruixiang Tang

发布于 2026-05-14
📖 1 分钟阅读☕ 轻松阅读

原作者: Zeru Shi, Zhenting Wang, Fan Yang, Qifan Wang, Ruixiang Tang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是论文《A Single Layer to Explain Them All》的通俗解释,辅以生动的类比。

核心思想:单层引发“音量激增”

想象大型语言模型(LLM)是一座巨大的多层工厂。原材料(单词)从底层进入,在每一层经过处理,最终在顶层作为成品(答案)输出。

研究人员发现,在这座工厂中发生了一件奇怪的事。在他们测试的几乎所有模型中,都存在一个特定的楼层(他们称之为ME 层,即“大规模涌现层”),在此处会发生突然且巨大的激增。

在这一特定楼层,句子第一个词的“信号”突然被放大到比其他所有词响亮 100 倍甚至 1,000 倍。这就像在一个合唱团中,唱第一个音符的人突然开始尖叫,音量大到淹没了其他人,而且这种尖叫的音量一直持续到整栋建筑的顶层。

发生机制:“扩音器”与“放大器”

论文深入探究了为何会在这一特定楼层发生这种情况。他们发现,这是机器两个部分协同作用的结果:

  1. 扩音器(RMSNorm): 在信号进入主处理器之前,会经过一个归一化步骤。在这一特定楼层,第一个词的参数被意外调校成了一个巨大的扩音器,使其音量增幅远超其他词。
  2. 放大器(FFN): 随后信号进入“前馈网络”(即主要的思考部分)。在这里,机器内部的权重就像一个超级放大器,专门针对那个已经很大的第一个词,使其更加响亮。

一旦这种“大规模激活”产生,它就不会消退。因为工厂使用“残差连接”(可以想象为跳过处理步骤的直达电梯),这个超响亮的信号便乘坐电梯直达顶层,全程保持响亮且不变。

问题所在:僵化且不变的嗓音

这就带来了麻烦:由于第一个词如此响亮且方向固定,它开始主导工厂的决策。

想象一群人正在计划一次旅行。如果一个人喊得太大声,以至于其他人无法被听见,群体就会停止倾听新想法,只是盲目跟随那个喊叫者。

在人工智能中,这种“喊叫”的第一个词创造了一个僵化的方向。它使人工智能变得不够灵活。当人工智能试图关注句子的不同部分(就像人类观察不同的线索)时,这个响亮且不变的信号迫使人工智能每次都以前同样的方式看待事物,而不管实际语境如何。这降低了人工智能理解细微差别和适应新问题的能力。

解决方案:“静音按钮”(WeMask)

研究人员提出了一种简单的修复方法,称为WeMask

他们并没有试图重建整个工厂,而是找到了一种方法,可以温和地静音那些导致第一个词尖叫的特定“通道”(维度)。

  • 工作原理: 他们查看使第一个词变响的设置(即“权重”),并在人工智能尝试关注其他单词之前,选择性地降低这些特定通道的音量。
  • 类比: 这就像在房间里最响亮的扬声器上贴上一小块策略性的胶带。扬声器依然存在,房间依然运作,但现在其他声音可以清晰可闻。人工智能终于能够倾听整个对话,而不仅仅是第一个词。

结果:更优的思考与更少的“注意力陷阱”

当他们应用这个“静音按钮”后,人工智能在所有测试中的表现都提升了:

  • 遵循指令: 它能更准确地遵循复杂的提示。
  • 数学推理: 它解决数学问题的能力更强。
  • 安全性: 它拒绝无害问题的可能性降低了(这种现象被称为“过度拒绝”)。

该论文还将此现象与一种称为**“注意力陷阱”的现象联系起来。此前,科学家注意到人工智能模型往往过度关注第一个标记(句子的开头)而忽略其余部分。这篇论文解释了原因**:第一个标记变成了一个“大规模激活”,在物理层面上淹没了其他标记。

通过使用他们的方法,他们并没有完全消除对第一个词的关注(事实证明完全消除是不好的,因为第一个词仍然需要被听见),而是削弱了其主导地位。这使得人工智能能够在倾听句子开头与倾听故事其余部分之间取得平衡,从而表现出更聪明、更灵活的行为。

总结

  • 发现: 人工智能模型中的特定层级为第一个词创造了一个“超响亮”的信号,并持续到结尾。
  • 原因: 该特定层级上的归一化与处理权重的组合。
  • 问题: 这个响亮的信号使人工智能变得僵化,难以适应新的语境。
  • 修复: 一种简单的方法,选择性地静音该信号中最响亮的部分,从而恢复平衡并全面提升性能。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →