← 最新论文
🤖 machine learning

Massive Spikes in LLMs are Bias Vectors: Mechanistic Uncovering and Spike-Free Quantization

本文揭示了大语言模型中大规模的激活峰值是结构性向量偏差而非简单的标量异常,并利用这一机制性的见解提出了 INSERTQUANT,这是一个通过使用模板向量来消除这些峰值的后训练量化框架,从而在文本和视觉模态中实现鲁棒、高保真低比特量化。

原作者: Yung-Chin Chen, Chung Peng Lee, Ze-Wei Liou, Naveen Verma

发布于 2026-06-02
📖 1 分钟阅读☕ 轻松阅读

原作者: Yung-Chin Chen, Chung Peng Lee, Ze-Wei Liou, Naveen Verma

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

大问题:图书馆里的“大嗓门邻居”

想象一下,大型语言模型(LLM)就像一座巨大的、高速运转的图书馆,书本(Token/词元)在其中不断地被阅读和处理。为了让这座图书馆运行得更快、更省电,工程师们想要把书本缩小成极小的、高效的尺寸(这个过程被称为量化/Quantization)。

然而,问题出现了。在每一座图书馆里,都有几个特定的“大嗓门邻居”(比如换行符或特殊的起始符号),它们叫得声嘶力竭,甚至盖过了其他所有人的声音。在 AI 的数学运算中,这些尖叫就是大规模尖峰(Massive Spikes)——它们的数值比正常值大出几千倍。

因为这些尖峰实在太巨大了,图书馆不得不建造一个极其庞大且昂贵的存储系统来容纳它们。这破坏了效率。如果你试图在不解决噪音的情况下缩小书本(进行量化),整个图书馆就会崩溃成一堆乱码。

旧理论 vs. 新发现

旧理论: 科学家们此前认为,这些“大嗓门邻居”只是随机的故障,或者是 AI 不小心调高了音量的简单“音量旋钮”(标量偏差/Scalar Biases)。

新发现(偏差向量假设): 本文的作者认为,这些尖峰并非意外。它们实际上是构建在 AI 设计中的刚性结构支柱

  • 类比: 想象一场舞台剧。大多数演员(语义 Token)都在台上移动、更换服装、说着不同的台词来讲述故事。但有一个特定的演员(“汇聚 Token/Sink Token”)站在舞台中央纹丝不动,戴着完全相同的面具,说着完全相同的台词,无论剧情如何演变,他都绝不动弹。
  • 论文证明了,这个“静止的演员”并非随机产生的。它是一个固定向量(数学空间中的一个特定方向),它是 AI 正常运行所必需的。它充当了一个“不做任何事”的按钮,帮助 AI 忽略干扰并保持专注。

AI 如何使用这个“静止的演员”

论文深入研究了这一机制是如何运作的,揭示了一个三步走的舞蹈过程:

  1. 吸引子(磁铁): AI 的“键(Key)”和“查询(Query)”机制就像磁铁一样。它们将所有其他演员向这个“静止的演员”拉拢。这创造了一个注意力汇聚点(Attention Sink),使 AI 的注意力集中在这个点上,以保持数学计算的稳定性。
  2. 寂静的虚空(排水口): 尽管所有人都在注视着这个“静止的演员”,但 AI 的“值(Value)”机制却像一个黑洞。它接收了“静止的演员”的信息,并将其转化为零。这确保了虽然 AI 看向这个位置以获取稳定性,但并不会改变故事的内容。这是一个“无操作(No-Op)”。
  3. 护盾(安全区): AI 知道“舞台”(输入序列)会不断旋转和变化。为了防止这个“静止的演员”发生晃动,AI 将其隐藏在一个安全区(低频通道)内,在那里旋转不会对其产生影响。这就像是在支柱周围建造了一座堡垒,以免风力将其吹倒。

解决方案:INSERTQUANT

既然作者现在知道这些“大嗓门邻居”实际上是静态的、预设的支柱而非随机噪声,他们开发了一种名为 INSERTQUANT 的新工具。

以下是它的工作原理,使用“替换”作为类比:

  1. 识别支柱: 系统扫描图书馆并找到那些“大嗓门邻居”Token。
  2. 消除噪音(钳制/Clamp): 系统不再让这些 Token 歇斯底里地尖叫并占用所有存储空间,而是直接将它们静音(将其钳制为零)后再进入主处理室。这能瞬间移除“尖峰”,使数据变得易于缩小(量化)。
  3. 植入蓝图(插入/Insert): 由于 AI 需要 这个“静止的演员”来维持功能,系统并不会直接删除它。相反,系统会在该演员本该出现的位置插入一份预制的蓝图(模板向量)。
    • 类比: 想象你在拍电影。与其雇佣一个真实的演员在那里站立 10 个小时(既昂贵又难以管理),你只需在布景上贴一个该演员的纸板人。摄像机看到了演员,灯光效果也达标了,但你节省了大量的成本和精力。

结果

通过使用这种“纸板人”方法(INSERTQUANT):

  • 不再有尖峰: 数据变得非常平滑,使得 AI 可以被缩小到极小的尺寸(4-bit 量化)而不会丧失智能。
  • 适用范围广: 之前的方法仅适用于文本(因为它们依赖于识别特定的词汇,如“换行符”)。而这种新方法作用于数据的结构,因此它不仅适用于文本,也适用于视觉 Transformer (ViT)(即观察图像的 AI)。
  • 高保真度: 即使使用了这些“纸板人”,AI 的表现也与原始未缩小的版本一样出色。

总结

论文指出:“不要把这些巨大的尖峰视为错误。它们实际上是 AI 用来保持稳定的刚性结构工具。如果我们认识到它们是固定的工具,我们就可以移除计算中的嘈杂部分,并用预制的模板来替换它们。这让我们能够在不破坏 AI 的情况下,将其缩小到极小的尺寸。”

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →