← 最新论文
🤖 machine learning

OffQ: Taming Structured Outliers in LLM Quantization by Offsetting

OffQ 是一种新颖的低比特量化方法,它通过利用 top-1 PCA 识别出一个低维离群子空间,将高幅值激活值旋转至单个通道,并将它们的幅值转换为一个共享偏移量,从而通过实现高效且准确的 W4A4KV4 量化来缓解大型语言模型中的激活值离群问题。

原作者: Haoqi Wang, Lorenz K. Mueller, Jiawei Zhuang, Mathieu Salzmann, Lukas Cavigelli

发布于 2026-06-08
📖 1 分钟阅读☕ 轻松阅读

原作者: Haoqi Wang, Lorenz K. Mueller, Jiawei Zhuang, Mathieu Salzmann, Lukas Cavigelli

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你拥有一个规模巨大、细节极其丰富的知识库(即大语言模型,LLM)。为了让这个知识库能装进一个可以随身携带在手机或笔记本电脑上的小背包里,你需要缩小这些书籍的体积。这个过程被称为量化(Quantization)

通常情况下,我们通过舍弃微小的细节来缩小书籍,将复杂的数字变成简单的整数(比如把 4.99 变成 5)。这能节省大量的空间。

问题所在:“尖叫者”(The "Screamers")
然而,这里有一个陷阱:在这些知识库中,大部分页面都是安静且平缓的,但有少数页面却包含了“尖叫者”——即那些比其他数字大得多的、极度响亮且混乱的数字。

  • 如果你试图将整个知识库压缩到一个小盒子里,这些“尖叫者”会迫使你使用一个非常粗糙的网格。
  • 这就像是试图把一头大象和一只小老鼠同时塞进同一个小板条箱里。为了容纳大象,你不得不把小老鼠压成一个无法辨认的小肉团。
  • 用技术术语来说,这些“尖叫者”(激活值离群点/activation outliers)会破坏模型的准确性,因为对于那些安静的数据部分来说,舍入误差变得太大了。

旧有的解决方案
以往解决“大象与老鼠”问题的尝试,类似于以下几种做法:

  1. 学习一种新的缩减方式: 重新训练模型,使其更擅长缩减(这既昂贵又缓慢)。
  2. 使用不同尺寸的盒子: 把大象放在大盒子里,把老鼠放在小盒子里(混合精度)。这种方法有效,但会让打包过程变得复杂且缓慢。
  3. 使用奇特的定制盒子: 使用不符合标准货架的特殊盒子(非均匀量化),但大多数计算机都无法轻松处理这些盒子。

新的解决方案:OffQ
论文介绍了一种名为 OffQ 的新方法。OffQ 并不试图与“尖叫者”对抗,也不使用不同的盒子,而是使用了一个聪明的技巧来“抵消”这些尖叫者。

以下是 OffQ 的工作原理,通过一个简单的类比分步展示:

1. 寻找“尖叫者”(Top-1 PCA)

首先,OffQ 会观察数据,找出“尖叫者”究竟躲在哪里。

  • 类比: 想象一个拥挤的房间,除了角落里的一个人在尖叫外,其他人都在低声细语。标准方法可能会被这些细语声搞糊涂。OffQ 使用一种特殊的“Top-1”雷达,它会忽略细语,只锁定并放大那个最响亮的尖叫声。
  • 结果: 它识别出这些“尖叫者”都遵循特定的模式,并且可以被归类为一个单一的“响亮通道”。

2. 将“尖叫者”移至一处(旋转/Rotation)

一旦找到,OffQ 会旋转数据,使得所有的尖叫能量都集中在仅仅一个通道中(就像把所有尖叫的人都移到剧院里的某一个特定座位上)。

  • 类比: 与其让一些人在不同的排坐着尖叫,不如把他们全部移到前排的 1 号座位。现在,剧院的其他部分就变得非常安静了。

3. 神奇的“偏移”技巧(Hadamard 旋转)

这是核心创新点。OffQ 拿到那个“响亮的座位”后,使用一种数学旋转(称为 Hadamard 旋转),将那股响亮的噪声均匀地扩散到剧院里的每一个座位上。

  • 类比: 想象 1 号座位的巨大噪音实际上是一条厚重的大毯子。与其让它留在 1 号座位上(从而挡住视线),OffQ 将这张毯子剪成无数个微小的、等大的碎片,然后把每一片微小的碎片都披在剧院里的每一个座位上。
  • 结果: 再也没有哪个座位会被噪音淹没。现在的“噪声”变成了一个在所有人耳边都一样的、微弱且恒定的背景嗡鸣声。

4. 吸收噪声(量化/Quantization)

由于噪声现在是全场均匀的背景嗡鸣,量化过程(即缩减过程)可以简单地通过说:“好吧,我们知道到处都有微弱的嗡鸣声。让我们通过调整零点(zero-point)来忽略它。”

  • 类比: 这就像是告诉图书管理员:“我们知道房间里有点灰尘。只要从每本书的重量中减去一点点灰尘的重量,它们就能完美地装进小背包里。”
  • 结果: “尖叫者”被有效地中和了。模型现在可以被压缩到 4-bit(非常小)的规模,而不会丧失理解语言的能力。

为什么这很重要

  • 无需特殊硬件: 与其他需要定制、复杂芯片的方法不同,OffQ 使用标准的、均匀的盒子。这就像使用标准的集装箱而不是定制的木箱。
  • 更高的准确性: 论文表明,即使在进行极小规模的压缩(权重、激活值和内存均为 4-bit)时,OffQ 也能比以往的方法更好地保持知识库的准确性。
  • 高效性: 它不需要重新训练模型,也不需要额外的内存来存放不同的盒子。它只是重新排列了数据并调整了“零点”。

总结
OffQ 是一种聪明的打包技巧。它不再让少数几个“响亮”的数字毁掉整批货物,而是隔离它们,将它们的影响均匀地分布到整个包裹中,然后调整比例,使包裹能够完美地装进一个微小且高效的盒子里,而不会损坏其中的内容。这使得在日常设备上运行强大的 AI 模型变得更加可行。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →