← 最新论文
🤖 machine learning

RDQ: Residual Distribution Quantization for Large Language Models

本文介绍了 RDQ,这是一个通过采用级联误差补偿来使逐通道缩放因子拟合漂移的残差分布,从而减轻大型语言模型中量化噪声超线性累积的训练后量化框架,在 3 位和 4 位精度下实现了最先进的困惑度,且零推理开销。

原作者: Prateek Singh

发布于 2026-07-14
📖 1 分钟阅读☕ 轻松阅读

原作者: Prateek Singh

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图在一个由 32 个相连房间组成的漫长且蜿蜒的隧道中发送一条秘密信息。在原始的高质量版本(称为 FP16)中,这条信息可以完美无瑕地从起点传到终点。但当我们试图将信息压缩成极小的格式(量化)以节省手机或边缘设备的存储空间时,事情开始出问题了。

长期以来,科学家们认为问题仅仅在于每个房间本身变得有点脏。他们认为:“如果我们只要把房间 1 清理干净,再清理房间 2,接着清理房间 3,一切就会好起来。”但这项名为 RDQ(残差分布量化) 的新论文发现,这种“分别清理每个房间”的方法实际上是错误的思考方式。

真正的元凶:“雪球”效应

作者发现,真正的问题在于一个雪球效应。每当信息经过一个房间时,都会增加一点点“噪声”或静电。在正常的隧道中,这并不重要。但在压缩后的隧道中,这点微小的噪声并不会消失;它会被带到下一个房间,并与该房间产生的新噪声混合在一起。

当信息到达第 32 个房间时,那点微小的静电已经变成了一阵巨大的轰鸣声。作者测量了这种“噪声累积”(他们称之为残差流漂移),并发现这种噪声量能完美地预测消息质量的恶化程度。事实上,他们发现了一种极其强大的相关性(皮尔逊相关系数 r=0.999):如果你知道信号漂移了多少,你就能准确预测计算机会变得多么困惑。

重大发现:隧道并不平滑

在此论文发表之前,大多数专家假设这些隧道中的噪声看起来像是一个平滑、可预测的小山丘(“高斯”分布)。他们基于这种平滑的小山丘构建了他们的清理工具。

但作者进入隧道内部观察了一下。他们发现,在 LLaMA-3-8B 模型中,84% 的房间根本没有平滑的小山丘!相反,噪声是锯齿状的、怪异的,有时甚至有两个峰值(双峰分布)。这就像是预期看到一个平静的湖泊,结果却发现了一个波浪汹涌、突发巨浪的海洋。由于噪声如此怪异,旧有的“平滑小山丘”清理工具表现得非常糟糕,尤其是在尝试将消息缩小到仅 3 比特(一个非常小的尺寸)时。

解决方案:“级联误差补偿”(CEC)

那么,如何修复一个噪声随深度变化的隧道呢?作者提出了一种名为**级联误差补偿(CEC)**的新方法。

与其在清理每个房间时假装信息仍然新鲜且干净(这是旧方法所做的),CEC 提议说:“让我们先走一遍整个隧道,看看信息到达每个房间时究竟是什么样子的,然后再进行清理。”

以下是其工作原理:

  1. 实地走访: 计算机在隧道中运行一个测试消息。它让前几个房间像在现实生活中那样变得“脏”(量化)。
  2. 真实面貌: 当信息到达第 10 个房间时,它已经因为经历了前 9 个房间而变得有些嘈杂。系统捕捉到这个实际的、混乱的信号。
  3. 定制修复: 系统不再使用通用的清理工具,而是专门为这个混乱的信号构建一个定制的清理工具。它就在那个房间里调整消息的“音量”(缩放比例/scales)。
  4. 神奇折叠: 一旦构建好清理工具,它就会被“折叠”进房间的门框中(RMSNorm 权重)。这意味着当真实的信号稍后经过时,清理过程会自动完成,没有任何额外的耗时或速度损失

结果:巨大的提升

团队在三个著名的 AI 模型上进行了测试:LLaMA-3-8BQwen-2.5-7BMistral-7B

  • 旧方法: 当他们尝试使用标准方法(RTN)将 LLaMA-3-8B 压缩到 3 比特时,消息几乎变得无法理解,得分(困惑度/Perplexity)从 5.83 飙升到了 14.09。这是一个巨大的质量下降。
  • RDQ 方法: 使用这种新的“走访”方法,他们将得分降到了 7.55。这比旧方法提升了 46.4%
  • 在 4 比特下: 他们也取得了有史以来最好的结果,大幅超越了之前的冠军(例如,对于 LLaMA,得分是 5.62 对比 6.92)。

这意味着什么

作者明确表示:这不仅仅是一个更好的工具,更是一种看待问题的新方式。他们证明了“漂移”是这些模型在低比特宽度下崩溃的主要原因。他们还表明,旧的“独立清理每个房间”的想法是一个死胡同,因为它忽略了来自前序房间的噪声雪球。

虽然他们目前还无法解决 2 比特 压缩的问题(那里的噪声实在太强了),但他们已经证明,对于 3 比特和 4 比特 压缩,我们可以保持模型的智能与快速。最棒的是,这种新方法可以与工程师现有的标准工具配合使用,因此无需任何特殊的、缓慢的硬件,即可部署在手机和电脑上。

简而言之:隧道变得混乱是因为我们清理房间的顺序错了。通过按照信息实际经过的顺序进行清理,我们可以让信号始终清晰地传达到终点。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →