← 最新论文
🤖 machine learning

AAAC: Activation-Aware Adaptive Codebooks for 4-bit LLM Weight Quantization

本文介绍了 AAAC,一种轻量级后训练量化方法,它利用激活感知的自适应码本将重建误差降至最低,在存储开销可忽略不计且量化速度显著快于现有基于梯度的方法的同时,实现了最先进的 4 位大语言模型权重压缩。

原作者: Beshr IslamBouli, David Jin

发布于 2026-05-12
📖 1 分钟阅读☕ 轻松阅读

原作者: Beshr IslamBouli, David Jin

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你有一本巨大的图书馆藏书(一个大语言模型),你想把它装进口袋里。这些书体积庞大,所以你决定把它们缩小以便携带。这个过程被称为量化

目前,大多数人通过强制将每个词放入一个预先制作好的、僵化的 4 位“槽位”网格中来缩小这些书。这就像试图将形状不规则的岩石塞进一个由完美正方形的乐高积木组成的盒子里。你必须把岩石切碎或挤压才能塞进去,这会丢失一些细节,使故事变得有点模糊。

现有的方法试图通过旋转岩石或给盒子填充空隙来解决这个问题,但它们仍然必须使用相同的僵化乐高网格。

AAAC(激活感知的自适应码本) 提出了一种更聪明的缩小书籍的方法。以下是其工作原理,使用简单的类比:

1. 问题:“一刀切”的网格

在标准的 4 位量化中,模型中的每一组数字(权重)都被迫固定到同一组固定的值上(就像一份固定的 16 项菜单)。如果一个数字无法完美契合,它就会被四舍五入到最近的选项,从而丢失精度。

2. AAAC 解决方案:两个定制工具包

AAAC 不是为整个层使用一个固定菜单,而是为模型的每一层创建两个微小的定制工具包(称为码本)。

  • 微小尺寸:这些工具包非常小——每层仅约64 字节。这大约相当于一条文本消息中单个表情符号的大小。
  • 量身定制:这些工具包不是固定的,而是从模型活动的一小部分样本中“学习”而来的。它们是专门针对该特定层中岩石(权重)的形状量身定制的。

3. 如何选择:“符号位”技巧

对于每一组数字,AAAC 决定哪一个定制工具包最合适。

  • 决策:它选择能最小化误差的工具包,特别关注哪些数字是“重要”的,这取决于模型当前是如何“思考”的(激活值)。
  • 神奇存储:这里是巧妙之处。模型已经为其尺度数字存储了一个“符号位”(一个正负指示符)。然而,因为这些尺度数字总是正数,所以该符号位通常是空的(浪费的空间)。AAAC 将工具包的选择(0 或 1)隐藏在这个未使用的符号位中。
  • 结果:你免费获得了一个更智能、更定制的契合度。它没有为模型增加任何额外的存储空间

4. 速度与效率:“轻量级”方法

许多其他试图提高准确性的方法需要繁重的劳动:

  • 基于梯度的方法就像试图在跑马拉松的同时解谜;它们需要数小时的时间和大量的计算机内存(RAM)来反向计算复杂的数学运算。
  • AAAC 就像用简单、快速的启发式方法解谜。它不需要反向运行或使用大量内存。它只需查看一次数据,进行快速的“聚类”(将相似项分组),然后选择最佳工具包。
  • 时间:它在单个显卡上仅需3 到 30 分钟即可完成,而其他高质量方法可能需要数小时。

5. 结果

该论文在 various 模型规模(从 1B 的小模型到 27B 的大模型)上,将 AAAC 与许多其他流行方法(如 AWQ、GPTQ 和 OmniQuant)进行了测试。

  • 准确性:AAAC 始终比其他“轻量级”方法产生更清晰、更准确的结果。
  • 竞争:它甚至匹敌或超越了那些需要数小时运行的“重型”方法,但只需几分钟即可完成。
  • 组合:当与另一种称为 AWQ 的方法结合使用时,它恢复了压缩过程中损失的**70%**以上的质量,非常接近原始全尺寸模型。

总结

AAAC 是一种快速、无需内存的方式来缩小 AI 模型。它不是将数据强行塞入僵化的预制网格,而是为每一层构建两个微小的定制网格,并将网格的选择隐藏在浪费的比特空间中。它能在几分钟内实现高精度,而无需旧式更复杂方法所需的繁重计算能力。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →