← 最新论文
🤖 machine learning

QAM-W: Joint 2D Codebook Quantization for LLM Weights via Hadamard Rotation and Activation-Aware Scaling

QAM-W 提出了一种针对大语言模型权重的联合二维码本量化方法,该方法利用哈达玛旋转和激活感知缩放以保持成对坐标结构,在每权重约 5.5 比特的情况下实现了接近 BF16 的困惑度,同时优于极坐标编码,并以显著更少的权重比特数达到了与 SmoothQuant 相当的质量。

原作者: Preetam Sharma, Kacper Dobek

发布于 2026-05-27
📖 1 分钟阅读☕ 轻松阅读

原作者: Preetam Sharma, Kacper Dobek

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你拥有一个庞大的图书馆,里面藏书无数(即大型语言模型,或 LLM),它极其聪明,但占用空间巨大。为了便于携带,你希望将这些书籍缩小。这个过程被称为量化

目前大多数缩小这些书籍的方法,就像拿着一本字典,逐个将每个单词替换为简短的数字代码。这种方法简单,却忽略了单词往往成对或成组出现、彼此之间存在特定关系的事实。如果你将它们视为孤立的个体,就会失去故事的一些细微之处。

本文介绍了一种名为QAM-W(用于权重的正交幅度调制)的新方法。可以将其理解为一种更智能、更高效的方式来打包这些书籍。

以下是其工作原理,使用简单的类比说明:

1. 问题:“独舞者”与“双人舞”

想象 AI 模型中的权重就是舞者。

  • 旧方法(标量量化): 旧方法将每个舞者视为正在表演独舞。它逐个审视每个舞者,并说:“你是一个'3',你是一个'7'。”它忽略了两个舞者可能手牵手或同步移动的事实。
  • QAM-W 的洞察: 作者们意识到,在一行数据中,这些“舞者”实际上是以成对的方式跳舞的。它们是相互关联的。QAM-W 不再将它们编码为两个独立的独舞者,而是将它们视为一个双人舞组合

2. 解决方案:“魔法旋转”与“配对”

QAM-W 采用三步流程来缩小模型,同时不丢失故事内容:

  • 步骤 A:“魔法旋转”(哈达玛旋转):
    想象舞者站在一个混乱拥挤的房间里。QAM-W 施加一种“魔法旋转”(一种数学旋转),重新排列他们。突然间,那些原本随机移动的舞者现在完美地配对,以平滑的圆形模式移动。这使得用数学描述他们变得容易得多。

  • 步骤 B:“双人舞”码本:
    QAM-W 不再给每个舞者分配单独的数字,而是将配对视为地图上的一个单一点。它使用一个预先制作好的“地图”(即码本),该码本是针对这些配对通常的行为模式训练而成的。这就像拥有一个标准双人舞动作的图书馆。你不再需要描述两个独立的步骤,只需说:“他们做了‘华尔兹第 42 号’动作。”这捕捉了两个数字之间的关系,从而节省了空间。

  • 步骤 C:“音量旋钮”(激活感知缩放):
    有时,模型的某些部分非常“响亮”(高度活跃),而其他部分则很“安静”。如果你过度缩小那些响亮的部分,音乐就会失真。QAM-W 在缩小之前会监听每个通道的“音量”。它略微调低响亮通道的音量,使它们更好地适应狭小的空间,确保最重要的信息不会被压碎。

3. 结果:体积更小,质量不变

该论文在五个不同的 AI 模型(从小型到中型大型)上测试了这种新方法。

  • “甜蜜点”: 在特定的压缩水平下(约每个权重 5.5 位),QAM-W 取得了与原始未压缩模型几乎相同的结果。
  • 对比: 一种流行的竞争方法称为SmoothQuant,需要约8.1 位才能达到相同的质量。而 QAM-W 仅使用32% 更少的位数就达到了相同的结果。
    • 类比: 这就像打包行李箱。SmoothQuant 需要一个大行李箱才能整齐地装下你所有的衣服。而 QAM-W 将衣服折叠得如此高效,以至于你可以将完全相同数量的衣物装进一个更小的包中。

4. 它做不到什么(局限性)

该论文非常明确地说明了它声称的内容:

  • 并非最小: 如果你尝试将模型进一步缩小(降至 4 位),另一种称为QTIP的方法实际上表现更好。QAM-W 是“中小型”范围(5–6 位)的冠军,而非“微型”范围。
  • 存储与速度: 该论文衡量的是模型在硬盘或内存中占用多少空间。它尚未声称能让模型在计算机芯片上运行得更快,因为用于在实时中实际使用这些压缩数字的软件仍在构建中。

总结

QAM-W 是一种用于 AI 模型的新型“打包技术”。通过识别数据成对出现、将它们旋转到更好的形状,并根据音量进行调整,它可以将 AI 模型缩小约三分之一,而不会降低其智能程度。这是一种专用工具,在特定尺寸范围内效果最佳,与现有方法相比,可显著节省存储空间。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →