想象你拥有一个庞大的图书馆,里面藏书无数(即大型语言模型,或 LLM),它极其聪明,但占用空间巨大。为了便于携带,你希望将这些书籍缩小。这个过程被称为量化。
目前大多数缩小这些书籍的方法,就像拿着一本字典,逐个将每个单词替换为简短的数字代码。这种方法简单,却忽略了单词往往成对或成组出现、彼此之间存在特定关系的事实。如果你将它们视为孤立的个体,就会失去故事的一些细微之处。
本文介绍了一种名为QAM-W(用于权重的正交幅度调制)的新方法。可以将其理解为一种更智能、更高效的方式来打包这些书籍。
以下是其工作原理,使用简单的类比说明:
1. 问题:“独舞者”与“双人舞”
想象 AI 模型中的权重就是舞者。
- 旧方法(标量量化): 旧方法将每个舞者视为正在表演独舞。它逐个审视每个舞者,并说:“你是一个'3',你是一个'7'。”它忽略了两个舞者可能手牵手或同步移动的事实。
- QAM-W 的洞察: 作者们意识到,在一行数据中,这些“舞者”实际上是以成对的方式跳舞的。它们是相互关联的。QAM-W 不再将它们编码为两个独立的独舞者,而是将它们视为一个双人舞组合。
2. 解决方案:“魔法旋转”与“配对”
QAM-W 采用三步流程来缩小模型,同时不丢失故事内容:
步骤 A:“魔法旋转”(哈达玛旋转):
想象舞者站在一个混乱拥挤的房间里。QAM-W 施加一种“魔法旋转”(一种数学旋转),重新排列他们。突然间,那些原本随机移动的舞者现在完美地配对,以平滑的圆形模式移动。这使得用数学描述他们变得容易得多。
步骤 B:“双人舞”码本:
QAM-W 不再给每个舞者分配单独的数字,而是将配对视为地图上的一个单一点。它使用一个预先制作好的“地图”(即码本),该码本是针对这些配对通常的行为模式训练而成的。这就像拥有一个标准双人舞动作的图书馆。你不再需要描述两个独立的步骤,只需说:“他们做了‘华尔兹第 42 号’动作。”这捕捉了两个数字之间的关系,从而节省了空间。
步骤 C:“音量旋钮”(激活感知缩放):
有时,模型的某些部分非常“响亮”(高度活跃),而其他部分则很“安静”。如果你过度缩小那些响亮的部分,音乐就会失真。QAM-W 在缩小之前会监听每个通道的“音量”。它略微调低响亮通道的音量,使它们更好地适应狭小的空间,确保最重要的信息不会被压碎。
3. 结果:体积更小,质量不变
该论文在五个不同的 AI 模型(从小型到中型大型)上测试了这种新方法。
- “甜蜜点”: 在特定的压缩水平下(约每个权重 5.5 位),QAM-W 取得了与原始未压缩模型几乎相同的结果。
- 对比: 一种流行的竞争方法称为SmoothQuant,需要约8.1 位才能达到相同的质量。而 QAM-W 仅使用32% 更少的位数就达到了相同的结果。
- 类比: 这就像打包行李箱。SmoothQuant 需要一个大行李箱才能整齐地装下你所有的衣服。而 QAM-W 将衣服折叠得如此高效,以至于你可以将完全相同数量的衣物装进一个更小的包中。
4. 它做不到什么(局限性)
该论文非常明确地说明了它不声称的内容:
- 并非最小: 如果你尝试将模型进一步缩小(降至 4 位),另一种称为QTIP的方法实际上表现更好。QAM-W 是“中小型”范围(5–6 位)的冠军,而非“微型”范围。
- 存储与速度: 该论文衡量的是模型在硬盘或内存中占用多少空间。它尚未声称能让模型在计算机芯片上运行得更快,因为用于在实时中实际使用这些压缩数字的软件仍在构建中。
总结
QAM-W 是一种用于 AI 模型的新型“打包技术”。通过识别数据成对出现、将它们旋转到更好的形状,并根据音量进行调整,它可以将 AI 模型缩小约三分之一,而不会降低其智能程度。这是一种专用工具,在特定尺寸范围内效果最佳,与现有方法相比,可显著节省存储空间。
技术摘要:QAM-W
问题陈述
当前针对大语言模型(LLM)的训后量化方法主要基于标量编码,将每个权重独立映射为整数索引。尽管这种方法简单,但标量编码忽略了权重行内固有的成对坐标结构。作者认为,在权重行内部,坐标通常是相关的;经过正交旋转后,这些坐标近似于二维圆形高斯分布。标量码本未能利用这一结构,留下了“率失真余量”,若将坐标对作为平面上的点而非独立标量进行联合量化,即可恢复这部分余量。
现有方法仅解决了该问题的部分方面:基于旋转的方法(如 QuIP、QuIP#)使坐标幅值均匀化,但通常依赖标量或格点编码;感知激活的方法(如 AWQ)根据激活幅值缩放通道,但未触及联合坐标结构。本文提出,一种结合旋转、联合二维编码和感知激活缩放的编解码器,能够在更低的比特率下实现更高质量的量化。
方法论:QAM-W 编解码器
作者引入了QAM-W(用于权重的正交幅度调制),这是一种按行处理权重矩阵的编解码器,其流程如下:
- 尺度与方向的分离:记录行范数(r=∥w∥2)作为元数据。将行归一化为单位向量 u。
- 确定性旋转:对归一化后的行应用符号掩码块哈达玛旋转(y=Rfwdu)。该旋转在实数运算中是精确的等距变换,意味着它不引入数学失真,但重新分配能量以减少坐标相干性。
- 配对与校准:将相邻的旋转坐标分组为复数值(zk=y2k+iy2k+1)。每对坐标通过校准因子 σk 进行缩放,该因子基于坐标对的平均幅值经验估计得出,将其建模为圆形高斯分布。
- 联合二维量化:QAM-W 不独立量化幅值和相位(极坐标编码),而是将每个归一化后的对映射到在单位圆形高斯分布上训练的单个二维 Lloyd-Max 码本中的最近质心。
- 感知激活的缩放:为了使编解码器误差与层的输出敏感性对齐,该方法在量化前应用每通道缩放因子(sj∝rjα),其中 rj 是输入通道激活的均方根(RMS)。这遵循了 AWQ 的逻辑,衰减了高 RMS 通道的贡献。
- 解码:解码器逆转上述过程:解包索引、查找质心、按 σk 重新缩放、应用逆旋转,并乘以存储的行范数。
作者通过复合界链分析了该系统:旋转是等距变换;在固定速率下,联合二维编码比极坐标编码更能最小化失真;层输出误差由迹恒等式(∥XΔW⊤∥F2=Tr(ΔWM^xΔW⊤))控制,这为感知激活的缩放提供了理论依据。
主要贡献
- 编解码器设计:一种针对 LLM 权重的行范数分解、块哈达玛旋转、联合二维 Lloyd-Max 编解码器,并具备感知激活的缩放功能。
- 理论分析:提出了一个复合单调界,将编解码器失真(Lloyd 失真 DB)与 BF16 模型和量化模型之间的 Kullback-Leibler (KL) 散度联系起来。该界表明,实际实现的 KL 散度在排序方法时,应与编解码器失真的排序一致。
- 跨模型实证研究:在来自四个家族(参数量 1.1B–13B)的五个 LLM 和八种量化配置上进行了评估。
- 秩相关性发现:论文证明,在 37 种(方法,模型)配置中,配对的 KL 散度与 ΔPPL% 在 Spearman ρ=0.99 下呈秩相关,验证了使用 KL 散度作为量化质量诊断指标的有效性。
结果
评估聚焦于三个指令微调模型(TinyLlama-1.1B、Qwen2.5-3B、Mistral-7B)以及在 Llama-2-7B 上的前沿对比。
- 约 5.5 bpw 下的质量:QAM-W 的感知激活变体(QAM-W-5.5)在所有测试模型上的 BF16 困惑度偏差保持在**±0.4%以内。这达到了SmoothQuant W8A8**(工作于约 8.1 bpw)的质量范围,但权重比特数减少了约32%。
- 联合二维编码 vs. 极坐标编码:在相同比特率(约 4 bpw)下,联合二维编码(QAM-W-4)在量化容忍型模型(TinyLlama、Mistral)上的 ΔPPL 比极坐标基线(QAM-W-polar)高出 1–3 个百分点(pp),在量化敏感型模型 Qwen2.5 上高出14.6 pp。
- 与 QTIP 的比较:在严格的 4 bpw 下,QTIP 方法(使用 E8 格点网格)优于 QAM-W。作者明确指出,QAM-W 的贡献在于5–6 bpw 的保质量区间,而非严格的 4 bpw 前沿。
- 低位宽变体:3.5 bpw 变体(QAM-W-3.5)在量化容忍型架构(如 Mistral 7B,ΔPPL +1.98%)上具有竞争力,但在敏感型模型(Qwen 2.5,ΔPPL +7.5%)上相比 GPTQ 表现较差。
- 下游任务:该编解码器在六个下游任务(PIQA、HellaSwag 等)和 MMLU 上保持了性能,QAM-W-5.5 在所有模型上的 MMLU 表现与 BF16 的差距在 0.2 pp 以内。
意义与主张
论文主张,QAM-W-5.5 代表了 LLM 压缩的一种保质量选择,与当前最先进的 SmoothQuant W8A8 相比,它在保持困惑度和下游任务准确率不降低的前提下,显著减少了权重存储和内存带宽(减少了 32% 的比特数)。
作者对其主张的范围持谨慎态度:
- 他们不主张在严格的 4 bpw 下具有优越性,承认 QTIP 在该领域占据主导地位。
- 他们指出,当前的流水线在矩阵乘法前将权重反量化为 BF16;因此,报告的每权重比特(bpw)节省仅适用于存储和内存带宽,而非推理延迟,直到实现融合内核。
- 该研究仅限于带有标准注意力机制的密集解码器-only 变换器;扩展到当代架构(如 Gemma 2、Llama 3)或 70B+ 参数规模留待未来工作。
- 码本是在合成单位圆形高斯分布上训练的,而非基于每个检查点的经验分布,尽管作者指出学习到的码本可能带来进一步的收益。
总之,QAM-W 表明,通过联合二维编码恢复权重的成对坐标结构,并结合旋转和感知激活的缩放,可以在 5–6 bpw 区间实现高保真量化,从而弥合了 4 比特方法的效率与 8 比特方法的质量之间的差距。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。