想象一下,你正试图将一座庞大而混乱的图书馆中的书籍(智能 AI 内部的“激活值”)打包进微小的、统一的运输箱("MXFP4"格式)中,以便快速且廉价地运输。
论文指出,简单地将这些书籍塞进箱子里效果并不好。书籍太过杂乱,而箱子的形状非常具体且僵硬。这导致了两个主要问题,作者将其称为TORQ(两级正交旋转)。
以下是论文如何运用简单的类比来解释问题及其解决方案:
问题:打包失败的两种方式
1. “一个吵闹的邻居”问题(块间方差失衡)
想象你的图书馆被分成了每组 32 本书的组别。在当前的系统中,每组只有一个单一的“尺寸标签”(缩放因子)用于整组。
- 问题所在: 在大多数组中,书籍都很小且轻。但在少数组中,有一本巨大且厚重的百科全书。
- 结果: 由于那本厚重的书,整个组的标签必须被设定为“特大号”。这意味着同一组中所有微小、轻薄的书籍现在都被迫塞进一个巨大的箱子里。它们会被压碎、丢失,或者因为箱子太大而无法容纳其微小细节而被转化为零。少数几个“吵闹”的组破坏了所有人的精度。
2. “空货架”问题(块内码本利用率失衡)
运输箱(MXFP4)附带一份预印的特定尺寸清单(“码本”),这些尺寸像梯子的横档一样分布:小、中、大、特大。
- 问题所在: 现实世界的 AI 数据就像一群人中,90% 非常矮,只有 10% 很高。
- 结果: 几乎所有数据都落入了梯子的“小”横档上。“中”和“大”的横档完全空置且未被使用。这就像拥有一个装满巨型板条箱的仓库,但你只使用那些微小的箱子,而巨大的箱子则积满灰尘。这是对空间和潜力的巨大浪费。
解决方案:TORQ(大重组)
作者提议在打包之前先对书籍进行旋转,而不是试图强行将杂乱的书籍塞进箱子。这就像洗牌,让重牌和轻牌均匀混合,让高个子和矮个子分散开来。
他们分两步进行:
第一步:宏观洗牌(解决“吵闹的邻居”)
- 类比: 想象你有 100 组书籍。有些组很重,有些很轻。作者使用一种基于舒尔 - 霍恩定理(Schur-Horn theorem)的数学技巧来在组之间交换书籍。
- 目标: 他们将“重”书从重组移到轻组,反之亦然。
- 结果: 现在,每一组的总重量大致相同。没有哪一组被一本巨大的书所主导。这使得每一组的“尺寸标签”都能设定为完美的中等尺寸,从而保留小书籍的细节。
第二步:微观洗牌(解决“空货架”)
- 类比: 现在组别已经平衡,看看组内部。书籍仍然聚集在“小”区域。作者旋转组内部的书籍。
- 目标: 他们旋转书籍,使它们均匀地分布在尺寸梯子的整个范围内。不再是 90% 的书籍是“小”的,现在它们被分布开来,一些落在“中”横档,一些落在“大”横档。
- 结果: 他们利用了梯子上的每一个横档。没有空间被浪费。“码本”得到了充分利用。
结果
通过在 AI 压缩(称为训练后量化,意味着他们不需要重新训练 AI)之前进行这种两步旋转,他们取得了惊人的成果:
- 精度: 他们成功将 AI 缩小到 4 位精度(小箱子),而没有损失太多其“脑力”。在测试中,他们的方法(TORQ)比之前的方法更智能,得分接近全尺寸、未压缩的 AI。
- 速度与大小: 由于箱子更小,AI 运行速度更快,并且在手机或服务器等设备上占用的内存更少。
- 无需额外工作: “旋转”只需计算一次,然后被烘焙到 AI 的权重中。当 AI 运行时,它不会感到任何额外的减速;旋转作为数学的一部分自动发生。
简而言之: 论文说,“不要试图将杂乱、不均匀的人群塞进一个僵硬的箱子里。相反,轻轻地洗牌,让每个人均匀分散,然后再将他们放入箱子。这样可以让箱子完美运作。”
技术摘要:TORQ——面向 MXFP4 量化的两级正交旋转
1. 问题陈述
随着大语言模型(LLM)向实际部署迈进,微缩放浮点 4 位(MXFP4)格式因其高动态范围与硬件效率的平衡,已成为低比特推理的关键标准。然而,直接将 MXFP4 应用于 LLM 激活量化会导致严重的精度下降。论文指出,现有的基于旋转的量化方法主要面向整数格式(如 INT4)设计,未能解决块浮点(BFP)格式(如 MXFP4)独特的拓扑结构问题。
通过理论分析,作者揭示性能下降源于真实世界激活分布与 MXFP4 块浮点格式之间的两种结构性失衡:
- 块间方差极端失衡:在固定块微缩放机制下,激活方差高度不均。少数高方差块主导了总量化误差。这些块迫使共享缩放因子(指数)向上调整以容纳异常值,导致同一块内绝大多数小幅度激活的分辨率被过度粗糙化,通常造成超过 90% 的元素被置零。
- 块内码本利用率失衡(码本坍缩):真实世界的激活通常遵循集中在零附近的重尾分布,这与 MXFP4(e2m1)的几何级数码本不匹配。这导致“码本坍缩”,即绝大多数数值落入最小量化区间,而用于大数值的高容量码字处于闲置状态。统计数据显示,约 50% 的码字范围仅由约 10% 的数据激活。
2. 方法论:TORQ 框架
为应对这些挑战,作者提出了TORQ(面向 MXFP4 量化的两级正交旋转),这是一个无需训练的量化后(PTQ)框架。TORQ 并非被动调整量化参数,而是主动旋转激活坐标系,使分布特性与 MXFP4 的结构属性对齐。该方法将优化分解为两个数学上正交的子问题:
A. 宏观均衡旋转(块间)
- 目标:通过在所有块间均匀重分布激活能量,消除高方差块的主导地位。
- 理论基础:基于**舒尔 - 霍恩定理(Schur-Horn theorem)**和凸优化理论。作者证明,在凸误差模型下,均衡化块间方差可最小化全局均方误差(MSE)。
- 机制:构建一个正交变换,确保变换后协方差矩阵的对角元素均匀(即所有块方差相等)。这充当了一种“软异常值抑制”机制,防止高方差块推高共享缩放因子,从而保留小幅度元素的精度。
- 实现:采用高效的迭代吉文斯旋转(Givens rotation)算法构建旋转矩阵,确保在 O(B2) 时间内收敛。
B. 微观对齐旋转(块内)
- 目标:通过重塑块内激活分布以充分利用 MXFP4 码本容量,从而缓解“码本坍缩”。
- 理论基础:遵循最大熵原理。目标是使激活分布在归一化的 FP4 空间内“流动”并均匀填充每个码字区间。
- 机制:该方法定义了一个码本占用均衡损失,用于衡量经验码字使用率与均匀分布之间的偏差。
- 优化:采用交替坐标下降策略:
- S 步:更新块缩放因子,将最大激活值映射到最大 MXFP4 码字。
- R 步:利用吉文斯旋转更新块内正交旋转矩阵。一种启发式方法选择具有高失衡性和统计互补性的列对,然后通过有限枚举搜索最佳旋转角度(利用损失函数的分段常数特性)。
推理效率
TORQ 旨在实现最小开销。在离线校准阶段,逆旋转矩阵被融合到相邻线性层的权重中。因此,在线推理阶段几乎不产生额外的计算成本,因为旋转实际上已被吸收进权重矩阵乘法中。
3. 主要贡献
- 问题形式化:本文首次系统性地识别并形式化了阻碍 MXFP4 性能的两个结构性挑战:块间方差失衡与块内码本利用率失衡。
- 双级框架:提出了 TORQ,这是首个专为块浮点结构设计的两级旋转框架。通过整合宏观方差均衡与微观码本对齐,实现了量化误差的系统性最小化。
- 理论基础:作者提供了严格的证明,表明在凸误差模型下方差均衡近似最优,且在 MXFP4 几何结构下码字占用均衡近似于量化误差的最小化。
- 高效的 PTQ 流程:建立了一个无需微调的流程,仅需极少量的校准数据(例如 128 个样本),并展现出硬件友好性,参数占用可忽略不计。
4. 实验结果
实验在主流 LLM(LLaMA3 系列和 Qwen3 系列)上进行,参数量范围从 8B 到 70B,涵盖稠密架构和混合专家(MoE)架构。评估包括 WikiText2 上的困惑度,以及 ARC、HellaSwag、MMLU、GSM8K 和 HumanEval 等任务的零样本准确率。
- 性能优越性:TORQ 显著优于现有的最先进(SOTA)方法(包括 RTN、GPTQ、QuaRot、OSTQuant、FlatQuant 和 BRQ)。
- 在Qwen3-32B上,TORQ 将 WikiText 困惑度降低至8.43(RTN 为 274.93,OSTQuant 为 14.62),接近 7.61 的 BF16 基线。
- Qwen3-32B 在零样本任务上的平均准确率从38.40%(RTN)提升至73.63%(TORQ),几乎匹配 74.82% 的 BF16 基线。
- 在LLaMA3-70B上,TORQ 实现了3.49的困惑度(RTN 为 3180.43),平均准确率达到76.28%。
- 推理能力:TORQ 在复杂推理任务中展现了强大的“深度智能”恢复能力。在 Qwen3-8B 的 GSM8K 任务上,准确率恢复至86.82%(GPTQ 为 67.37%),HumanEval 准确率达到61.15%。
- 泛化性:该方法在不同微缩放格式(MXINT4、NVFP4)和 MoE 架构(Qwen3-30B-A3B)上均被证明有效,确认了其格式无关的特性。
- 效率:TORQ 的校准速度显著快于竞争方法(例如,在 Qwen3-32B 上比 FlatQuant 快约 10 倍)。在 Qwen3-30B-A3B 上观察到比 BF16 快3.5 倍的推理加速,内存占用从 56.9GB 减少至 15.3GB。
5. 意义与主张
论文声称,TORQ 有效地弥合了 4 位浮点量化与全精度推理之间的差距,解决了 MXFP4 激活量化固有的精度下降问题。通过将优化范式从局部参数调整转变为“结构感知正交变换”,TORQ 提供了首个针对 MXFP4 激活量化的系统性解决方案。
作者将此项工作定位为低比特浮点格式在 LLM 高效部署应用中的关键基础。他们承认了局限性,例如目前仅关注一阶统计量(忽略了峰度等高阶矩)以及使用固定块大小,并指出针对这些因素的自适应策略仍是未来工作的方向。然而,当前结果确立了低比特浮点激活量化的新优化范式。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。