← 最新论文
🤖 machine learning

TORQ: Two-Level Orthogonal Rotation for MXFP4 Quantization

本文介绍了 TORQ,这是一种无需训练的量化后处理框架,它采用两级正交旋转从理论上解决 MXFP4 激活量化的结构性不平衡问题,从而显著缩小大语言模型上 4 位推理与全精度模型之间的精度差距。

原作者: Zukang Xu, Xing Hu, Dawei Yang

发布于 2026-05-20
📖 1 分钟阅读☕ 轻松阅读

原作者: Zukang Xu, Xing Hu, Dawei Yang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图将一座庞大而混乱的图书馆中的书籍(智能 AI 内部的“激活值”)打包进微小的、统一的运输箱("MXFP4"格式)中,以便快速且廉价地运输。

论文指出,简单地将这些书籍塞进箱子里效果并不好。书籍太过杂乱,而箱子的形状非常具体且僵硬。这导致了两个主要问题,作者将其称为TORQ(两级正交旋转)。

以下是论文如何运用简单的类比来解释问题及其解决方案:

问题:打包失败的两种方式

1. “一个吵闹的邻居”问题(块间方差失衡)
想象你的图书馆被分成了每组 32 本书的组别。在当前的系统中,每组只有一个单一的“尺寸标签”(缩放因子)用于整组。

  • 问题所在: 在大多数组中,书籍都很小且轻。但在少数组中,有一本巨大且厚重的百科全书。
  • 结果: 由于那本厚重的书,整个组的标签必须被设定为“特大号”。这意味着同一组中所有微小、轻薄的书籍现在都被迫塞进一个巨大的箱子里。它们会被压碎、丢失,或者因为箱子太大而无法容纳其微小细节而被转化为零。少数几个“吵闹”的组破坏了所有人的精度。

2. “空货架”问题(块内码本利用率失衡)
运输箱(MXFP4)附带一份预印的特定尺寸清单(“码本”),这些尺寸像梯子的横档一样分布:小、中、大、特大。

  • 问题所在: 现实世界的 AI 数据就像一群人中,90% 非常矮,只有 10% 很高。
  • 结果: 几乎所有数据都落入了梯子的“小”横档上。“中”和“大”的横档完全空置且未被使用。这就像拥有一个装满巨型板条箱的仓库,但你只使用那些微小的箱子,而巨大的箱子则积满灰尘。这是对空间和潜力的巨大浪费。

解决方案:TORQ(大重组)

作者提议在打包之前先对书籍进行旋转,而不是试图强行将杂乱的书籍塞进箱子。这就像洗牌,让重牌和轻牌均匀混合,让高个子和矮个子分散开来。

他们分两步进行:

第一步:宏观洗牌(解决“吵闹的邻居”)

  • 类比: 想象你有 100 组书籍。有些组很重,有些很轻。作者使用一种基于舒尔 - 霍恩定理(Schur-Horn theorem)的数学技巧来在组之间交换书籍。
  • 目标: 他们将“重”书从重组移到轻组,反之亦然。
  • 结果: 现在,每一组的总重量大致相同。没有哪一组被一本巨大的书所主导。这使得每一组的“尺寸标签”都能设定为完美的中等尺寸,从而保留小书籍的细节。

第二步:微观洗牌(解决“空货架”)

  • 类比: 现在组别已经平衡,看看组内部。书籍仍然聚集在“小”区域。作者旋转组内部的书籍。
  • 目标: 他们旋转书籍,使它们均匀地分布在尺寸梯子的整个范围内。不再是 90% 的书籍是“小”的,现在它们被分布开来,一些落在“中”横档,一些落在“大”横档。
  • 结果: 他们利用了梯子上的每一个横档。没有空间被浪费。“码本”得到了充分利用。

结果

通过在 AI 压缩(称为训练后量化,意味着他们不需要重新训练 AI)之前进行这种两步旋转,他们取得了惊人的成果:

  • 精度: 他们成功将 AI 缩小到 4 位精度(小箱子),而没有损失太多其“脑力”。在测试中,他们的方法(TORQ)比之前的方法更智能,得分接近全尺寸、未压缩的 AI。
  • 速度与大小: 由于箱子更小,AI 运行速度更快,并且在手机或服务器等设备上占用的内存更少。
  • 无需额外工作: “旋转”只需计算一次,然后被烘焙到 AI 的权重中。当 AI 运行时,它不会感到任何额外的减速;旋转作为数学的一部分自动发生。

简而言之: 论文说,“不要试图将杂乱、不均匀的人群塞进一个僵硬的箱子里。相反,轻轻地洗牌,让每个人均匀分散,然后再将他们放入箱子。这样可以让箱子完美运作。”

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →