← 最新论文
🔢 mathematics

High-Rate Quantized Matrix Multiplication I

本文研究了在无先验统计校准的情况下,通用矩阵乘法中量化率与失真之间的基本信息论权衡,同时分析并推导了如绝对值最大整数和浮点等流行量化方案的启发式近似。

原作者: Or Ordentlich, Yury Polyanskiy

发布于 2026-05-14
📖 1 分钟阅读🧠 深度阅读

原作者: Or Ordentlich, Yury Polyanskiy

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图将一部庞大、高清的电影通过一条微小、狭窄的隧道发送出去。这部电影代表了大型语言模型(如驱动聊天机器人的那些模型)内部复杂的数学运算,而隧道则代表了计算机的内存和处理速度。如果你试图将完整、未压缩的电影强行推过隧道,隧道就会堵塞,计算机的运行速度也会慢如蜗牛。

为了解决这个问题,工程师们使用了量化。你可以将其想象成将这部高清电影压缩成一个低分辨率、像素化的版本。它并不完美,但它能快得多地穿过隧道,而且画面仍然清晰到足以观看。

这篇由 Or Ordentlich 和 Yury Polyanskiy 撰写的论文,就像一份关于压缩的理论物理学报告。作者们并没有仅仅测试不同的压缩工具以查看哪种在实际中效果最好,而是问道:“在数据变成垃圾之前,我们压缩数据的绝对数学极限究竟有多高?”

以下是他们发现的简要说明,使用了简单的类比:

1. 两种类型的“压缩”

作者指出了数学家和工程师在谈论“速率”(即我们保留多少数据)时存在的混淆。

  • 数学家的观点:想象将一整块像素压缩成一个单一的、巧妙的代码。这是最高效的方式,但在实时操作中极其困难。
  • 工程师的观点:想象逐个查看每个像素,并说:“你有点太亮了,所以我只把你四舍五入到最接近的标准颜色。”这就是当前 AI 芯片的工作方式(使用 INT8 或 FP8 等格式)。它快速且简单,但作者认为,它并不像理论极限那样高效。

2. “高比率”假设

该论文关注的是压缩并非过于极端(例如将电影压缩成火柴人)的场景。他们假设我们保留了足够的细节,使得由四舍五入引入的“噪声”(误差)很小。

  • 类比:想象试图用尺子测量一张桌子。如果你的尺子有微小、精确的刻度(高比率),误差就只是几分之一毫米。如果你使用刻度间隔巨大的尺子(低比率),误差就会非常巨大。作者假设我们使用的是精确的尺子,这使得他们能够利用简单的数学来预测误差。

3. “完美”与“现实”

作者计算出了基本极限:如果你拥有一个能够一次性观察整个画面的魔法压缩工具,你所能期望达到的最佳精度。

  • 结果:他们发现,对于一个完美的系统,随着你增加位数(更多细节),误差会迅速下降。
  • 现实检验:随后,他们审视了当今 AI 中流行的工具,如INT(整数)和FP(浮点)格式。
    • 问题:这些工具通常使用“一刀切”的缩放方法(就像用同一把尺子去量巨大的大象和微小的老鼠)。如果数据包含少数几个巨大的数字和许多小数字,尺子会被拉伸以适应大数字,导致小数字看起来像模糊的点。
    • 解决方案:他们发现,如果在压缩之前旋转数据(就像旋转图片使锯齿状边缘与网格对齐),“模糊”会变得更加均匀和可预测。这是一种称为随机旋转的技术。

4. “收缩”的惊喜

一个有趣的发现是关于“收缩”的。

  • 类比:如果你压缩一张照片,然后尝试解压缩它,对原始图像的最佳猜测不仅仅是解压缩后的照片;它实际上是一个略微“收缩”的版本。
  • 论文的观点:虽然这种“收缩”效应确实存在,但作者发现,在他们研究的高质量(高比率)世界中,其益处微乎其微,因此为了保持数学简洁,我们可以安全地忽略它。

5. 测试工具

作者们利用来自流行 AI 模型(Llama 3)的真实世界数据测试了他们的理论。

  • INT 与 FP:他们发现,对于标准整数格式(INT),首先旋转数据至关重要。如果没有旋转,误差可能会非常大。有了旋转,误差会降至接近理论极限。
  • 浮点数(FP):令人惊讶的是,对于浮点格式,旋转数据实际上是有害的。作者解释说,这些格式处理数字的方式天然地更好地处理了“锯齿状边缘”,因此旋转数据只会把事情搞砸。
  • NestQuant:他们研究了一种名为 NestQuant 的新颖方法(它使用称为“格”的复杂几何形状,而不是简单的立方体)。他们发现,它的表现明显优于标准工具,更接近那个“魔法”般的理论极限。

结论

这篇论文提供了AI 压缩未来的蓝图。它告诉我们:

  1. 我们压缩 AI 数学的能力存在一个严格的数学极限。
  2. 当前的工具(如 INT8 和 FP8)虽然不错,但它们往往因为未考虑数据的形状而将“精度位”留在了桌面上。
  3. 旋转是一个强大的技巧,但它是一把双刃剑:它有助于整数数学,但会损害浮点数学。
  4. 更新的、更复杂的方法(如 NestQuant)正开始弥合我们实际所做与数学上可能做到之间的差距。

简而言之,这篇论文说:“我们知道这条高速公路的限速。目前的汽车行驶得很快,但如果我们调整引擎(使用旋转或更好的格),我们可以在不撞车的情况下更接近那个限速。”

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →