← 最新论文
🤖 machine learning

HyperQuant: A Rate-Distortion-Optimal Quantization Pipeline for Large Language and Diffusion Models

HyperQuant 是一个统一的后训练量化流水线,它结合了随机哈达玛变换、最优格量化、Rice 编码和偏置修正,旨在为大型语言模型和扩散模型的权重及 KV 缓存实现率失真最优的压缩,在各种比特率下均优于现有方法,同时保持近乎无损的质量。

原作者: Yuval Domb, Hadar Sackstein, Tomer Solberg

发布于 2026-06-23
📖 1 分钟阅读☕ 轻松阅读

原作者: Yuval Domb, Hadar Sackstein, Tomer Solberg

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你拥有一个庞大且极其详尽的图书库(一个大型语言模型或视频生成器)。这些书籍包含了数十亿个词汇和图像,占用的空间如此之大,以至于几乎填满了你的电脑硬盘。当你要求计算机阅读一句话或生成一段视频时,它必须不断地在这些沉重的书籍之间来回搬运,这让机器感到既缓慢又疲惫。

HyperQuant 是一个全新的、聪明的系统,旨在将这些书缩减到其原大小的一小部分,同时又不丢失故事内容,使它们读取起来更快,存储起来更容易。

以下是它的工作原理,通过日常类比将其分解为简单的步骤:

1. “洗牌”技巧 (随机哈达玛变换 - Randomized Hadamard Transform)

想象你有一堆乱七八糟的纸张,其中有些页面巨大且沉重,而另一些则是微小的碎片。如果你试图把它们装进箱子,大的页面会凸出来,浪费空间。
HyperQuant 首先通过**“洗牌”**这些页面开始工作。它混合了数据,使得数据不再是只有少数几个巨大的离群值和许多微小碎片,而是变成了一个平滑、均匀的分布(就像一个完美的钟形曲线)。这使得数据更容易被高效地打包,就像洗一副扑克牌能让发牌更加均匀一样。

2. “完美打包” (格点量化 - Lattice Quantization)

一旦数据被洗牌,HyperQuant 就需要将连续的数字转换为可以存储的离散“点”。

  • 旧方法: 想象尝试用简单的网格(就像棋盘一样)将球体装入箱中。球体之间会有大量的空隙和浪费的空间。
  • HyperQuant 的方法: 它使用数学“格点”(例如 E8 或 D4 形状)。你可以把这些想象成在板条箱中堆叠橙子最有效率的方式。它们能让球体紧密地结合在一起,几乎没有浪费的空间。这使得系统可以使用更少的比特来存储相同数量的信息。

3. “拉链” (熵编码与 Rice 编码 - Entropy Coding & Rice Codes)

即使有了完美的打包,你仍然有一长串数字需要记录下来。

  • 旧方法: 你会为每一个数字分配相同的空间,即使有些数字出现得非常频繁,而另一些则很少出现。
  • HyperQuant 的方法: 它使用了一种变长编码(Rice 编码)。这就像是一种秘密语言,常用的词汇使用极短的代码(比如用 "u" 代表 "you"),而罕见的词汇则使用较长的代码。因为系统知道哪些数字出现得最频繁,它可以进一步压缩数据,在不丢失任何意义的情况下节省空间。

4. “降噪” (KV 缓存的偏差修正 - Bias Correction for KV Cache)

当模型记忆之前的单词(即“KV 缓存”)时,它需要非常精确。如果对数字进行过于粗糙的舍入,模型可能会产生混乱,甚至开始产生幻觉(胡言乱语)。
HyperQuant 使用了一个技巧,叫做**“减法抖动” (subtractive dither)**。想象你正在测量液体的体积,但你的杯子有点晃动。与其仅仅靠猜测,不如先加入一点随机的水,测量它,然后再减去那个完全相同的随机量。这样可以完美地抵消误差,确保即使在数据被高度压缩的情况下,最终结果依然准确且无偏差。

5. “魔法盒” (硬件集成 - Hardware Integration)

最后,HyperQuant 被设计为直接与现代计算机芯片(如 NVIDIA 的 H100 和 Blackwell GPU)协同工作。它不仅仅是压缩数据,它还对数据的格式进行了处理,使得芯片无需先进行解包即可立即读取。

  • 结果: 它发现,对于这种特定类型的压缩数据,使用 8 位整数(标准的整数)实际上比 8 位浮点数(小数)效果更好。这就像是意识到对于这个特定的谜题,整数比小数更能完美契合槽位。

核心优势

论文声称 HyperQuant 实现了以下目标:

  • 大规模压缩: 它将模型的“权重”(weights)缩小了约 4 倍,并将“工作记忆”(KV 缓存)缩小了约 3.8 倍
  • 无质量损失: 尽管数据被压缩得如此之多,该模型理解和生成文本或视频的能力几乎与原始未压缩版本一样出色。
  • 视频领域的成功: 它成功压缩了一个 190 亿参数的视频生成模型 (LTX-2),且没有出现任何可见的闪烁或故障。
  • 击败竞争对手: 它在几乎所有的测试中都优于以往的顶级方法(如 HIGGS、TurboQuant 和 OCTOPUS),尤其是在尝试将数据压缩到极小尺寸(如每个数字 1.7 比特)时。

简而言之,HyperQuant 是一种新的“打包算法”,它通过洗牌、堆叠和拉链式压缩,让 AI 模型能够轻松装进你的口袋,同时又不破坏故事的完整性。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →