← 最新论文
🤖 machine learning

Float8@2bits: Entropy Coding Enables Data-Free Model Compression

该论文介绍了 EntQuant,这是一个无需数据的训练后压缩框架,它利用熵编码实现了针对 70B 参数等大型模型的极高比特率压缩(低于 4 位)且耗时不足 10 分钟,成功地将无需数据方法的快速性和通用性与通常需要校准数据的高保真度统一了起来。

原作者: Patrick Putzky, Martin Genzel, Mattes Mollenhauer, Sebastian Schulze, Thomas Wollmann, Stefan Dietzel

发布于 2026-06-01
📖 1 分钟阅读☕ 轻松阅读

原作者: Patrick Putzky, Martin Genzel, Mattes Mollenhauer, Sebastian Schulze, Thomas Wollmann, Stefan Dietzel

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你拥有一个规模宏大、细节极其丰富的图书库(即大型语言模型)。为了能在智能手机这类小型设备上阅读这些书,你需要将它们缩小。通常有两种方法:

  1. “快而粗糙”的方法: 你快速地将书籍复印在微小的索引卡片上。这种方法很快,不需要额外的研究,但如果你缩得太小(低于 4 bit),文字就会变成乱码,故事也会随之崩溃。
  2. “慢而完美”的方法: 你雇佣了一支编辑团队,利用特定的参考书对每一句话进行精心的重写,以确保其含义保持完美。这种方法效果很好,但需要耗费数天时间,需要大量的昂贵计算机,而且你必须能够访问那些(通常并不存在或属于私有的)原始参考书。

迎来 EntQuant: 这篇论文介绍了一种名为 EntQuant 的新方法,它就像是一个“神奇的缩放射线”,兼具了两者的优点。它既快速,又不需要参考书,还能在极端缩小的尺寸下保持故事的完整性。

以下是它的工作原理,使用简单的类比:

1. 问题所在:“固定盒子”陷阱

现有的方法强迫图书馆的文字进入固定大小的盒子中。

  • 如果你想节省空间,你就必须使用极小的盒子(低比特)。
  • 但极小的盒子只能容纳极少数特定的词汇。如果图书馆需要表达一个复杂的想法,它会因为盒子太小而陷入困境。这就是为什么现有的方法在尝试将模型缩小到 4 bit 以下时会失效;它们耗尽了“表达能力”。

2. 解决方案:“智能归档系统”

EntQuant 改变了规则。它不再强迫文字进入微小的盒子,而是保留了标准且高质量的盒子(如 Float8 或 Int8),但通过极其巧妙的组织方式,让它们几乎不占用空间。

这就像是搬家时的打包服务

  • 旧方法: 你必须把家具塞进预先定好尺寸的板条箱里。如果你有一个巨大的沙发,你必须把它切碎才能塞进一个小板条箱。
  • EntQuant 方法: 你保持家具的完整性(高精度),但通过紧凑的排列,让货车看起来几乎是空的。你使用一种“智能算法”来高效地堆叠物品,使得货车虽然装满了空气,但物品本身被完美地保存了下来。

3. 核心秘诀:“熵编码”

该论文使用了一种称为熵编码(具体为一种称为 ANS 的技术)的技术。

  • 想象你在编写一种秘密代码。如果字母“E”出现的频率是 50%,你就给它一个非常短的代码(比如“1”)。如果“Z”很少出现,你就给它一个较长的代码(比如“11010”)。
  • EntQuant 首先通过“训练”模型,使其更频繁地使用某些数字(使数据变为“低熵”)。
  • 然后,它利用这种智能编码来压缩数据。因为这些数字是可预测的,所以计算机可以用平均每参数不到 2 bit 的空间来存储它们,尽管这些数字本身仍然是以高精度格式存储的。

4. 为什么这意义重大

  • 无需“校准”: 大多数高质量的压缩方法都需要使用数据集进行“试驾”来调整模型。EntQuant 是无需数据的(data-free)。你可以拿走一个模型,在不到 10 分钟内完成压缩,然后它就能直接运行。这对于那些拥有私有或专业化数据的模型来说至关重要。
  • 极端压缩: 它成功地将庞大的模型(如 700 亿参数的模型)压缩到了可以适配消费级显卡的尺寸,同时保持了模型足够聪明,能够遵循复杂的指令并解决数学问题。
  • 速度: 虽然在读取时需要进行一定的“拆包”(解码)过程,但论文表明,在现代计算机上,这种速度损耗微乎其微(大约比原始速度慢 1.5 到 2 倍,这仍然非常快)。

总结

作者 Patrick Putzky、Martin Genzel(以及他们在 Merantix Momentum 的团队)创造了一个工具,让你能将巨大的 AI 模型缩小到像个小手提箱的大小,而不会丢失其智能,而且你可以瞬间完成,无需任何额外数据。这就像是能把一艘 70 英尺长的游艇装进背包里,且不损坏它。

关键要点: 他们打破了“为了节省空间就必须牺牲质量”的规则。通过使用智能归档系统(熵编码)而不是单纯地切割数据,他们在实现极端体积缩减的同时,保持了高质量。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →