← 最新论文
🤖 machine learning

Statistically-Lossless Quantization of Large Language Models

本文介绍了统计无损量化(SLQ),这是一种层级非对称量化方法,它在每参数低于 4 位时实现了任务无损的精度,在 5–6 位时实现了分布无损的保真度,同时实现了相对于 FP16 1.7–3.7 倍的推理加速。

原作者: Michael Helcig, Eldar Kurtic, Dan Alistarh

发布于 2026-08-11
📖 1 分钟阅读☕ 轻松阅读

原作者: Michael Helcig, Eldar Kurtic, Dan Alistarh

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下人工智能的世界就像一座巨大且繁忙的图书馆,那里的书不是由纸张制成的,而是由纯粹的数学构成的。这些“书”就是大语言模型(LLMs),即那些能够写故事、解方程并像人类一样聊天的超级智能计算机。但问题在于,这些图书馆规模宏大。要阅读一本书,你需要一台巨大的、昂贵的且极其耗电的超级计算机。大多数人的客厅里并没有这样一台设备。因此,科学家们一直试图缩小这些“书”的体积——让它们变得更小、更轻,以便能装进普通的手机或笔记本电脑中。这个过程被称为“量化”(quantization)。你可以把它想象成将一张高分辨率照片压缩成较小的文件。通常情况下,如果你把文件压缩得太厉害,图片会变得模糊或出现像素块(这是“有损”压缩)。如果你希望图片保持完美,文件就会保持庞大(这是“无损”压缩)。科学家们一直在问一个大问题:我们能否将这些 AI 大脑缩小到足以装进手机,同时又能保持足够的聪明才智来通过测试,而不会让它们出现卡顿或幻觉?

这篇题为《大语言模型的统计无损量化》(Statistically-Lossless Quantization of Large Language Models)的论文深入探讨了这个棘手的中间地带。作者 Michael Helcig、Eldar Kurtic 和 Dan Alistarh 认为,我们不需要在模糊的小型模型和完美的巨型模型之间做选择。相反,他们提出了一种新的缩小模型的方法,这种方法是“统计无损”的。这里有一个神奇的技巧:他们意识到,当人类(甚至是 AI 本身)回答问题时,总会存在一点随机性。如果你两次询问同一个 AI 同一个问题,它可能会给出略有不同的答案,就像你可能会根据自己的心情不同,对朋友的问题做出不同的回答一样。作者发现,如果缩小的模型能保持在那种自然的“情绪波动”范围内,那就足够好了。他们创造了一种名为 SLQ(统计无损量化)的方法,它就像一位大师级的裁缝。SLQ 不会对 AI 大脑的每个部分都进行同样大小的切割,而是精确测量每一部分的敏感程度。有些部分得到的空间极小(低至每参数 3.3 位),而另一些部分则会得到更多空间。

这篇论文做出了一些改变我们对缩小 AI 理解方式的具体发现。首先,他们证明了某种特定的衡量“缩减”程度的方式至关重要。他们引入了一个名为 EAR(预期接受率)的指标,这就像是一个“词元一致性得分”。如果原始 AI 和缩小的 AI 在 100 个词中对 99 个词,那就是一次胜利。他们发现,为了实现这种完美的契合,必须非常小心如何缩小数值。他们从数学上证明了,使用一种“对称”的缩减方式(将正数和负数同等对待)实际上比“非对称”方式(通过平移比例尺来完美适配数据)会产生更多的噪声和误差。这就像试图把一个不对称的行李箱塞进一个正方形的盒子里;如果你强行将其置于中心,它无法完全闭合。你必须移动行李箱以适应盒子的形状。

结果令人印象深刻。通过使用 SLQ 方法,他们成功地将 Llama-3.3-70B 和 Qwen3 等模型缩小到了平均 3.3 到 4.7 位每参数,同时保持了它们的“任务无损”准确度(这意味着它们仍能通过与大版本相同的测试)。如果他们想要更加严格,确保 AI 的内部“情绪”(其概率分布)与原始版本几乎完全一致,则需要大约 5 到 6 位。但最棒的部分是?由于模型变得如此之小,它们的运行速度也快得多。作者在真实硬件上进行了测试,发现他们的缩小版模型比原始的全尺寸版本快了 1.7 到 3.7 倍,甚至可以装载在更少的显卡上。他们还表明,像 GPTQ 或 AWQ 这样的旧方法往往无法达到这种“统计无损”的目标,要么过于模糊,要么压缩得不够。简而言之,这篇论文表明,通过更聪明地决定在哪里以及如何缩小 AI,我们可以让这些庞大的大脑变得既小巧、快速,又依然拥有惊人的准确度,而无需牺牲回答的质量。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →