← 最新论文
🤖 machine learning

Reliability Scaling Laws for Quantized Large Language Models

本文通过对不确定性、校准度和鲁棒性的全面评估,研究了量化大语言模型的可靠性,揭示了虽然性能随总模型比特数单调缩放,但可靠性在 4 位量化时达到峰值,且量化实际上增强了模型对自然输入扰动的鲁棒性。

原作者: Sirine Ayadi, Sándor Daróczi, Stephan Günnemann, Bertrand Charpentier

发布于 2026-07-14
📖 1 分钟阅读☕ 轻松阅读

原作者: Sirine Ayadi, Sándor Daróczi, Stephan Günnemann, Bertrand Charpentier

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你拥有一个巨大的、超级聪明的机器人大脑(大型语言模型),它能写故事、回答百科知识,还能像人类一样聊天。但这个大脑非常庞大——它占据了整个房间,并且消耗大量的电力。为了让它能装进你的口袋并在普通的笔记本电脑上运行,科学家们尝试对其进行“缩减”。他们这样做的方法叫做量化(quantization),就像是将一张高清晰度的照片压缩成较小的文件体积。你会损失一点细节,但图片依然清晰可辨,而且更容易携带。

长期以来,人们一直认为规则很简单:“文件越大(数据位越多),机器人的大脑就越聪明。”但由慕尼黑工业大学和 Pruna AI 的研究人员进行的一项新研究表明,这个规则只对了一半。他们发现,虽然更大的大脑确实更擅长获得正确答案,但它并不一定更擅长知道自己何时可能出错,或者处理混乱的、现实世界中的拼写错误。

“甜点区”的发现

研究人员使用不同的压缩水平测试了这些缩减后的机器人:16位(巨大的、未压缩的版本)、8位、4位、3位,甚至2位(最微小的、压缩程度最高的版本)。他们测量了两项指标:

  1. 准确率(Accuracy): 它能否答对百科问题?
  2. 可靠性(Reliability): 如果问题中带有拼写错误、奇怪的表情符号或俚语,机器人是否仍能理解其含义?它是否知道自己感到困惑?

这里有一个转折,他们发现了:准确率会随着你增加位数而持续上升,这是一条直线。但可靠性却像是一场过山车。

研究显示,最可靠、最值得信赖的版本既不是最大的,也不是最小的。它正是4位版本

把它想象成收拾行李旅行。

  • 16位模型就像是带上了你所有的衣橱,包括你拥有的每一双鞋。你拥有一切,但它又重又慢。
  • 2位模型就像是把所有东西都塞进了一个微小的、皱巴巴的袜子。它超级轻,但你找不到袜子,而且衬衫也破了。
  • 4位模型则是完美的登机箱。它轻便易携,但你依然拥有心仪的套装、鞋子和牙刷。事实证明,对于这些人工智能机器人来说,将它们缩减到4位,会让它们在应对“混乱”输入(如拼写错误或俚语)时表现得比巨大的未压缩版本更加稳健。

“混乱输入”测试

现实生活并不完美。人们不会输入完美的句子。他们使用表情符号,会犯拼写错误,会将字母替换为数字(比如用“h3ll0”代替“hello”),或者使用像“lol”或“rofl”之类的俚语。

研究人员创建了15种不同的破坏输入文本的方式,从改变一个字母为符号到添加随机表情符号。他们发现,当机器人的压缩程度为 4位 时,它处理这些混乱输入的表现实际上比巨大的、未压缩的版本还要好。这就像是压缩过程无意中训练了机器人,使其变得更加灵活,不再轻易被一个拼写错误所迷惑。

然而,如果你过度挤压机器人(降至2位),它就会开始崩溃。它会感到困惑,信心摇摆,并开始编造事实。该研究明确排除了“越小越好”或“越大越安全”的观点。事实上,即使是那些巨大的模型(如700亿参数的模型),在被压缩后也不一定表现出最好的可靠性;有时,一个中等规模的模型压缩到4位后,反而会是最值得信赖的。

关于“剪枝”

研究人员还尝试了一种不同的缩减方法,叫做剪枝(pruning),这就像是直接剪掉机器人大脑中的整个分支,而不是仅仅压缩数据。他们发现,剪枝的效果不如量化。这就像是试图通过剪掉背包的背带来减轻重量;没错,它变轻了,但它也会散架。量化(压缩数据)在保持机器人大脑完整的同时提高了效率,而剪枝则降低了它的可靠性。

他们有多确定?

作者并非凭空猜测;他们进行了数千次实验。他们测试了四个不同家族的机器人大脑(LLaMA, OPT, Qwen)和六种不同的压缩方法。他们在真实的数据库(如 TriviaQA 和 CoQA)上测量了结果。

他们发现,“4位甜点区”并非偶然现象。它在不同规模的模型(从10亿到700亿参数)和不同类型的任务中都表现得非常一致。虽然他们并没有证明一个可以预测未来的数学定律,但其数据强烈表明,在固定内存容量的情况下,将模型压缩到4位可以在智能程度与可靠性之间达到最佳平衡。

总结

如果你想构建一个既能装进手机、又能处理充满拼写错误和表情符号的短信,且值得信赖的人工智能,不要只盯着你能找到的最大模型,也不要把它挤压到极小。研究表明,4位量化就是那个神奇区域。它是人工智能压缩领域的“金发姑娘”(Goldilocks)法则:不太大,也不太小,恰到好处,能让机器人在现实世界中保持聪明、快速且可靠。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →