← 最新论文
🤖 machine learning

When Less is More: 8-bit Quantization Improves Continual Learning in Large Language Models

本文证明了 8 位量化通过作为一种防止过拟拟合的隐式正则化手段,在持续学习场景中显著优于全精度模型,使大语言模型能够以极小的回放缓冲区更有效地保留知识。

原作者: Michael S. Zhang, Rishi A. Ruia, Arnav Kewalram, Saathvik Dharmapuram, Utkarsh Sharma, Kevin Zhu

发布于 2026-07-02
📖 1 分钟阅读☕ 轻松阅读

原作者: Michael S. Zhang, Rishi A. Ruia, Arnav Kewalram, Saathvik Dharmapuram, Utkarsh Sharma, Kevin Zhu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你有一位才华横溢的学生(一个大型语言模型),他非常聪明,但记性极差。每当他学习一门新学科时,他往往会忘记之前学过的所有内容。这被称为“灾难性遗忘”。

为了帮助他记住,老师们通常使用“回放”(replay)方法:在教授新课程时,给学生一些旧课程的闪卡。闪卡堆得越大,学生的记忆力就越好。

然而,在现实世界中,我们经常需要缩小这些学生的身材,以便让他们在普通计算机上运行得更快、更便宜。这个过程被称为量化(quantization)。你可以把它想象成将一部高清的 4K 电影转换成粗糙的、黑白的 8 位像素视频游戏。你会损失一些细节,但文件体积会变得非常小。

普遍的观点是:“如果你缩小学生的身材(进行量化),他们会忘得更快,所以你需要更多的闪卡来帮助他们记忆。”

这篇论文颠覆了这个想法。 以下是研究人员通过简单的类比所发现的内容:

1. “多噪”的学生 vs. “完美”的学生

研究人员测试了三种类型的学生:

  • 完美的学生 (FP16): 拥有晶莹剔透、高精度的头脑。
  • 8 位学生 (INT8): 一个稍微压缩过的版本。
  • 4 位学生 (INT4): 一个非常压缩的、“颗粒感”很强的版本。

令人惊讶的是: 当这些学生在没有任何帮助的情况下学习新学科(如数学)时,“完美的学生”反而忘记旧技能(如阅读理解)的速度最快。“颗粒感”较强的学生(尤其是 4 位学生)能更好地保留旧记忆。

为什么? 研究人员认为,这些“颗粒感”较强的学生大脑中存在一点点静态噪声。这种噪声就像一个温柔的摇晃器。当学生试图学习新事物时,噪声能防止他们过度专注于新课程而抹除旧课程。这就像是在一块略微凹凸不平的画布上画新画;你不能用力过猛,否则画作会涂抹开。这种“凹凸不平”(噪声)实际上有助于他们保留旧的图像。

“完美的学生”因为没有噪声,所以过于光滑。他们可以完美地学习新课程,但在学习的过程中,他们会把旧的图像从画布上彻底擦除。

2. 闪卡实验(回放缓冲区)

团队随后在教授新课程的同时,给了这些学生不同数量的“闪卡”(回放缓冲区)来复习旧课。他们测试了需要多少闪卡才能让旧技能保持活力。

  • 结果: 即便是极小的闪卡堆(仅为旧数据的 0.1%)也会对所有人产生巨大影响。
  • 胜出者: 8 位学生 (INT8) 成了这组中的“金发姑娘”(意指恰到好处的人)。他们不需要巨大的闪卡堆,但也不会像“完美的学生”那样容易遗忘。他们找到了学习新事物与记住旧事物之间的完美平衡。
  • 4 位学生: 他们非常擅长记忆,但需要稍大一点的闪卡堆才能在处理新任务时表现出色。

3. “少即是多”原则

该论文的核心结论是:降低精度实际上可以让模型在持续学习方面变得更聪明。

  • 对于阅读理解 (NLU): 你不需要很多闪卡。即使是压缩后的模型,配合极小的闪卡堆也能表现出色。
  • 对于数学和编程: 你需要一个中等规模的闪卡堆(5–10%)。
  • 重大的反转: 如果你使用“完美的学生”(高精度),除非给他们海量的闪卡,否则他们会非常迅速地忘记旧技能。如果你使用“8 位学生”,即使只有很少的闪卡,他们也能更好地记住旧技能。

总结

把它想象成收拾行李去旅行。

  • 高精度 (FP16): 你把所有东西都整理得井井有条。但如果你增加一件新物品,你就必须重新排列整个行李箱,而且你经常会弄丢旧物品。
  • 量化后 (INT8/INT4): 你带着一点点“混乱”(噪声)来打包。这种混乱实际上起到了缓冲的作用。当你添加新物品时,这种混乱能防止旧物品被完全挤出去。

底线是:
如果你想要一个能够随着时间推移不断学习新事物而不遗忘旧事物的 AI,你并不总是需要最高性能、最高精度的计算机。有时,一个带有少量过去闪卡的、略微“压缩”(8 位)的模型,比一个拥有庞大记忆库的超精确模型效果更好。压缩模型中的“噪声”实际上是一个特性,而不是缺陷。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →