GaugeQuant: Online Learning of Quantization-Optimal Bases from LLM Symmetries
GaugeQuant 是一种在线学习方法,它利用大语言模型(LLM)的对称性以及一个 LogSumExp 损失项,在训练过程中动态学习量化最优基底,从而在无需校准数据或改变语言建模目标的情况下,显著降低低比特量化下的困惑度。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图将一座宏大而复杂的知识图书馆塞进一个极小的背包里。这就是现代人工智能每天都在面临的挣扎。这些人工智能系统的“大脑”(被称为大语言模型)规模巨大,运行它们需要堆积如山的计算机内存。为了让它们能够装进更小的设备中,科学家们使用了一种叫做**量化(quantization)**的技巧。你可以把它想象成将一部高清电影压缩成低分辨率文件以节省空间。你会损失一些细节,但电影仍然可以观看。然而,这里有一个陷阱:有时这部电影会有一些极其明亮或黑暗的场景(被称为“离群值”或“异常值”)。当你试图压缩整个文件以适应这些极端场景时,电影的其他部分会变得模糊且扭曲。
长期以来,科学家们一直试图在人工智能已经构建完成后再来修复这个问题,就像是在电影拍摄完成后才尝试去编辑它一样。他们会观察那些“亮点”,并尝试使用一小部分数据来平滑它们。但本文介绍了一个新想法:如果我们能在人工智能构建的过程中,就教它如何组织自己的图书馆,从而让它自然地契合进背包,而不需要事后进行混乱的清理,那会怎样呢?研究人员提出了一种方法,利用人工智能自身的内部“灵活性”,在数据被压缩之前对其进行重新排列,使压缩过程更加干净利落地完成。
论文:GaugeQuant
你正在阅读的这篇论文是关于一种名为 GaugeQuant 的巧妙新技术的。作者 Miguel P. Bento 和 João F. Seabra 发现,这些人工智能模型的内部结构拥有一个隐藏的超能力:对称性。
为了理解这一点,请想象人工智能的大脑是由数千个旋转的齿轮组成的。在许多地方,这些齿轮可以完美地同步旋转,而不会改变人工智能给出的最终答案。这就像你有一支舞者团队;如果他们一起旋转 90 度,从观众的角度来看,编舞的效果是一样的。人工智能并不关心数据来自哪个具体的“角度”,只要齿轮之间的关系保持不变即可。
问题在于,当我们尝试压缩人工智能(量化它)时,我们必须选择一个特定的角度。如果我们选错了角度,那些“离群值”(超亮或超暗的数据点)就会被拉伸,从而毁掉压缩效果。通常情况下,科学家们必须在人工智能训练完成后,才能通过使用一个单独的数据集来测试并确定最佳角度。
GaugeQuant 通过在训练过程中实现这一点,改变了游戏规则。作者在人工智能的“家庭作业”中加入了一个特殊的“惩罚项”。想象一下,人工智能正在学习写故事,而老师(计算机)说:“好故事!但如果你使用了任何过于极端或古怪的词汇,你就会被扣分。”这个惩罚是基于一个叫做 LogSumExp 的数学公式。它温柔地引导人工智能重新排列其内部齿轮(旋转其数据),使得没有任何一个数字成为极端的离群值。
神奇之处在于:人工智能必须在不影响其写故事能力的前提下完成这种重新排列。作者使用了一个“停止梯度(stop-gradient)”技巧。你可以把它想象成一面单向透视镜。人工智能使用其正常的课程来学习如何写出更好的故事,但它使用另一套隐形的、独立的课程来学习如何为压缩而组织数据。两者互不干扰。人工智能会自动找到数据的“完美角度”,因此当它最终被压缩时,一切都能严丝合缝地装入,而不会损失质量。
他们的发现
研究人员在两个著名的 AI 模型上测试了该方法:Qwen-2.5 0.5B 和 LLaMA-2 7B。他们模拟了将这些模型压缩到极低精度(仅使用 4 位权重和激活值,这是一个非常紧凑的挤压)的情况。
结果非常令人振奋:
- 对于 LLaMA-2 7B 模型,当他们将权重和激活值都压缩到 4 位(W4A4,组大小为 128)时,“困惑度”(一个数值越低代表 AI 越不困惑的评分指标)从 8.22 降至 6.73。
- 当他们仅将权重压缩到 4 位,而保持激活值为全精度(W4A16)时,得分改善得更为显著,从 11.16 降至 5.45。
- 对于较小的 Qwen-2.5 0.5B 模型,改进也十分显著,W4A4 的得分从 187.8 降至 61.2。
作者指出,该方法无需特殊的校准数据(不需要单独的测试集),并且几乎不会增加额外的训练时间。它能与那些通常需要在训练后对模型进行冻结和广泛测试的方法相媲美。
它无法解决的问题(以及仍未知的领域)
了解该方法无法解决什么问题也很重要。作者发现,如果你尝试仅使用单个标度覆盖整个 Token(一种非常严格的设置,称为“逐 Token/per-token”)将激活值压缩到 4 位,模型仍然会失效并变得无法使用,无论进行何种旋转。该方法在允许一定的分组(例如组大小为 128)时效果最好。
此外,作者承认,他们的方法依赖于一个“代理(proxy)”来代表实际的压缩误差。他们使用 LogSumExp 公式来猜测哪里存在离群值,但这并不是对真实世界压缩的完美模拟。他们认为,这有时可能会平滑掉模型实际上需要用来区分相似事物的数据。
最后,这些结果是基于对两个特定模型(0.5B 和 7B)的模拟和训练运行得出的。作者建议,虽然数学逻辑看起来很稳健,但我们尚不知道它在更大规模的模型或不同的现实场景中会表现如何。他们提议,这是一个可以在训练期间使用的工具,随后可以与其他“训练后”的修复手段结合使用,以获得更好的效果,但他们尚未证明它适用于每一种可能的人工智能架构。
简而言之,GaugeQuant 表明,通过教人工智能在学习的同时整理自己的数据,我们可以将它装进一个更小的背包,而不会洒出其中的内容。这是一种处理压缩庞大 AI 大脑这一复杂现实的有趣且高效的方式。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。