← 最新论文
💬 NLP

Superposition Yields Robust Neural Scaling

本文提出,表示叠加(即模型编码的特征数量超过其维度限制)是神经缩放定律的基本驱动力,导致在当前大语言模型所观察到的强叠加机制下,损失与模型规模呈反比关系进行缩放。

原作者: Yizhou Liu, Ziming Liu, Jeff Gore

发布于 2026-08-11
📖 1 分钟阅读☕ 轻松阅读

原作者: Yizhou Liu, Ziming Liu, Jeff Gore

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图将一座宏大的图书馆装进一个极小的背包里。这正是人工智能(特别是那些能够编写代码、回答问题并与我们聊天的巨型“大语言模型” [LLMs])每天面临的挑战。这些模型通过将文字转化为数字(向量),并将它们存储在一个特定大小的隐藏“背包”中来运作。长期以来,科学家们注意到一个奇特的模式:如果你把背包做大,AI就会变得更聪明,其错误率也会以一种非常可预测的方式下降。这就像一条神奇的规则:每当大脑容量翻倍,错误就会减少特定程度。但一直以来,没人真正知道为什么这条“神奇规则”会存在。是因为更大的包能装下更多的书吗?还是因为在包内部发生了一种巧妙的技巧,使得书籍的存放方式比物理定律所允许的还要高效?这个问题处于现代计算机科学的核心,试图理解机器是如何学会思考的。

麻省理工学院(MIT)的一个研究小组决定通过构建一个简单的“玩具模型”(一种精简的、微缩版的AI模型)来调查这个谜团,看看当你试图把过多的特征塞进过小的空间时会发生什么。他们发现,秘诀不仅仅在于拥有一个更大的包,更在于AI如何将信息挤压在一起。他们称之为“叠加”(superposition)。想象一下,尝试将100个不同颜色的弹珠放入一个只能容纳10个的盒子里。在“弱”设置下,你会直接扔掉多余的90个弹珠,只保留最重要的10个。但在“强”设置下,AI学会了将弹珠叠放在一起,让它们稍微重叠,从而使它们都能放得下。研究人员发现,当AI使用这种“堆叠”技巧(叠加)时,随着规模增长而变得更聪明的神奇规则变得异常稳健且可靠,无论它学习的是什么样的资料。

这篇题为《叠加产生鲁棒的神经缩放》(Superposition Yields Robust Neural Scaling)的论文指出,这种“重叠技巧”是为什么更大的AI模型表现得更好的主要原因。该团队利用他们的玩具模型测试了两种不同的场景。首先,他们观察了一个“弱叠加”机制,在这种机制下,由于空间过于拥挤,AI被迫忽略大部分数据。在这种情况下,他们发现只有当数据本身已经具备某种特定的、罕见的模式(例如英语中常见词汇遵循的特定频率)时,AI才会以一种可预测的幂律方式变得更聪明。如果数据是杂乱或随机的,这条神奇规则就会失效。

然而,当他们调高“叠加”旋钮时,故事发生了戏剧性的变化。通过调整训练中的一个设置(使用一种称为“权重衰减”的技术),他们鼓励AI去表示所有的特征,即使这意味着它们必须稍微重叠。在这种“强叠加”机制下,AI变得极其高效。研究人员观察到,由于这些重叠向量如何几何性地组合在一起,误差率以一种稳定、可预测的幂律形式下降。这就像一个拼图游戏,其中的碎片被稍微挤压变形了;随着你增加拼图板的空间,碎片会完美地契合进去,而“缝隙”(误差)会以大约 1 除以模型宽度(1/width)的速度缩小。

为了证明这不仅仅是他们玩具模型的特例,该团队研究了现实世界的开源大语言模型(如 OPT、GPT-2、Qwen 和 Pythia)。他们测量了“语言模型头”(即AI决定下一个词是什么的部分),发现这些真实的模型确实运行在“强叠加”模式下。代表不同词汇的向量以一种与他们的玩具模型预测完全吻合的方式相互重叠。数据显示,对于这些真实模型,误差率与模型的宽度成反比,其指数非常接近 1。这与著名的“Chinchilla缩放法则”相一致,该法则表明模型大小和数据量需要以特定的方式平衡,才能达到最优性能。

该论文明确排除了这样一种观点,即神奇的缩放法则仅仅是因为AI学会了更多互不干扰的独立特征。他们展示了如果AI不使用叠加(即“弱”机制),那么缩放法则将是非常脆弱的,完全取决于数据的特定分布。相反,他们认为,我们今天看到的这种强大且通用的缩放现象,是由于AI能够通过允许特征在几何上重叠,从而表示比其维度更多的特征。虽然他们并未声称已经解开了AI的所有谜团,但他们的模拟和测量强烈表明,这种几何上的“堆叠”是为什么更大的模型效果如此出色的核心驱动力。他们甚至暗示,如果我们能在未来的训练中更刻意地鼓励这种叠加,我们或许能让较小的模型表现得像大型模型一样,尽管他们也提醒说,这可能会让AI变得更难解释。最终,这篇论文描绘了一幅画面:AI不仅仅是一个装载数据的更大的桶,而是一个聪明的魔术师,它通过让球体在视觉上略微模糊以实现完美契合,从而学会了用比手掌更多的球进行杂耍。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →