← 最新论文
🤖 machine learning

Neural Scaling Universality: If Exponents Are Fixed, Time to Understand Coefficients

本立场论文认为,尽管神经缩放法则的指数是由 Softmax 非线性等通用机制所决定的,但决定实际性能和最优模型配置的系数对特定的数据和架构细节具有敏感性,这使得对其理解成为近期 AI 改进的关键。

原作者: Yizhou Liu, Jeff Gore

发布于 2026-06-25
📖 1 分钟阅读☕ 轻松阅读

原作者: Yizhou Liu, Jeff Gore

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这是一篇使用简单语言和日常类比对该论文进行的解释。

核心思想:“配方”与“原料”

想象你正在尝试烘焙出完美的面包(大语言模型)。长期以来,科学家们注意到一个规律:如果你将面粉、水或烤箱时间增加一倍,面包的质量会以一种可预测的方式提升。这被称为“缩放法则”(Scaling Law)。

本文认为,**面包如何变好(配方背后的数学逻辑)**实际上是固定且不可改变的,就像物理定律一样。然而,原料的质量(数据和具体的各种设计选择)决定了面包最终的味道有多好,即便规则保持不变。

作者将此称为**“神经缩放普适性”(Neural Scaling Universality)**。这意味着无论你如何调整模型,它学习的“速度”都遵循三个固定的规则。唯一改变的是过程的“起点”或“效率”。


三个固定规则(指数)

论文指出,随着模型的训练,它产生的误差(错误)会遵循三种特定的模式下降。可以将这些视为三种不同的学习“限速”:

1. “Softmax” 限速(时间)

  • 类比: 想象你在草堆里找一根针,但这个草堆是由磁铁组成的,离针越近,磁力就越强。起初你移动得很慢,但随着你越来越接近那根针,磁铁会把你拉得越来越快。
  • 科学原理: 论文指出,由于使用了名为“Softmax”的特定数学函数(用于进行预测),模型的学习方式是特定的。误差下降的速率与时间(具体为时间的立方根)呈固定关系。这是因为当模型变得自信时,其数学特性会变得非常“非线性”(弯曲度很高)。
  • 要点: 你无法改变这个限速。它是内置在模型思考方式的数学逻辑中的。

2. “拥挤房间”限速(宽度)

  • 类比: 想象一个狭小的房间(模型的记忆),你试图把一百万种不同的人(概念/词汇)塞进去。如果房间太小,人们就不得不互相重叠或共享空间。这会导致“几何干扰”——人们互相碰撞,导致很难听清声音。
  • 科学原理: 这被称为“叠加”(Superposition)。模型试图在更少的维度中压缩更多的特征。随着你把房间变宽(增加模型的宽度),误差也会下降,但这种提升遵循严格的规则:宽度翻倍,误差减半。
  • 要点: 这个限制在于你能将多少信息挤进模型的“大脑”而不使其变得混乱。

3. “团队协作”限速(深度)

  • 类比: 想象一场接力赛,有很多名选手(模型中的层)。如果每个选手都犯了一点点小错,只要团队能抵消掉这些误差,依然可以获胜。但如果所有的选手都在做完全相同的事情,他们就无法互相帮助。
  • 科学原理: 论文表明,Transformer 层的作用类似于团队通过平均化来修正错误。随着你增加更多的层,团队纠正错误的能力就会增强,但同样遵循固定规则:层数翻倍,误差减半。
  • 要点: 增加层数确实有帮助,但这种收益遵循一种可预测的、固定的模式。

真正的问题:系数(“原料”)

如果规则(指数)是固定的,为什么有些模型表现得更好呢?答案在于系数(Coefficients)

  • 类比: 把固定规则看作烘焙的物理定律。你无法改变热量能让面团熟透这一事实。但系数则是你的面粉质量、烤箱温度以及烘焙师的技术水平。
  • 论文观点: “系数”是数学中的那些数字,它们告诉你还剩下多少误差。这些数字完全取决于:
    • 数据: 文本的多样性和质量。
    • 架构: 特定的设计选择(例如模型如何处理注意力机制或归一化)。
  • 为什么重要: 由于“限速”(指数)是固定的,目前提升模型性能的唯一方法就是改进这些系数。如果你可以通过调整设计或数据来降低系数,你就能在不破坏物理定律的前提下,获得更好的模型。

实践结果:寻找“黄金分割点”

论文利用这些规则来确定模型的完美形状。

  1. 形状: 模型的宽度相对于深度应该是多少?

    • 论文计算出存在一个“金发姑娘原则”(Goldilocks ratio,意指恰到好处的比例)。如果你有固定的计算量预算,你不应该只在一个方向上把模型做大。你需要一个特定的平衡(根据他们在 Chinchilla 模型上的数据,宽度大约应该是深度的 64 倍)。
    • 好消息: 论文指出这里的“地形”是平坦的。这意味着你不需要做到完美。只要接近正确的比例,效果就几乎和达到精确比例时一样好。
  2. 数据 vs. 步数:

    • 许多人担心我们正在“耗尽数据”。本文认为,预训练实际上是受步数限制(step-limited),而非受数据限制。
    • 类比: 这不是因为你读完的书不够了,而是因为你在读完句子之前就停止阅读了。通过利用现有数据进行更多的“步数”(优化步数),你可以获得更好的结果,而不仅仅是囤积更多独特的数据。
  3. 计算前沿:

    • 论文证实,如果你完美地平衡了模型规模和数据规模,误差会以总计算量六分之一的速度下降。这就是“计算最优前沿”(compute-optimal frontier)。

总结

  • 规则是固定的: AI 模型的学习方式遵循三个不可改变的数学模式(时间、宽度、深度),这是由数学本质(Softmax)和层间协作方式决定的。
  • 变量是灵活的: 学习的质量(系数)取决于你的数据和设计选择。
  • 目标: 为了构建更好的 AI,我们不应仅仅寻找新的“物理定律”。相反,我们应该专注于调整我们的“原料”(数据和架构),以降低误差系数,找到模型规模与数据之间的完美平衡,从而获得最大的效益。

论文得出结论,我们目前处于一个特定的“普适类”(universality class,即一套特定的规则)中。为了在未来获得更好的 AI,我们可能需要找到打破这些现有规则的方法;但就目前而言,掌握“系数”是实现即时提升的关键。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →