← 最新论文
💬 NLP

Smooth Scaling Laws Hide Stepwise Token Learning

本文证明了语言模型损失的平滑缩放法则实际上是由一系列局部的标记级学习事件所驱动的,这一发现不仅解释了聚合幂律行为,还通过基于标记可学习性重塑数据分布,实现了 11% 的训练效率提升。

原作者: Pingjie Wang, Zechen Hu, Peiru Yang, Fu Guo, Debing Zhang

发布于 2026-06-30
📖 1 分钟阅读☕ 轻松阅读

原作者: Pingjie Wang, Zechen Hu, Peiru Yang, Fu Guo, Debing Zhang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教一个巨大的、超级聪明的机器人说人类语言。你喂给它数以万亿计的词汇。随着机器人的规模变大以及你喂入的数据增多,它的错误(称为“损失”)呈现出一种非常可预测且平滑的曲线下降趋势。科学家们早就知道这一点,但他们并不真正理解为什么曲线会呈现出那个样子。

这篇论文认为,这种平滑的曲线实际上是一个由数百万个发生在不同时间点的微小、个体学习时刻所创造的“魔术”。

以下是使用简单类比进行的拆解:

1. 大局观:平滑的滑梯 vs. 阶梯

通常,当我们观察机器人的进步时,它看起来像是一个平滑向下的滑梯。论文指出,这是一种错觉。如果你放大观察,你会发现看到的不是平滑的滑梯,而是一个阶梯

  • 旧观点: 我们认为机器人是在一点一滴地学习,同时缓慢地在所有方面变得更好。
  • 新发现: 机器人实际上是在进行突然的跳跃式学习。它会盯着某个特定的词(或“标记/token”)看很久,没有任何进步;然后,突然间,它“开窍”了,完美地掌握了这个词。在此之后,它就能一直保持对这个词的掌握。

2. “Sigmoid”(学习跳跃)

作者发现,机器人学习的每一个词都遵循相同的模式,他们称之为“Sigmoid”。

  • 阶段 1(平台期): 机器人很困惑。它每次都猜错。
  • 阶段 2(跌落期): 突然间,机器人弄明白了。它的错误率迅速崩塌式下降。
  • 阶段 3(平台期): 机器人现在掌握了。它保持正确。

这就像学习骑自行车。你会经历长时间的摇晃和摔倒(平台期 1)。然后,某一天,你突然掌握了平衡并能平稳骑行(跌落期)。之后,你就一直保持骑行(平台期 2)。

3. 秘密武器:“学习时间谱”

那么,如果每个词都是以突然跳跃的方式学习的,为什么整体图表看起来却是一个平滑的滑梯呢?

答案是时机

  • 有些词很简单(比如“the”或“and”)。机器人在非常早期就会学会这些词。
  • 有些词很难(比如复杂的数学术型或罕见的成语)。机器人会在很晚的时候才学会这些词。
  • 大多数词都处于中间位置。

论文将此称为**“学习时间谱”**。这就像一群人进入房间。如果所有人都在同一秒钟进入,房间会瞬间填满。但如果人们一个接一个地在很长一段时间内陆续进入,房间就会平滑地填满。

我们在 AI 研究中看到的平滑“缩放法则(scaling law)”曲线,并不是因为机器人在平滑地学习;而是因为不同的词在不同的时间学习。这种“平滑性”只是数百万个连续发生的、个体的“开窍时刻”的平均值。

4. 三个轴:时间、数据和规模

作者通过三种不同的方式测试了这个想法,并且在所有情况下都奏效了:

  1. 训练步数(时间): 随着训练时间的增加,机器人会学习更难的词。
  2. 数据规模: 当你给机器人读更多的书时,它会遇到以前从未见过的更难的词。
  3. 模型规模: 当你把机器人的大脑做大时,它就具备了理解更难概念的能力。

在这三种情况下,平滑的进步都只是机器人按照特定的顺序(从易到难)处理词汇的结果。

5. 超能力:重写进度表

这是最令人兴奋的部分。因为作者弄清楚了机器人何时学习特定的词,他们利用这一知识来加速进程

  • 实验: 他们观察了一个特定的训练阶段(例如,第 2,000 到 3,800 步)。他们识别出了在那个特定窗口期内“准备好被学习”的词。
  • 调整: 他们改变了机器人的“饮食”。他们不再喂它随机的词,而是喂它更多那些在此时此刻“准备好被学习”的词,以及更少那些太难或太容易的词。
  • 结果: 机器人学得更快了。与正常进度相比,它多减少了 11% 的错误。

总结

论文声称,AI 缩放法则中的“魔力”并非某种神秘的数学规则。它仅仅反映了 AI 在何时学习不同的事物。

  • 问题: 我们曾认为 AI 是平滑学习的。
  • 真相: 它是以突然爆发的方式学习,但不同的词在不同的时间爆发。
  • 益处: 如果我们知道一个词什么时候准备好被学习,我们就可以在正确的时间喂给 AI 正确的词,从而让它学得更快。

这就像意识到一个学生并不是通过缓慢学习所有内容来掌握数学的;而是通过掌握一个概念,再下一个,再下一个。如果你知道他们今天正好准备好学习哪个概念,你就能更高效地教导他们。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →