← 最新论文
🤖 machine learning

How to Allocate Your Tokens? Scaling Laws with Training Steps and Batch Size

本文提出了一种“三项”缩放法则,该法则将训练数据显式地分解为步数和批大小,从而能够稳健地恢复最优批大小的缩放,并利用显著减少的训练次数推导出次优设置下的法则。

原作者: Fabian Schaipp

发布于 2026-07-03
📖 1 分钟阅读☕ 轻松阅读

原作者: Fabian Schaipp

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图烘焙出完美的面包(在本文中,这代表一个强大的人工智能模型)。为了获得最好的结果,你需要平衡三个主要原料:

  1. 烤箱的大小(模型规模): 你的机器有多大、多复杂。
  2. 面团的数量(训练数据): 你喂给它的信息量有多少。
  3. 烘焙策略(步数 vs. 批次大小): 这是最棘手的部分。你可以选择一次烤很多个小批量的面团(多次步数,小批次),或者一次烤几个大批量的面团(较少步数,大批次)。

长期以来,科学家们都有一个平衡“烤箱”与“面团”的优秀配方。他们准确地知道该使用多少比例的两者来获得最好的面包。但对于烘焙策略,他们的描述却很模糊。他们只会说:“使用一个合适的批次大小,”而没有解释批次大小的变化究竟如何影响结果,也没有说明如何在不测试成千上万个面包的情况下找到那个完美的大小。

这篇论文提出了一种更详细的新配方,称为**“三项定律”(Three-Term Law)**。

新配方:计算步数

作者建议,我们不应仅仅关注面团的总量,而应该观察这些面团是如何被拆分为**步数(Steps)批次大小(Batch Size)**的。

可以这样理解:

  • 旧方法: “我有 100 公斤面粉。我要做一个大模型。”
  • 新方法: “我有 100 公斤面粉。我可以做 100 次每次 1 公斤的小批次,也可以做 10 次每次 10 公斤的大批次。哪种混合方式能做出最好的面包?”

这个新公式(三项定律)将批次大小步数视为两个独立的成分,它们都会影响最终的味道(模型的性能)。

为什么这意义重大?

1. 它节省了大量时间(“采样”技巧)
通常,为了找到完美的批次大小,你必须烘焙出一系列不同规格的面包:一个极小批次的,一个中等批次的,一个巨大的,等等。这极其昂贵且缓慢(就像需要数百万个 GPU 小时)。

作者发现,他们的新公式非常聪明,只需观察两到三个不同的批次大小,就能准确预测出那个完美的大小。

  • 类比: 想象你想找到烤箱的最佳温度。与其测试 100 种不同的温度,你只需测试三种。因为你理解热力学的物理原理(这个公式),你可以通过数学计算得出精确的最佳温度,而无需去拨动其他 97 个档位。
  • 结果: 这将训练运行所需的次数减少了约 72%。你只需投入一小部分工作,就能得到同样的答案。

2. 它能处理“不完美”的批次
在现实世界中,你可能并不具备使用完美批次大小的硬件条件。也许你的烤箱太小了,或者你只有时间进行中等规模的烘焙。
旧的配方只告诉你使用完美设置时的结果。而这个新配方则会告诉你,如果你被迫使用一个次优(不完美)的批次大小,会发生什么。它可以准确预测如果被迫使用较小的批次,你的面包味道会变差多少,从而帮助你在有限的条件下做出最佳决策。

3. 它解开了一个关于“临界批次大小”的谜团
科学家们注意到一种现象,叫做“临界批次大小(Critical Batch Size)”。它就像是一个速度限制。如果你把批次做得太大,你并不会获得更快的进度,反而是在浪费能源。

  • 旧理论: 一些旧理论认为,最佳批次大小应该是极小的(大小为 1),但这与我们在现实生活中看到的相矛盾。
  • 本论文的发现: 新公式正确地展示了这种“速度限制”(临界批次大小)取决于你有多少数据,但令人惊讶的是,它并不会随着模型大小的变化而发生太大改变。这与我们在实际实验中观察到的情况相吻合。

局限性(不足之处)

作者坦诚地说明了他们的配方目前还不完美的地方:

  • 边缘效应较粗糙: 虽然它能很好地预测最佳批次大小,但在预测使用过小或过大批次时的确切“味道”方面并不完美。
  • 需要一点辅助: 为了获得关于“不完美”批次的更精确细节,他们必须使用一个两阶段的过程(“两阶段拟合”),这比直接代入一个方程要复杂一些。
  • 针对特定工具: 其结果是基于特定的 AI 训练类型(使用一种名为 AdamW 的优化器)。如果你更换了工具(例如使用不同的优化器),这个配方可能需要进行调整。

总结

这篇论文为我们提供了一张在复杂的 AI 训练世界中航行的更好地图。它告诉我们,如何拆分数据(步数 vs. 批次大小)与你拥有多少数据同样重要。最重要的是,它给了我们一个捷径:我们不再需要测试每一种可能性来寻找最佳策略。我们可以测试其中几个,利用这个新数学公式,然后自信地预测出获胜者,从而节省大量的计算时间和算力。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →