← 最新论文
📊 statistics

Universal One-third Time Scaling in Learning Peaked Distributions

本文证明了在大语言模型训练中观察到的计算昂贵且缓慢的幂律收敛,是使用 softmax 和交叉熵来学习尖峰分布的内在结果,这普遍导致了 1/3 的损失时间缩放指数。

原作者: Yizhou Liu, Ziming Liu, Cengiz Pehlevan, Jeff Gore

发布于 2026-08-11
📖 1 分钟阅读☕ 轻松阅读

原作者: Yizhou Liu, Ziming Liu, Cengiz Pehlevan, Jeff Gore

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教一个超级聪明的机器人如何接你的话茬。你给了它数百万本书,它开始学习人类语言的模式。但问题在于:随着机器人的规模变大、你喂给它的数据变多,它并不会瞬间变得完美。相反,它的进步遵循一种非常特定的、缓慢的方式。这就像是在观察一辆汽车爬坡,坡度越陡,车速就越慢,遵循着一条可预测的曲线。科学家们称之为“神经缩放”(neural scaling),长期以来,他们认为这种缓慢的曲线是因为数据本身很杂乱或复杂,就像一个有些书很稀有、有些书随处可见的图书馆。他们曾假设机器人只是在努力寻找那些稀有的书。但如果机器人并不是因为图书馆的问题而挣扎,而是因为它的“思考方式”呢?这篇论文深入探讨了这个谜团,研究了机器人大脑内部数学上的“齿轮”,以观察为什么学习速度会放慢,以及我们是否可以精确预测它会慢到什么程度。

该研究的作者 Yizhou Liu、Ziming Liu、Cengiz Pehlevan 和 Jeff Gore 决定不再去猜测那个杂乱的图书馆,而是转而观察机器人的内部引擎。他们构建了一个微小的、简化的语言模型版本——一个“玩具模型”——来观察当它尝试学习一种非常特定的模式时会发生什么:一种“尖峰”分布(peaked distribution)。想象一下天气预报说有 99% 的概率下雨,1% 的概率出太阳。这就是一个尖峰分布;答案几乎是确定的,但模型必须非常精确才能掌握它。

当他们训练这个玩具模型去预测这些尖锐、确定的结果时,他们发现了一些令人惊讶的事情。那种缓慢的、幂律(power-law)的学习曲线并不是因为数据很难,而是因为模型使用了两种特定的工具:softmax交叉熵(cross-entropy)。你可以把 softmax 理解为一个“投票机”,它将原始数字转化为概率(确保总和为 100%);而把 交叉熵 理解为一个“计分卡”,它告诉模型错得有多离谱。论文表明,当你结合这两个工具去学习一个非常尖锐、确定的答案时,数学逻辑会迫使学习速度以一种非常特定的方式减慢。无论你如何调整数据或模型的大小,损失值(误差)下降的速率都遵循一个普遍规则:它随时间按 1/3 的幂次进行缩放。

用一个有趣的类比来说:想象你正在尝试让一支铅笔在笔尖上保持平衡。起初,做微小的调整很容易。但随着铅笔越来越接近完美的直立状态(即“尖峰”状态),哪怕是最微小的晃动也会变得越来越重要。论文表明,模型计算错误的方式会让它感觉就像是在向着完美答案前进的过程中,正走在厚厚的蜂蜜里。这种“蜂蜜”并不是数据,而是投票机和计分卡的数学机制。作者发现,在这种“蜂蜜”中,误差并不会迅速下降;它以一种稳定、可预测的节奏下降,即如果你将训练时间增加一倍,误差只会下降一个特定的比例,而不是减少一半。这个比例恰好是时间的立方根,即 1/3

研究人员并没有止步于他们的微型玩具模型。他们想知道这种“蜂蜜效应”在当今我们使用的巨型真实世界语言模型(如 Pythia 和 Olmo 模型)中是否真实存在。他们观察了这些大规模模型的训练数据,发现这些模型确实运行在“低温度”(非常尖锐、确定)的机制下。当他们将这些巨型模型的误差率对阵其训练时间进行绘图时,数据与他们的预测完美吻合。误差是以 1/3 的幂律指数下降的。这表明,我们在大型 AI 中看到的缓慢学习并不是一个漏洞,也不是杂乱数据的迹象,而是这些模型构建方式的一个基本特征。

论文还探讨了如果你尝试加速会发生什么。他们发现,如果你把学习率(即模型迈出的步子大小)设得太大,模型就会感到困惑,无法沿着路径穿过“蜂蜜”。但如果你保持步伐小而稳,模型就会完美地遵循 1/3 规则。有趣的是,他们还发现,即使模型在开始时与“老师”并不完全一致,它最终也会进入这种节奏。唯独当数据非常“平坦”或具有不确定性时(比如天气预报显示 50% 下雨、50% 出太阳),这个规则才会失效,在那时学习是快速的指数级增长,而非缓慢的幂律增长。

那么,这对未来意味着什么?作者建议,如果我们想要更快地训练 AI,我们可能需要重新思考我们使用的“投票机”和“计分卡”。也许我们需要新的工具,使其在答案非常确定时不会陷入“蜂蜜”之中。他们还指出,这项发现解释了为什么之前的实验观察到了 1/3 的指数(或接近 1/3,如 0.28 或 0.30)却没能意识到原因。这并非巧合,而是模型本身的数学特性。

简而言之,这篇论文揭示了大型语言模型的缓慢、稳定的进步是其设计中的一个内置特征,而非数据的缺陷。这就像是 AI 学习的一条物理定律:当你试图使用这些特定的工具去学习一个非常确定的答案时,你注定会以 1/3 的速度前进。作者谨慎地表示,这是基于他们的模拟和对现有模型的分析,这为提高 AI 训练效率指明了新方向,但他们并未声称已经彻底解决了训练速度的问题。相反,他们为我们提供了一张地图,清晰地展示了路障在哪里以及它们为何存在。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →