← 最新论文
🤖 machine learning

On the Nonlinearity of Learning Rate Scaling for LLM Training

本文通过证明最优学习率在大规模情形下呈现出向上弯曲的特性,挑战了大型语言模型训练中对对数线性学习率缩放的假设,而这种非线性特征可以通过使用有效学习率和基于数据的外推法来解决,从而实现更准确且更具成本效益的迁移学习。

原作者: Zaiwen Yang, Huaqing Zhang, Jing Xu, Jingzhao Zhang

发布于 2026-06-30
📖 1 分钟阅读☕ 轻松阅读

原作者: Zaiwen Yang, Huaqing Zhang, Jing Xu, Jingzhao Zhang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在试图教一个巨型机器人写诗。为了做到这一点,你需要找到完美的“教学速度”(被称为学习率)。如果你教得太快,机器人会感到困惑;教得太慢,它则永远学不会。

通常情况下,为这样一个庞大的机器人寻找完美的最佳速度是非常昂贵且耗时的。因此,科学家们尝试使用一种捷径:先教一个微型机器人,弄清楚它的最佳速度,然后推测这个速度对于巨型机器人应该是多少。他们假设这种关系是简单的、笔直的,就像一把尺子:“如果机器人大了一倍,我们只需按固定比例调整速度即可。”

这篇由清华大学研究人员撰写的论文指出:“那把尺子其实是弯曲的。”

以下是他们利用简单的类比对这一发现进行的拆解:

1. 弯曲的尺子(问题所在)

研究人员通过训练不同规模的机器人(AI 模型,从小型到超大型)来测试这种“捷径”。他们发现,当你试图根据小型模型来预测巨型模型的最佳速度时,你的直线预测会失效。

  • 类比: 想象你在开车。你知道如果行驶 10 英里,你会消耗 1 加仑汽油。你可能会猜行驶 100 英里会消耗 10 加仑。但如果汽车变得越来越大、越来越重,引擎的效率会下降呢?你实际上可能需要超过 10 加仑。
  • 发现: “学习率”并不遵循直线。当模型变得巨大时,最佳速度会向上弯曲。如果你使用旧的直线预测,你选出的速度会太慢,导致巨型机器人的学习效果很差。

2. 神秘指南针:“有效学习率”

研究人员意识到,问题不在于速度本身,而在于我们如何衡量它。他们引入了一个新概念,叫做有效学习率(Effective Learning Rate)

  • 类比: 把“学习率”想象成汽车仪表盘上的时速表。但“有效学习率”则是你的车实际向前移动的距离。
    • 有时,即使你踩下油门(设置高学习率),但如果车很重或者轮子在打滑(由于 AI 内部权重变化的原因),车实际移动的距离并不会像时速表显示的那样远。
    • 研究人员发现,如果你测量的是实际移动的距离(有效速率)而不是仅仅看时速表的读数,那么这种关系就会重新变成一条完美的直线。这就像是从一个损坏的时速表切换到了一个能精确告诉你行驶了多远的 GPS。

3. 最好的捷径:看数据,而非规模

论文还测试了两种预测方法:

  1. 模型规模缩放(Model-Size Scaling): 根据机器人的大小来猜测速度。
  2. 数据缩放(Data-Scaling): 根据机器人需要阅读的“文本”(数据)量来猜测速度。
  • 发现: “数据缩放”方法要好得多。
  • 类比: 想象你在教一名学生。
    • 方法 A(规模): 你根据学生的身高来猜测该教多快。(这是不可靠的;高个子学生可能学得和矮个子一样快)。
    • 方法 B(数据): 你根据他们要阅读的教科书页数来猜测该教多快。(这要准确得多)。
    • 论文表明,基于数据量进行预测比基于模型大小进行预测要可靠得多。

4. 为什么会出现曲线?(“沉降”阶段)

作者解释了直线为什么会弯曲。他们发现,当你使用非常慢的学习率时,机器人的内部“肌肉”(权重范数/weight norms)需要很长时间才能放松并进入舒适的位置。

  • 类比: 想象一扇带有弹簧的重门。
    • 如果你用力推(快速学习率),它会迅速打开并稳定下来。
    • 如果你推得很轻(慢速学习率),它甚至要花很长时间才能开始移动。它会陷入一个“瞬态”阶段,即虽然在晃动,但并没有真正向前移动。
    • 为了让门在轻推时有效移动,你实际上需要比简单数学计算出的力量更大,才能克服最初的这种晃动。这种“额外的推力”就是为什么曲线会针对大模型向上弯曲的原因。

核心结论

论文得出结论,为了在训练大规模 AI 时节省成本和时间:

  1. 不要信任旧有的“直线”数学模型来预测学习率;它低估了大模型所需的学习速度。
  2. 将重心转向有效学习率(关注实际移动,而非仅仅是设置值)。
  3. 基于模型看到的数据量来预测速度,而不仅仅是看模型的大小。

通过这样做,你可以更准确地预测完美的训练速度,从而节省大量的计算资源。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →