← 最新论文
🔬 condensed matter

Theory of Optimal Learning Rate Schedules and Scaling Laws for a Random Feature Model

本文利用最优控制理论从理论上推导并验证了随机特征模型的最优学习率调度策略,识别出决定多项式衰减或预热 - 稳定 - 衰减策略是否优于标准基准的截然不同的“易”与“难”训练阶段。

原作者: Blake Bordelon, Francesco Mori

发布于 2026-05-11
📖 1 分钟阅读☕ 轻松阅读

原作者: Blake Bordelon, Francesco Mori

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在训练一名学生解决一个复杂的谜题。你拥有有限的时间(“训练周期”)和有限的练习题供应(“数据预算”)。你手中最关键的工具有一个:学习率(LR)。将学习率想象成学生在学习过程中迈出的步幅大小

  • 大步幅: 学生学得很快,但可能会 overshoot(冲过头)解决方案,或被噪声搞糊涂。
  • 小步幅: 学生谨慎且精确,但可能需要花费永恒的时间才能完成。

多年来,研究人员一直靠猜测来确定随时间改变这些步幅大小的最佳方式(即“调度策略”),通常是通过试错法。本文利用数学方法,为特定类型的学习模型找到了完美且科学最优的调度策略

以下是他们研究发现的拆解,使用了简单的类比:

1. 两种类型的谜题:“简单”与“困难”

作者发现,并非所有学习任务都是一样的。根据数据的性质,任务属于以下两类之一:

  • 简单阶段(一帆风顺):

    • 类比: 想象沿着平缓、光滑的山坡向下走。你可以清晰地看到山底。
    • 策略: 最佳策略是随着你越接近终点,采取逐渐变小的步幅。你以中等速度开始,然后慢慢减速至爬行,以确保你不会错过确切的位置。
    • 现实世界示例: 论文发现,GPT 风格的语言模型(如那些撰写文本的模型)就表现出这种行为。随着训练时间的延长,最优的起始步幅需要变得越来越小。
  • 困难阶段(崎岖的山脉):

    • 类比: 想象站在崎岖不平的悬崖上,试图在干草堆里找一根针。如果你迈小步,你会卡在岩石里;如果你迈巨大的步子,你会从悬崖上摔下去。
    • 策略: 这里的最佳策略是预热 - 稳定 - 衰减(WSD)
      1. 预热/稳定: 立即采取最大安全步幅,并在几乎整个旅程中保持恒定。你需要强力穿过噪声和崎岖的地形。
      2. 衰减: 只有在时间的最后极小部分,你才突然减速至爬行,以微调你的位置。
    • 现实世界示例: 图像分类模型(如在照片中识别猫与狗)就表现出这种行为。最佳策略是在训练的大部分时间里保持高且稳定的学习率,然后在最后时刻将其降低。

2. 为什么“一刀切”会失败

一个常见的错误是认为,如果某个步幅大小适用于短期训练,那么只需将其按比例缩小,它就同样适用于长期训练。

  • 论文的发现: 这是错误的。论文表明,“完美”的步幅大小完全取决于你计划训练的时间长度
  • 类比: 如果你要驾驶 10 英里,你可能会全程以 60 英里/小时的速度行驶。如果你要驾驶 1000 英里,你可能需要在前 900 英里以 80 英里/小时的速度行驶,然后减速。你不能对这两次行程使用相同的速度曲线;“调度策略”必须根据总距离进行调整。

3. 优化“班级规模”(批量大小)

论文还考察了批量大小(batch size),这就像学生一次学习的班级规模

  • 发现: 在“简单阶段”,你可以通过开始时使用小班,并随着接近终点逐渐增加班级规模,来加速整个过程(挂钟时间)。
  • 类比: 想象一位老师。在开始时,他们教授一个小群体,以确保每个人都理解基础知识。随着学生们变得更加自信,老师引入更多学生以快速覆盖更多内容。这种“批量爬坡”节省了时间,而没有牺牲最终成绩。

4. “动量”助推

论文还测试了添加动量(一种让学生携带部分先前速度向前的技术)。

  • 发现: 对于“困难”任务,仅仅改变步幅大小是不够的。你还需要动态调整动量(学生多大程度上依赖其先前的步伐)。
  • 结果: 同时优化步幅大小和动量,使得模型能够比标准方法显著更快、更准确地解决“困难”谜题。

“配方”总结

论文提供了一份完美训练调度策略的理论配方:

  1. 识别你的任务: 它是“简单”的(如语言)还是“困难”的(如图像)?
  2. 如果是简单任务: 以中等步幅开始,并随时间逐渐衰减。你也可以随时间增加批量大小以节省时间。
  3. 如果是困难任务: 在几乎整个持续时间内保持步幅高且恒定,然后在最后时刻急剧下降
  4. 不要猜测: 论文证明,这些特定的调度策略在数学上优于目前工业界使用的标准“恒定”或“简单幂律”调度策略。

简而言之,论文认为不存在一种单一的“最佳”模型训练方式。最佳方式取决于任务的难度,而我们现已拥有一张数学地图,可以为每种任务找到确切的路径。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →