← 最新论文
💬 NLP

Pre-training LLM without Learning Rate Decay Enhances Supervised Fine-Tuning

该论文通过实验与损失景观分析表明,在大语言模型预训练阶段采用无学习率衰减的“预热 - 稳定”(WSO)策略,虽可能牺牲预训练损失指标,却能引导模型收敛至更平坦的极小值,从而显著提升其在监督微调后的下游任务表现与适应性。

原作者: Kazuki Yano, Shun Kiyono, Sosuke Kobayashi, Sho Takase, Jun Suzuki

发布于 2026-03-18
📖 1 分钟阅读☕ 轻松阅读

原作者: Kazuki Yano, Shun Kiyono, Sosuke Kobayashi, Sho Takase, Jun Suzuki

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文探讨了一个在大语言模型(LLM)训练中非常有趣且反直觉的发现:在预训练阶段,不要“减速”(即不要降低学习率),反而能让模型在后续的任务中表现得更好。

为了让你轻松理解,我们可以把训练一个大语言模型想象成培养一个天才学生

1. 背景:传统的“减速”教学法

过去,大家认为训练模型就像教学生读书。

  • 预训练(Pre-training):相当于让学生读遍全世界的书(海量数据),建立通用的知识基础。
  • 微调(SFT):相当于让学生毕业后去实习,学习具体的工作技能(比如写代码、写公文)。

在传统的“教学法”(学习率调度)中,老师们习惯用一种叫**“余弦衰减”或“线性衰减”**的策略。

  • 比喻:想象学生刚开始读书时,像一辆在高速公路上飞驰的赛车(学习率高),为了快速吸收大量信息。但随着读书读得越来越多,老师会担心学生“太兴奋”或“走火入魔”,于是慢慢踩刹车,让车速越来越慢,最后几乎停下来(学习率降得很低)。
  • 目的:老师觉得,这样能让模型在“读书阶段”(预训练)的考试成绩(Loss 值)达到完美,把书读得最透。

2. 新发现:一直“匀速”跑的学生更灵活

这篇论文的作者(来自东北大学等机构)提出了一种新的教学法,叫 WSO (Warmup-Stable-Only)

  • 比喻:在这个方法里,学生读完热身(Warmup)后,全程保持匀速,不管读了多少书,都不踩刹车,一直维持高速状态直到读完。
  • 反直觉的结果
    • 在“读书阶段”(预训练结束时),那些踩了刹车(传统衰减法)的学生,考试成绩确实更好,书读得更“深”。
    • 但是,当这些学生进入“实习阶段”(微调/SFT)时,那些一直匀速跑、没踩刹车的学生(WSO),反而表现得更好! 他们学新技能更快,适应新工作更灵活。

3. 为什么会这样?(核心原理:地形学)

论文通过数学分析(损失景观分析)揭示了原因,我们可以用**“地形”**来比喻:

  • 踩刹车的学生(传统衰减法)

    • 当他们慢慢减速时,就像在走一条狭窄、陡峭的山谷。他们很容易掉进一个很深的坑里(局部最优解)。
    • 后果:这个坑太深、太窄了。一旦要让他们去学新东西(微调),就像要把他们从深坑里拉出来,非常困难,稍微动一下就会摔得很惨。他们的思维变得“僵化”了。
  • 匀速跑的学生(WSO 方法)

    • 因为他们没有减速,他们停留在宽阔、平坦的高原上。
    • 后果:这里的地势平坦,没有深坑。当需要学习新技能(微调)时,他们可以轻松地在高原上移动,灵活地适应各种新任务,不会受到阻碍。

简单总结:传统的“减速”策略虽然让模型在预训练时看起来更“完美”(陷得更深),但也让它变得“死板”,难以适应新任务。而“不减速”的策略虽然预训练分数稍低,但保留了模型的灵活性(Adaptability),让它更容易被“调教”成各种专家。

4. 实验验证:不管怎么练,结果都一样

作者做了很多实验,包括:

  • 不同大小的模型(10 亿参数和 80 亿参数)。
  • 不同的训练阶段(包括中间加了一个“进阶训练”阶段,以及“过度训练”阶段,即读了远超常规数量的书)。

结论:无论模型大小,无论读了多少书,只要最后阶段不踩刹车(WSO),模型在最终任务(微调)中的表现总是最好的。

5. 这对我们意味着什么?

这篇论文给 AI 开发者提出了一个重要的建议:

  • 不要只盯着预训练的分数看:以前大家觉得预训练 Loss 越低越好,但这篇论文告诉我们,那可能是一种“虚假的繁荣”。
  • 为了未来的灵活性:如果你希望你的模型在发布后,能更容易地被微调成写代码的助手、写故事的作家或医疗顾问,那么在预训练时,请保持学习率稳定,不要过早减速

一句话总结
别为了把书读得“太透”而把学生教“死”了。保持一点“冲劲”和“灵活性”,反而能让他们在未来的工作中干得更好。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →