← 最新论文
🤖 machine learning

Rethinking Expert Trajectory Utilization in LLM Post-training for Mathematical Reasoning

本文引入可塑性上限框架,证明在大规模数据下于监督微调(SFT)的稳定或轻微过拟合阶段启动的“先 SFT 后强化学习(RL)”顺序流程,优于同步方法,并驳斥了“少即是多”假说,即该假说认为最大化大语言模型数学推理能力需要更少数据。

原作者: Bowen Ding, Yuhan Chen, Jiayang Lyv, Jiyao Yuan, Qi Zhu, Shuangshuang Tian, Dantong Zhu, Futing Wang, Heyuan Deng, Fei Mi, Lifeng Shang, Tao Lin

发布于 2026-05-12
📖 1 分钟阅读☕ 轻松阅读

原作者: Bowen Ding, Yuhan Chen, Jiayang Lyv, Jiyao Yuan, Qi Zhu, Shuangshuang Tian, Dantong Zhu, Futing Wang, Heyuan Deng, Fei Mi, Lifeng Shang, Tao Lin

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在训练一名天才学生成为数学大师。你拥有两大主要工具:一本“教科书”(监督微调,即 SFT)和一个“解题健身房”(强化学习,即 RL)。

本文研究的是如何利用这些工具将一名聪明的学生培养成数学天才的最佳方法。研究人员发现,使用这些工具的顺序、研读教科书的时长以及所选问题的难度,是成功的关键。

以下是他们研究发现的简要解析,采用简单的类比:

1. “先教科书,后健身房”法则

问题: 有些人认为可以将教科书和健身房混合在一起同时使用(称为“同步 SFT-RL")。他们希望这样能更快。
发现: 本文表明这是一个糟糕的主意。这就像试图一边阅读数学书的一章,一边在跑步机上跑步;结果你会感到困惑,且进展甚微。
胜出者: 最佳方法是顺序式:先完整研读整本教科书,直到你真正理解概念,然后再去健身房独立练习解题。这种“先教科书”的方法奠定了坚实的基础,使学生日后能达到更高的技能水平。

2. 切换的“甜蜜点”

问题: 何时应该停止阅读教科书并开始进入健身房?
发现: 你不应该切换得太早(当你仍感到困惑时),也不应该太晚(当你把书背得滚瓜烂熟以至于无法再创造性思考时)。
类比: 将教科书的学习曲线想象成一座山丘。

  • 太早(自适应阶段): 你仍在山脚,步履蹒跚。如果此时切换到健身房,你缺乏有效训练所需的基本技能。
  • 太晚(严重过拟合): 你把书背得完美无缺,以至于无法处理问题。你变成了一个只知晓书中答案的机器人。
  • 甜蜜点(稳定阶段): 你已经登上了山顶。你深入理解了材料,但尚未变成僵化的机器人。这正是切换到健身房的完美时机。 本文证明,恰好在教科书学习“稳定”时停止,能带来最佳结果。

3. 数量与难度(“少即是多”的迷思)

问题: 一些专家声称,使用极少量的高质量难题比使用海量问题堆更好(“少即是多”)。
发现: 本文表示
类比:

  • 数据规模(数量): 将其想象为健身房的大小。一个小健身房(小数据集)可能容易填满,但它限制了你变得多强壮。一个巨大的健身房(海量数据集)为你提供了构建巨大力量的空间。本文发现,越大越好。数据集的大小是决定你最终上限的主要因素。
  • 数据难度: 将其想象为杠铃上的重量。一旦你拥有了一个大健身房,增加更重的重量(更难的问题)能帮助你变得更强。但如果你只有一个微小的健身房,沉重的重量无法帮助你登顶。
  • 结论: 首先,拥有一个巨大的健身房(大量数据)。然后,增加重量(更难的数据)以优化训练。

4. “水晶球”指标

问题: 如何在不进行昂贵测试的情况下,知道你是否选对了教科书以及切换的时机?
发现: 研究人员发现了一个简单的指标:“验证损失”的最低点
类比: 想象你正开车上山。你不需要一直开到山顶就能知道山有多高。你只需要观察在教科书学习期间道路上的最低凹陷处(最小验证损失)。如果那个凹陷非常低,它预示着你在健身房后期能够达到非常高的峰值。这是你最终潜力的可靠水晶球。

“可塑性 - 上限”框架总结

作者创建了一个名为可塑性 - 上限的框架:

  • 上限: 你的模型所能达到的最高分数。
  • 可塑性: 在完成教科书学习后,仍有多少改进空间。

核心教训:
要获得最高的上限,你必须:

  1. 使用顺序式方法(先教科书,健身房)。
  2. 恰好在达到稳定阶段时停止教科书学习(不要太早,也不要太晚)。
  3. 使用海量数据集(数量为王)。
  4. 更难的问题作为额外的倍增器。

这将 AI 的训练过程从一场“猜测与检查”的游戏,转变为一种可预测的、科学的配方。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →