← 最新论文
🤖 machine learning

ExpRL: Exploratory RL for LLM Mid-Training

ExpRL 引入了一种自动化训练中框架,该框架利用人工编写的解法作为隐藏的奖励支架,为大语言模型生成密集的过程级反馈,从而克服了稀疏奖励和人工技能定义的局限性,以更有效地为复杂的推理任务预热模型。

原作者: Violet Xiang, Amrith Setlur, Chase Blagden, Nick Haber, Aviral Kumar

发布于 2026-06-16
📖 1 分钟阅读☕ 轻松阅读

原作者: Violet Xiang, Amrith Setlur, Chase Blagden, Nick Haber, Aviral Kumar

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教导一名才华横溢但缺乏经验的学生(基础大语言模型)如何解决极其困难的数学谜题。

问题:“全有或全无”的陷阱

目前教导这位学生的标准方式是给他们一个谜题,然后说:“如果你得到了最终答案,你就有一颗金星;如果你错了,你什么也得不到。”

这被称为稀疏奖励强化学习(Sparse Reward Reinforcement Learning)。问题在于,对于非常难的谜题,学生很难在第一次尝试时就得到正确答案。因为他们几乎从未获得过金星,所以他们不知道自己哪里做错了。是因为一开始的想法不对?是因为一个小小的计算错误?还是在中途迷失了方向?由于缺乏反馈,他们只是在随机猜测,希望偶然撞到正确答案。他们缺乏覆盖度(coverage)——他们还没有学会足够多的不同解题方法,从而无法获得解决问题的机会。

解决方案:ExpRL(“带着小抄的教练”)

研究人员提出了一种新的训练方法叫做 ExpRL(探索性强化学习)。你可以把它看作是一个“中期训练”阶段,即在进行最终考试之前,先给学生配备一位特别教练。

以下是 ExpRL 的工作原理,使用一个简单的类比:

  1. 小抄(参考答案): 教练拥有一份完美的、分步骤的谜题解答(“参考答案”)。
  2. 秘密规则: 学生看不见这份小抄。他们必须像在现实世界中一样,尝试独立解决谜题。
  3. 评分标准(裁判): 在学生写完他们的尝试过程后,教练会将他们的内容与小抄进行对比。但教练不仅仅是说“错了”,而是扮演一个严厉但乐于助人的阅卷老师。
    • 你是否使用了正确的公式?(对了?+1 分)。
    • 你是否正确地简化了方程?(对了?+1 分)。
    • 你在中间过程迷失了吗?(没得分)。
    • 你最后得到的最终答案错了吗?(没关系,但你之前做的那些好步骤仍然可以得分)。

这就是核心创新点:ExpRL 奖励部分进度。 即使学生最终答案错了,只要他们在过程中迈出了正确的步骤,依然能获得“稠密奖励”(即许多细小的分数)。

两种评分方式

论文测试了两种给予这些分数的方法:

  • ExpRL-Outcome(结果导向型): 教练会等到学生完成整个尝试过程后,根据整个论述与完美答案的接近程度给出总分。
  • ExpRL-Process(过程导向型): 教练会在学生写每几句话时停下来,给出即时反馈。“第一步做得很好!但下一步看起来有点不稳。”这有助于学生学习如何构建解决方案,而不仅仅是了解最终答案长什么样。

结果:建立更好的基础

在经过这个“中期训练”阶段后,学生在面对最终考试(即真正的稀疏奖励 RL)时表现得更加出色。

  • 更好的覆盖度: 学生已经学会了尝试多种不同的策略。他们不再是盲目猜测;他们知道如何分解问题、检查自己的工作并进行自我纠正。
  • 更强的起点: 当学生最终参加最终考试(此时只有拿到完美答案才能获得金星)时,由于他们已经练习了解决难题的过程,因此成功的概率大大提高。
  • 击败竞争对手: 论文表明,这种方法比以下方法效果更好:
    • SFT(监督微调): 仅仅强迫学生死记硬背小抄(这会让学生变得僵化且缺乏创造力)。
    • 标准 RL: 仅仅等待金星(这太慢且令人沮丧)。
    • 自我蒸馏(Self-Distillation): 试图从他们自己最好的猜测中学习(这可能并不可靠)。

“混合领域”测试

研究人员还在数学、科学和编程问题的混合领域进行了测试。

  • 数学与科学: 效果非常好。“小抄”帮助学生理解逻辑和步骤。
  • 编程: 有一定帮助,但效果不如前者。为什么呢?因为在编程中,你可以直接运行代码来查看是否成功(这是一个清晰的“通过/失败”信号)。在这种情况下,“小抄”就不那么必要了,因为计算机本身就会告诉你对错。

核心结论

ExpRL 就像是给学生进行一场练习考试,在练习中,只要他们迈出了正确的一步,就能获得部分分数,而引导他们的是一份他们看不见但完美的答案解析。这建立了一个强大的解题能力基础,使他们在面对那个只有最终答案才算数的、高风险的真实考试时,更有可能取得成功。它将“全有或全无”的赌博变成了一段结构化的学习旅程。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →