← 最新论文
🤖 machine learning

Spend Your Rollouts Where It Counts: Rollout Allocation for Group-Based RL Post-Training

本文介绍了 Pilot-Commit,这是一种预算感知的 rollout 分配框架,能够在基于群体的强化学习后训练过程中动态识别并优先处理高方差提示,与 GRPO 和 DAPO 等现有方法相比,显著降低了采样成本并加速了收敛。

原作者: Woojeong Kim, Ziyi Yang, Jing Nathan Yan, Jialu Liu

发布于 2026-05-27
📖 1 分钟阅读☕ 轻松阅读

原作者: Woojeong Kim, Ziyi Yang, Jing Nathan Yan, Jialu Liu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你是一位老师,正试图帮助学生学好数学。你拥有有限的时间和精力(你的“预算”),用于为学生提供练习题。

在人工智能领域,特别是在训练大型语言模型(LLMs)提升推理能力时,“学生”就是人工智能,而“练习题”被称为rollouts( rollout 即 AI 尝试解决问题并生成答案的过程)。

问题:在过易或过难的问题上浪费时间

目前,大多数 AI 训练方法就像一位盲目地向每位学生分发相同数量练习题的老师,无论学生是否已经知道答案,或者是否觉得问题无法解决。

  • “太简单”的问题:如果一个问题简单到 AI 每次都能答对,那么就没有新东西可学。但计算机仍然浪费时间去生成答案。
  • “太难”的问题:如果一个问题难到 AI 每次都会答错,它也学不到太多东西,因为信号过于嘈杂。
  • “刚刚好”的区域:当一个问题具有挑战性,使得 AI 有时答对、有时答错时,AI 的学习效果最佳。这种“不确定性”会产生强烈的学习信号。

现有方法(如 GRPO 和 DAPO)对所有问题一视同仁,将昂贵的计算能力浪费在“太简单”和“太难”的问题上。

解决方案:Pilot-Commit(试点 - 承诺)

本文作者提出了一种名为Pilot-Commit的新策略。可以将其想象为一位聪明的老师,采用两步流程来决定哪些问题值得学生投入时间。

第一步:试点(“试吃”)

在投入完整课程之前,老师先让学生对问题进行微小的“试吃”(几次快速尝试)。

  • 如果学生每次都答对?老师将其标记为“太简单”,暂时跳过。
  • 如果学生每次都答错?老师将其标记为“太难”,留待以后处理。
  • 如果学生感到吃力但偶尔能答对?老师将其标记为“金发姑娘”(刚刚好)。

第二步:承诺(“主课”)

老师将剩余的时间和精力投入到试点阶段识别出的“金发姑娘”问题上。他们忽略那些太简单和不可能解决的问题。

为何这很重要

本文声称,通过使用这种"Pilot-Commit"方法,AI 的学习速度大大加快,因为它不再将资金浪费在无法带来新知识的题目上。

  • 结果:在数学问题的测试中,该方法达到了与旧方法相同的准确率水平,但使用的练习尝试次数(rollouts)显著减少
    • 与一种标准方法(GRPO)相比,其速度最快可达1.9 倍
    • 与另一种方法(DAPO)相比,其速度最快可达4.0 倍

关于“驱逐”的类比

本文还提到了一个名为“驱逐”(Eviction)的功能。想象随着学生变得更聪明,一些曾经属于“金发姑娘”的问题变成了“太简单”。Pilot-Commit 系统会注意到这一点,并永久将这些已解决的问题从练习列表中移除,确保计算机永远不会再在它们身上浪费一秒钟。

总结

简而言之,Pilot-Commit 是一种用于 AI 训练的聪明预算系统。它不再盲目地练习所有内容,而是快速测试少量问题,以识别哪些真正有助于学习,然后将所有资源倾注到这些特定的挑战上。这使得 AI 能够以更少的计算能力和时间达到专家级的数学技能。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →