← 最新论文
🤖 machine learning

Rollout Pass-Rate Control: Steering Binary-Reward RL Toward Its Most Informative Regime

本文提出前缀采样方法,通过重构轨迹前缀将二元奖励智能体强化学习引导至最优的50%通过率,从而最大化奖励熵与对比信号,在SWE-bench和AIME等基准测试上实现显著的实时加速与性能提升。

原作者: Tianshu Zhu, Wenyu Zhang, Xiaoying Zuo, Lun Tian, Haotian Zhao, Yucheng Zeng, Jingnan Gu, Daxiang Dong, Jianmin Wu, Dawei Yin, Dou Shen

发布于 2026-05-07
📖 1 分钟阅读☕ 轻松阅读

原作者: Tianshu Zhu, Wenyu Zhang, Xiaoying Zuo, Lun Tian, Haotian Zhao, Yucheng Zeng, Jingnan Gu, Daxiang Dong, Jianmin Wu, Dawei Yin, Dou Shen

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是用简单语言和创造性类比对该论文的解读。

核心问题:在“太简单”或“太难”的任务上浪费能量

想象你是一位教练,正在训练一支学生运动员团队解决复杂的谜题。你每次给他们一批 8 个谜题。

  • “太简单”的一批: 7 或 8 名学生瞬间解开了谜题。他们感到无聊,而你学不到任何新东西,因为他们全都答对了。
  • “太难”的一批: 0 或 1 名学生解开了谜题。其他人都卡住了。你学不到任何东西,因为没有成功的范例可供研究。
  • “刚刚好”的一批: 4 名学生解开了谜题,4 名失败了。这就是最佳点。你拥有了完美的成功与失败混合体供学习。失败的学生可以清楚地看到成功者究竟哪里做得不同。

在人工智能领域,这被称为强化学习(RL)。人工智能会生成许多“推演”(尝试)来解决问题。该论文指出,当前的人工智能训练在“太简单”和“太难”的批次上浪费了巨大的计算能力,因为它们无法提供有用的学习信号。

解决方案:“前缀采样”(“抢跑”与“让分”技巧)

研究人员提出了一种名为前缀采样的巧妙方法来修复这一问题。与其直接丢弃糟糕的批次或要求人工智能从头开始重新尝试(这既慢又昂贵),他们使用了一种“时间旅行”技巧。

将人工智能的尝试想象成正在撰写的一个长故事。

  1. “太难”的情景: 人工智能尝试解决一个难题,但大多以失败告终。

    • 技巧: 系统在该批次中找到人工智能确实做出的那一次成功尝试。它截取该成功故事的前半部分(即“前缀”),并强制人工智能从该确切点开始下一次尝试。
    • 类比: 这就像给 struggling 的学生一个抢跑的机会。“你在这里卡住了,但看,你实际上正确解决了第一部分。从这一点开始你的下一次尝试。”这让难题变得更容易,将成功率推向 50%。
  2. “太简单”的情景: 人工智能太容易地解决了问题。

    • 技巧: 系统找到该批次中那一次失败的尝试。它截取该失败故事的前半部分,并强制人工智能从那里开始。
    • 类比: 这就像给天才学生施加一个让分。“你解决得太快了。让我们假装你在开始时犯了一个错误。从这个错误开始你的下一次尝试。”这让简单的问题变得更难,将成功率拉低向 50%。

为什么 50% 是神奇数字

该论文通过数学证明,50% 的成功率是最具信息量的点。

  • 熵(困惑度): 如果你知道人工智能总是赢或总是输,就没有惊喜。如果它一半时间赢,就存在最大的“惊喜”或可供学习的信息。
  • 对比: 为了学习,你需要将“赢”与“输”进行对比。如果所有人都赢,你就没有输的案例可供比较。如果所有人都输,你就没有赢的案例。你需要 50/50 的分割才能获得最佳对比。

在现实世界中如何运作(“有状态”部分)

这是最难解释的部分,但至关重要。在简单的数学问题中,人工智能只需编写文本。但在软件工程(如修复代码)中,人工智能是一个“智能体”,它会打开文件、运行命令并改变计算机的状态。

通常,如果你想重播之前的尝试,必须重置整个计算机环境,这非常缓慢。

  • 创新之处: 研究人员构建了一个系统,可以逐步“重播”人工智能的操作,以重建计算机的确切状态(代码、文件、历史记录),而无需从头开始。
  • 掩码处理: 当人工智能从这个重播的状态继续时,系统会告诉人工智能:“第一部分不是你写的(我们为你重播了)。你只为你写的内容获得积分。”这确保人工智能从自己的新决策中学习,而不是旧决策。

结果:更快、更智能

研究人员在两类任务上测试了这种方法:

  1. 软件工程(SWE-bench): 修复现实世界的代码漏洞。
  2. 数学(AIME 2025): 解决高难度的数学奥林匹克问题。

收益:

  • 速度: 在更大的模型上,人工智能达到相同的高性能水平所需时间减少了一半(快达 2 倍)。
  • 效率: 它在无用的“全赢”或“全输”尝试上浪费了更少的计算能力。
  • 性能: 最终的人工智能在解决问题方面实际上比标准训练方法更出色,达到了更高的分数。

总结

该论文为人工智能训练引入了一位“交通指挥官”。与其让人工智能肆意奔跑并在太简单或太难的任务上浪费时间,不如主动将训练批次引导至50% 的成功率。它通过给 struggling 的人工智能提供来自先前成功的“抢跑”机会,以及给过度自信的人工智能提供来自先前失败的“让分”来实现这一点。这将学习过程保持在“金发姑娘区”(即不冷不热、刚刚好),使训练显著更快且更有效。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →