← 最新论文
🤖 machine learning

Early Verdicts, Better Budgets: Sequential Adaptive Rollout Allocation for Compute-Efficient RLVR

本文介绍了 SARA,一种顺序自适应展开分配方法,该方法通过根据早期有效性信号动态决定继续或放弃提示词采样,优化了具有可验证奖励(RLVR)的强化学习中的计算效率,从而在保持或提高模型性能的同时,显著减少了浪费的展开次数。

原作者: Pixel Nomand, Elena Voss, Marcus Hale, Sofia Reyes

发布于 2026-07-30
📖 1 分钟阅读☕ 轻松阅读

原作者: Pixel Nomand, Elena Voss, Marcus Hale, Sofia Reyes

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正在举办一场大规模的烹饪比赛,旨在训练一个机器人厨师。目标是通过让它尝试数千个食谱,并针对每次尝试得到一个简单的“是的,成功了!”或“不,失败了!”的反馈,来教会机器人如何解决复杂的谜题,比如数学问题或规划旅行。这个过程被称为具有可验证奖励的强化学习(Reinforcement Learning with Verifiable Rewards)。难点在于,这个机器人的运行速度慢且成本高昂。它每尝试一个食谱,都会消耗大量的计算资源(称为“展开”,rollouts)。

这里有一个问题:机器人经常陷入循环。有时,它会尝试一个非常简单的食谱,并且每次都能成功;其他时候,它会尝试一个超级困难的食谱,并且每次都失败。在这两种情况下,结果都是枯燥且可预测的。如果一批尝试中的每一次都是成功的,或者每一次都是失败的,机器人就学不到新东西,因为没有可以分析的“惊喜”。这就像一位老师在给考试评分,如果每个学生都得了100分或0分,老师就无法判断谁需要帮助,或者谁已经准备好进入下一阶段了。目前解决这个问题的方法是不断烹饪,直到找到足够多的“混合型”批次(即既有对也有错的批次),但这在处理那些枯燥、可预测的批次时浪费了大量的能量。

这篇论文介绍了一种聪明的新策略,叫做 SARA(顺序自适应展开分配,Sequential Adaptive Rollout Allocation),旨在停止这种能量浪费。SARA 不再盲目地烹饪完整的食谱批次并寄希望于好运,而是像一位聪明的副厨,在尝了几口菜后就能判断出味道。如果主厨很早就意识到某个食谱注定会彻底失败(全错)或注定会稳赢(全对),SARA 就会立即停止烹饪该食谱。它会扔掉该特定菜肴剩余的食材,并将节省下来的能量用于开始烹饪一个新的、未知的食谱。

作者在数学和规划问题上,使用单张显卡上的小型 AI 模型测试了该方法。他们发现 SARA 的效率极高。它能以与旧的、浪费的方法相当的效果训练机器人,但减少了 22% 的烹饪尝试(展开次数)。更棒的是,当他们将 SARA 与一种能够预测哪些食谱可能具有趣味性的方法结合时,得到了最高的准确率,且比标准的“尝试一切”方法减少了 67% 的尝试次数。这篇论文从数学上证明了这种提前停止机制是可靠的,并且不会意外丢弃好的学习机会。简而言之,SARA 教会了机器人如何在领先(或落后)时见好就收,并将精力仅投入到那些真正能让它变得更聪明的谜题上。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →