Learning as Reasoning Unfolds: Progressive Rollout Allocation for Efficient Reinforcement Learning
本文提出了 VIGOR,一种方差引导的在线展开分配方法,该方法通过将固定的生成预算动态分配给奖励方差最高的样本,从而在显著降低计算成本并提高稳定性的同时,在数学推理和编程任务上实现了比标准 GRPO 更优越的性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图教一个非常聪明但有点丢三落四的机器人如何解决复杂的谜题,比如数学题或编写计算机代码。你不能坐在那里解释每一个步骤;相反,你让机器人去尝试,当它得到正确答案时,你会给它一个击掌(即“奖励”)。当它出错时,你会温柔地对它说“再试一次”。这个过程被称为强化学习(Reinforcement Learning)。机器人会不断尝试不同的路径来解决问题,随着时间的推移,它会逐渐明白哪些路径能带来击掌,哪些路径会导致死胡同。
然而,这里有一个难点。为了有效地学习,机器人需要尝试很多不同的路径。如果它只尝试一两个,它可能会走运并误以为一条糟糕的路径其实是好的。但如果它尝试了成千上万条路径,就会造成巨大的时间和电力浪费,尤其是因为其中大部分路径都是乏味或无用的。这就像要求一个学生写100篇论文来学习写作,而其中90篇都只是乱涂乱画,根本学不到任何新东西。科学家们面临的大问题是:我们如何让机器人尝试正确数量的路径,而不至于在那些乏味的路径上浪费能量?
这就是一种名为 VIGOR 的新方法发挥作用的地方。把机器人的学习过程想象成一场“找热找冷”的游戏。在旧的方法(称为 GRPO)中,机器人会对每一个谜题盲目地尝试相同次数的猜测,无论这个谜题是易是难。这就像老师给每个学生布置同样多的家庭作业,即使有些学生已经掌握了答案,而另一些学生则完全迷失了方向。
VIGOR 背后的研究人员意识到,最有用的信息来自于机器人不确定的时刻。如果机器人尝试一道数学题,得到的是正确和错误交织的结果,那么这种“方差”(或分歧)就是一个信号,表明机器人正在学习重要的东西。但如果它每次都得到同样的错误答案,或者每次都得到同样的正确答案,那它就是在浪费时间。
VIGOR 改变了游戏规则,它扮演着一个聪明的教练,观察机器人的前几次尝试。它不再给每个谜题固定的尝试次数,而是先让机器人对所有题目进行几次初步尝试。然后,它观察结果:
- 如果机器人的答案每次都一样(低方差),教练会说:“好了,我们明白了,继续下一个。”
- 如果机器人的答案五花八门(高方差),教练会说:“这个很难!让我们多试几次来搞清楚它。”
这种方法会将更多的“猜测能量”(rollouts)仅投入到那些最令人困惑的谜题中,同时忽略那些太简单或由于太烂而无法从中学习的题目。这就像一款视频游戏,只会为那些正在挣扎的玩家生成更多困难的敌人,而不是通过增加简单关卡的难度来填充时间。
论文显示,这种方法是一个游戏规则的改变者。通过使用这种“方差引导”策略,机器人达到相同的技能水平所需的猜测次数显著减少。在数学问题上,VIGOR 达到目标准确率时使用的尝试次数比标准方法减少了高达 2.3 倍。在编程任务中,它以减少 1.49 倍的尝试次数达到了相同的成功率,甚至将最终成功率提高了 3.4 个百分点。
作者认为,这不仅仅是一个小小的改进;这是我们教授 AI 推理方式的一次根本性转变。他们在不同规模的 AI 模型上测量了这些结果,发现 VIGOR 始终能更快速、更高效地学习。这证明了你不需要向一个问题投入更多的计算能力来解决它,你只需要更聪明地分配你的力量。通过仅专注于不确定的时刻,VIGOR 帮助 AI 更有效地学习推理,将一个混乱的试错过程转变为一场专注且高效的探索之旅。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。