Process Reward Informed Tree Rollout for Effective Multi-Turn RL
本文介绍了 PATR,一种过程奖励引导的自适应树展开框架,该框架通过从有前景的中间状态进行选择性分支并复用共享前缀,优化了用于大语言模型(LLM)智能体的多轮强化学习,从而在 SWE-Bench 和 FrozenLake 等基准测试上,相比传统的均匀轨迹采样方法显著提升了性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下你正在教一个机器人破解谜题。在人工智能领域,这被称为强化学习(Reinforcement Learning, RL)。把它想象成训练一只狗:机器人尝试完成一项任务,如果它做对了,就会得到奖励(零食);如果它搞砸了,就什么也得不到。随着时间的推移,机器人会学会哪些行为能带来零食。但棘手的地方在于:有时机器人必须走一段漫长且曲折的路径,经过许多步骤后才能第一次看到零食。如果机器人只是随机猜测,它可能会浪费数小时在原地转圈或掉进坑里,永远学不会正确的方法。对于“智能体”(Agents)——即与计算机或网站等工具进行交互的 AI 程序——来说,这尤其困难,因为它们必须连续做出一系列决策来解决问题。科学家们正在思考的大问题是:我们如何教这些智能体去探索正确的路径,而不是在死胡同里浪费时间?
这就是名为 PATR 的新思路发挥作用的地方。来自加州大学圣迭戈分校、亚马逊和麻省理工学院的研究人员注意到,目前训练这些 AI 智能体的方法有点像“散弹枪”式的方法。他们告诉 AI 反复尝试同一个任务,而且每次都从头开始。如果 AI 陷入循环或在早期阶段做出了错误的举动,整个尝试都会被丢弃,即使前几步其实做得相当不错。这就像仅仅因为烤焦了饼皮就把整张披萨扔掉一样,尽管剩下的芝士和酱料其实非常完美。
作者提出了一种更聪明的训练智能体的方法,称之为过程评分引导的自适应树状展开(Process-Scorer Guided Adaptive Tree Rollout, PATR)。PATR 不再每次都从头开始,而是构建一棵“可能性之树”。想象一下,AI 就像一名在岔路口前的徒步旅行者。与其派十名徒步旅行者去尝试十条完全不同的随机路径,PATR 会先让他们沿着最有希望的小径前进。如果这条路径上的徒步旅行者发现了一个美丽的景色(一个“好”的中间步骤),系统就会派更多的人沿着同一条路径去探索不同的分支。如果一条小径看起来像是通往悬崖(一个“坏”的步骤),系统就会提前停止向该路径派人,以节省精力。至关重要的一点是,它也会记录那些掉下悬崖的徒步旅行者的经历,因为知道什么是不该做的,与知道该做什么同样重要。
论文指出这种“树”方法效率更高。通过使用一个“评分器”(Scorer)——一个每隔几步就会观察徒步旅行者进展情况的聪明裁判——系统可以决定扩展哪些路径以及修剪哪些路径。他们在两个截然不同的挑战上进行了测试:一个是简单的网格世界游戏 FrozenLake(智能体必须在不掉入冰洞的情况下穿越冰冻湖面),另一个是更难的现实世界编程任务 SWE-Bench(智能体需要修复软件中的漏洞)。
结果令人振奋。在编程任务中,与标准方法相比,PATR 将智能体的成功率提升了高达 5.0 个百分点。在较简单的游戏中,它将成功率提升了 9.3 个百分点。作者发现,这种方法不仅让 AI 变得更聪明,还让它运行得更快,且不太容易陷入重复的循环。他们强调,这并不是解决一切问题的万灵药,但它表明,利用“过程评分器”来引导探索,是教导 AI 智能体如何应对长期、复杂任务而不浪费时间在死胡同里的有力手段。核心启示在于,通过对我们的“探索者”去向进行筛选,我们可以用更少的努力学到更多。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。