RTPO: Reverse-Turn Policy Optimization for Stabilizing Agentic RL Training
本文介绍了反向轮次策略优化(Reverse-Turn Policy Optimization, RTPO),这是一个通过将展开过程重构为稀疏反向树,从而消除上下文失配、实现因果一致的信用分配并控制异步策略漂移,进而稳定多轮智能体强化学习训练的统一框架,其性能显著优于现有基准方法。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在人工智能飞速发展的世界中,研究人员正在教导大型语言模型扮演自主智能体的角色。这些不仅仅是回答问题的聊天机器人,而是旨在进行规划、推理并使用外部工具(如计算器或搜索引擎)来解决复杂问题的系统。为了让这些智能体变得更聪明,科学家经常使用一种叫做强化学习的方法。想象一个学生正在学习玩一款新游戏:他们尝试不同的动作,如果赢了,就会获得奖励。随着时间的推移,他们学会了哪些动作会导致成功。在数字领域,“动作”是模型生成的词汇,而“奖励”是任务结束时给出的分数。这种方法对于单步任务(例如一次性解决数学问题)非常成功。然而,当这些智能体被要求执行长期的、多步骤的工作流时——例如在多次对话回合中进行主题研究、收集数据并撰写报告——训练过程会变得极其不稳定。模型往往能学会解决短任务,但在面对长任务时表现得一团糟,其性能会随着步骤数量的增加而崩溃。
来自澳大利亚和美国大学的一个研究小组已经发现了这种崩溃发生的原因,并提出了一种修复它的新方法。他们发现,这种不稳定性源于在对这些智能体进行多轮训练时发生的三个紧密相关的难题。首先,模型在练习时看到的内容与它在接受教学时看到的内容之间存在不匹配。在练习期间,为了节省空间,模型可能只看到对话的摘要;但在训练期间,计算机却强制它查看完整的对话历史。这种差异会让模型感到困惑,使其无法确定该信任哪种上下文。其次,系统很难弄清楚在长链推理中究竟是哪一个具体步骤导致了最终的成功或失败。当模型在完成一个十步流程后获得奖励时,训练算法通常会将这种功劳(或责备)平均分配给所有十个步骤,即使其中第五步才是关键性的错误。这使得智能体难以学习正确的行为。第三,随着训练的进行,模型本身也在发生变化。如果系统试图从一段对话开始时模型还比较“年轻”、技能较低,而结束训练时模型已经变得“年长”、技能更高的数据中学习,那么数据就会变得不一致。模型本质上是在尝试从过去的自我中学习,从而产生了一种使学习过程不稳定的漂移现象。
为了解决这些问题,研究人员开发了一种名为“逆向转轮策略优化”(Reverse-Turn Policy Optimization,简称 RTPO)的新框架。他们不再将一段长对话视为一个巨大的、扁平的文本块,而是将训练过程重新构想为一系列截然不同且相互连接的时刻。其核心思想是通过“倒着”的方式来训练模型,即从任务的最后一步开始,向最初的步骤回溯。当系统到达对话中的特定回合时,它会暂停并创建多个“兄弟”版本的未来。它会让模型去想象:“如果我现在做出这个特定的决定,接下来会发生什么?”然后,它会向前运行这些未来的场景,以观察它们是否会导致好的结果。通过对比这些“兄弟”未来的情况,系统可以精准地指出当前回合中哪一个决策是最优的,而不会受到之前发生的干扰或之后不确定性的影响。这种方法确保了模型始终在一致的上下文中学习,并且成功的功劳能精确地归功于导致结果的那个决策。
这项新方法的成果令人瞩目。在进行困难的数学推理任务和复杂的网络搜索挑战测试时,新方法显著优于现有技术。在一组高难度数学问题中,新方法使智能体的准确率比之前的标准方法提高了超过 21%。在基于知识的任务中,性能提升了近 11%。或许更重要的是,训练过程本身变得更加稳定了。在以往的方法中,随着任务变长,模型的表现往往会变差,但使用这种新方法,即使在步骤数增加的情况下,模型仍能持续进步。研究人员还发现,智能体使用工具的效率也提高了。在处理数学问题时,智能体调用的工具次数减少了,但得到的正确答案却更多了,这表明它们学会了依靠自身的推理,仅在绝对必要时才使用工具。在研究任务中,它们的调用次数增加了,但这些调用更具策略性,从而实现了更有效的信息收集。
研究人员通过隔离出他们识别出的三个问题,验证了其解决方案的有效性。他们证明,通过修复上下文不匹配问题,模型不再会对应该观察什么感到困惑;通过修复信用分配问题,模型学会了在每个特定步骤做出更好的决策,而不是仅仅根据最终结果进行猜测;通过保持训练数据与当前版本模型的一致性,他们消除了通常会导致长程训练失败的漂移现象。这项研究为构建能够处理复杂多步任务而不迷失方向、更可靠的 AI 智能体提供了一条清晰的路径。它表明,掌握长程推理的关键不仅在于给模型更多的数据,还在于重构其学习数据的方式,确保每一个决策都能针对正确的未来可能性得到公正且准确的评判。这项工作标志着在创造能够真正一步步应对现实世界复杂性的 AI 助手方面迈出了重要的一步。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。