PlanPO: Group Planning-Aware Policy Optimization for Multi-Turn Agentic LLMs
PlanPO 是一种新颖的组相对策略优化方法,它通过引入由粗到精的优势信号来区分基于交互效率的成功轨迹,从而使多轮智能体大语言模型能够学习可泛化的规划行为,并在挑战性基准测试上显著超越现有基准。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在快速发展的人工智能领域,一类被称为大语言模型的特定计算机程序已经开始不仅仅作为被动的阅读者或书写者,而是作为主动的智能体。这些数字实体可以通过参与多轮对话来导航复杂的环境,从虚拟网络商店到模拟科学实验室,通过观察情况、思考应对方案并采取行动。为了教导这些智能体如何有效地执行此类任务,研究人员经常使用一种称为强化学习的方法。在这个过程中,智能体会尝试许多不同的方式来解决问题,当它成功时,就会获得奖励。随着时间的推移,智能体会学会重复那些导致成功的行为。然而,当智能体找到一种成功的方法时,一个重大的挑战也随之而来:并非所有的成功路径都是平等的。有些解决方案是直接且高效的,而另一些则是迂回的,充满了不必要的循环、冗余的步骤或过于冗长的解释,尽管它们都获得了相同的“成功”奖励。这种缺乏区分度的现象会干扰学习过程,导致智能体在低效的习惯上浪费时间,或无法培养预先规划的能力。
一个研究小组提出了一种解决这一问题的新方法,称为组规划感知策略优化(Group Planning-aware Policy Optimization),简称 PlanPO。该方法不再仅仅奖励任何成功的结局,而是通过观察解决方案是如何达成的,来教导智能体区分“好”的解决方案与“卓越”的解决方案。研究人员观察到,即使智能体正确完成了任务,到达终点的过程也会大相径庭。有些智能体可能会在一个虚拟房屋中徘徊,在找到物体之前反复检查同一个抽屉,而另一些则可能直接前往正确的地点。同样,当智能体表达或书写其想法时,有些响应是简洁且逻辑清晰的,而有些则是啰嗦或包含混乱的推理,即便最终采取的行动是正确的。PlanPO 的核心思想是利用这些长度和效率上的差异作为学习信号。通过将智能体的成功尝试进行相互比较,系统可以识别出哪些路径更为直接,哪些响应更为高效,从而对这些特定的行为给予更高的奖励,而非那些笨拙的行为。
研究人员通过在三个不同且具有挑战性的环境中训练语言模型来测试这一想法。第一个是模拟家庭环境,智能体必须执行诸如拿起物体、清洁或加热物品等任务。第二个是复杂的网络购物环境,智能体必须根据用户指令在数千种选项中寻找特定产品。第三个是科学模拟环境,智能体必须操纵虚拟仪器来进行实验。在这些测试中,研究人员将他们的新方法与几种现有技术进行了对比,包括那些无法区分不同类型成功的标准强化学习方法。结果显示,使用 PlanPO 训练的智能体表现持续优于其他方法。平均而言,新方法在这些困难的基准测试中提升了 27.2% 的性能。在家庭环境中,使用 PlanPO 训练的智能体实现了超过 91% 的成功率,这与以往的方法相比是一个显著的飞跃。
使这一发现显得尤特别引人注目的是智能体行为的变化方式。研究人员发现,使用 PlanPO 训练的智能体不仅学会了完成任务,还学会了更高效地完成任务。它们采取更少的步骤来达到目标,并生成更短、更集中的响应。例如,在家庭任务中,完成一项工作所需的平均交互轮数从超过 26 轮降至不到 14 轮。智能体也停止了产生冗长或重复的文本,显著减少了平均响应长度。这种改进并非通过简单地强制要求智能体变得更短或更快来实现的,研究人员表明,单纯这样做实际上会损害性能。相反,智能体学会了仅在有助于成功时才保持高效。它们开发出了一种规划意识,理解直接的路径和清晰的解释比漫长且曲折的路径更好,即便两者最终都能导致相同的结果。
研究还考察了这些智能体是否能将所学知识应用于未曾见过的全新情境。当在与训练任务不同的任务上进行测试时,PlanPO 智能体保持了极高的成功水平,并以大幅领先于其他方法。这表明这些智能体并非仅仅是在针对特定问题记忆特定解决方案,而是在学习一种通用的规划与决策技能。研究人员指出,这种提升并不需要大量的额外计算能力或复杂的全新硬件;该方法只是重新组织了现有训练数据的评估方式。通过将成功尝试中的差异视为有价值的信息而非噪声,研究人员使智能体能够更有效地学习。这项工作证明,在复杂的人工智能世界中,成功的质量与成功本身同样重要,而教导机器识别这种差异可以带来更聪明、更强大的数字助手。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。