← 最新论文
🤖 AI

ReGRPO: Reflection-Augmented Policy Optimization for Tool-Using Agents

GRPO 是一种通过结合用于热启动的结构化反思数据引擎与反思增强型组相对策略优化(Group Relative Policy Optimization)算法来增强工具使用智能体的创新框架,使智能体能够有效地从近失失败(near-miss failures)中学习,并共同优化反思标记与纠正动作,从而超越现有基准。

原作者: Binjie Zhang, Mike Zheng Shou

发布于 2026-07-01
📖 1 分钟阅读☕ 轻松阅读

原作者: Binjie Zhang, Mike Zheng Shou

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个非常聪明但有点笨拙的机器人助手,利用一套数字工具箱(比如网页搜索、图像阅读器或代码执行器)来解决复杂的谜题。这个机器人是一个“视觉-语言模型(Vision-Language Model)”,这意味着它能看懂图片并阅读文本,但当它尝试使用这些工具时,有时会犯错。

这篇论文介绍了一种新的训练方法,叫做 ReGRPO(反思增强型组相对策略优化)。以下是通过简单的类比对它的解释:

问题所在:那个不知道如何修复错误的机器人

目前,当我们训练这些机器人时,我们大多是在向它们展示如何完成任务的完美范例。这就像是在给学生展示一份每一步都做得完全正确的标准答案。

  • 问题在于: 如果机器人尝试使用某个工具并失败了(例如,它试图读取一张收据,但由于相机角度不对,导致它什么也没读到),它就不知道该怎么办了。它只会盲目地继续下去,或者直接放弃。
  • 差距在于: 旧的训练方法并没有教会机器人如何从错误中恢复。它们只教会了机器人在一切顺利时如何取得成功。

解决方案:“错误-反思-修正”循环

研究人员创建了一个新系统,教机器人停下来、思考并自我修正。他们称之为**“反思(Reflection)”**。

把它想象成一个GPS导航系统

  1. 错误(差一点就成功): 机器人尝试转弯,但道路被封锁了(工具失效了)。
  2. 反思(“啊哈!”时刻): 机器人没有直接撞车,而是停了下来并问道:“为什么失败了?哦,我试图在错误的部位读取文本。证据是,我读取到的文本是空的。我的计划是将摄像头框向右移动。”
  3. 修正: 机器人立即尝试新的计划并成功了。

他们是如何构建它的(“结构化数据引擎”)

为了教会机器人这项技能,研究人员并没有只是等待它自然出错。他们建立了一个模拟实验室

  • 他们拿出一个完美的任务并故意破坏它(例如,他们命令机器人看向照片中的错误位置)。
  • 他们观察机器人的失败过程,并记录下到底哪里出了问题。
  • 他们使用了一个“教师AI”(一个非常聪明的模型)来为机器人编写一段结构化的笔记。这个笔记包含三个特定部分:
    1. 错误类型: 发生了什么样的错误?(例如,“我看了错误的位置。”)
    2. 证据: 什么证明了这一点?(例如,“我读取的文本是空的。”)
    3. 修复计划: 如何解决它?(例如,“将摄像头框移动到文本处。”)
  • 然后,他们向机器人反复展示这种“错误 + 笔记 + 修复”的序列,直到它学会自动执行。

训练游戏(组相对策略优化)

一旦机器人学会了基础知识,他们就让它参加一个训练游戏来变得更强。

  • 游戏规则: 他们要求机器人解决同一个谜题 10 次。
  • 评分方式: 有时候它能立即成功;有时候它失败了,停下来“反思”,然后修正它。
  • 奖励机制: 机器人通过解决谜题获得积分,但如果它进行了不必要的“思考”(反思),它会失去一些积分。
  • 目标: 机器人学会了只有在真正需要的时候才停下来反思,并且让它的反思保持简短且有用。它学会了比较自己的尝试:“嘿,那个通过反思并修正的版本比那个只是盲目继续的版本得分更高。”

结果:一个更聪明、具备自愈能力的机器人

研究人员在两个具有挑战性的任务上测试了这个新机器人(ReGRPO):

  1. GTA: 涉及读取收据、图表和 UI 界面等任务。
  2. GAIA: 涉及处理复杂的文档,如 PDF 和电子表格。

最终成果:

  • 这个新机器人解决这些任务的能力显著优于之前的开源机器人。
  • 它不仅变得更擅长使用工具,而且在工具失效时变得更擅长恢复
  • 至关重要的是,它学会了在最终测试中无需人类或第二台计算机来检查其工作就能完成任务。它学会了信任自己的“反思”来即时修复错误。

总结

简而言之,这篇论文教 AI 智能体成为像具备自我修正能力的机械师一样。它不仅仅是学会如何完美地驾驶汽车,而是学会了如何听到异响、诊断问题并立即修复它,而无需停车去请示主管。这使得 AI 在事情并不总是按计划进行的现实世界中变得更加可靠。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →