← 最新论文
💬 NLP

Synthesize and Reward -- Reinforcement Learning for Multi-Step Tool Use in Live Environments

该论文介绍了 PROVE,这是一个通过结合具有状态的服务器库、依赖引导的数据合成流水线以及一种新型程序化奖励系统,从而在实时环境中实现高效的多步工具使用强化学习的框架,并在多个基准测试和模型族中取得了显著的性能提升。

原作者: Ibrahim Abdelaziz, Asim Munawar, Kinjal Basu, Maxwell Crouse, Chulaka Gunasekara, Suneet Katrekar, Pavan Kapanipathi

发布于 2026-06-03
📖 1 分钟阅读☕ 轻松阅读

原作者: Ibrahim Abdelaziz, Asim Munawar, Kinjal Basu, Maxwell Crouse, Chulaka Gunasekara, Suneet Katrekar, Pavan Kapanipathi

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一名非常聪明但缺乏经验的学徒,如何使用一个巨大的、复杂的工具箱来修理房子里的各种东西。目标不仅仅是让学徒选对工具,还要让他们学会以正确的顺序使用工具、处理错误,并在不知道该怎么做时及时停手。

这篇题为 PROVE 的论文描述了一种新的训练 AI 模型(即“学徒”)的方法,正是为了实现这一目标。作者发现以往的方法之所以失败,主要是因为三个原因,并构建了一个新系统来解决这些问题。

以下是利用简单类比对他们解决方案的拆解:

他们修复的三个问题

  1. “假房子”问题:

    • 旧方法: 大多数训练发生在“模拟器”或静态地图中。这就像是在一张房子的图纸上练习。如果学徒试图打开一扇在图纸中并不存在的门,系统直到很久之后才会意识到错了。
    • 修复方案: PROVE 使用了 实时 MCP 环境 (Live MCP Environments)。想象一下,你是在一个拥有真实水路和电路的真实房子里训练学徒。如果他们尝试打开一个没有灯泡的灯,系统会立即说:“这没起作用。”这种反馈是实时的,且带有真实的后果。
  2. “虚构家具”问题:

    • 旧方法: 在生成练习题时,计算机经常编造虚假的细节。它们可能会要求学徒“移动 404 房间里的红色椅子”,但 404 房间并不存在,也没有红色椅子。学徒会试图执行指令并因此立即失败,因为那个物体根本不是真实的。
    • 修复方案: 他们构建了一个 落地数据流水线 (Grounded Data Pipeline)。在提出问题之前,系统会先检查“房子”里实际存在什么家具。如果 101 房间里有一把红椅子,系统就会问:“移动 101 房间里的红椅子。”这确保了每一个练习任务都是可以完成的。
  3. “话痨”问题:

    • 旧方法: 奖励机制就像一位老师,只有当学生勾选完清单上的每一项时才会给一颗金星。这会鼓励学生变得懒惰,只是机械地调用他们知道的所有工具,希望能撞大运撞到正确的那个,而不是仔细思考。
    • 修复方案: 他们创建了一个 程序化奖励系统 (Programmatic Reward System)。新系统不再仅仅检查是否使用了正确的工具,而是奖励学徒满足以下条件的表现:
      • 有效性 (Validity): 工具是否真的起作用了?
      • 覆盖度 (Coverage): 他们是否完成了所有必要的步骤?
      • 效率 (Efficiency): 他们是否在没有浪费时间或进行多余、不必要调用的情况下完成了任务?(这就是“反话痨”规则)。
      • 精准度 (Precision): 他们是否使用了正确的工具名称和正确的设置?

系统是如何运作的(“教练”)

作者构建了一个“教练”(状态机编排器)来运行训练环节:

  1. 地图: 教练首先绘制一张工具之间如何相互依赖的地图(例如,你必须先“检查余额”,然后才能“转账”)。
  2. 侦察: 教练观察实时环境,寻找可用于问题的真实物品。
  3. 练习: 教练向 AI 提出一个多步骤问题。AI 尝试通过调用工具来解决问题。
  4. 计分卡: 系统不使用另一个 AI 来评分(这样速度慢且昂贵)。相反,它使用代码进行即时检查:“工具运行了吗?它返回了正确的数据吗?你是否使用了过多的步骤?”
  5. 循环: AI 获得分数并再次尝试,从而变得越来越好。

结果

团队在四种不同的 AI 模型(从小型到中型规模)上进行了测试。他们不需要数百万个例子;他们使用了大约 13,000 个高质量的练习环节。

结果令人印象深刻:

  • 模型在解决多步骤问题方面有了显著进步。
  • 他们在三项主要测试(BFCL、τ 2-bench 和 T-Eval)中提升了高达 10 分
  • 至关重要的是,模型学会了高效工作。它们停止了不必要的工具调用,并学会了在信息不足时停下来,而不是盲目猜测。

核心结论

这篇论文证明了,你不需要庞大的专业人工标注团队或一个超级聪明的“裁判 AI”来教机器人如何使用工具。相反,如果你给它们一个真实的练习环境真实的数据以及一个奖励效率的智能评分系统,它们就能非常快速地学会编排复杂的任务。

关键的启示是,在教授 AI 如何在现实世界中使用工具时,训练的质量(真实的场景、真实的奖励) 胜过 数据的数量

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →