← 最新论文
💬 NLP

PEARL: Plan Exploration and Adaptive Reinforcement Learning for Multihop Tool Use

PEARL 是一个新颖的两阶段框架,它将离线工具探索与在线群体相对策略优化(GRPO)相结合,显著增强了大语言模型在复杂多跳工具使用中的规划与执行能力,并在 ToolHop 基准测试上实现了 56.5% 的新最先进成功率。

原作者: Qihao Wang, Mingzhe Lu, Jiayue Wu, Yue Hu, Yanbing Liu

发布于 2026-01-29
📖 1 分钟阅读☕ 轻松阅读

原作者: Qihao Wang, Mingzhe Lu, Jiayue Wu, Yue Hu, Yanbing Liu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你有一个非常聪明、博学多才的助手(一个大语言模型),它对世界了如指掌,但从未亲自动手做过任何事。它可以滔滔不绝地谈论如何修理汽车或烘焙蛋糕,但如果你要求它实际使用扳手或烤箱,它可能会猜错工具、转错方向,或者尝试使用一个根本不存在的工具。

这篇论文介绍了一种名为 PEARL 的全新训练方法,旨在将这种“只会空谈”的助手转变为一个在需要使用一系列数字工具(如 API)来解决复杂问题时,能够可靠“执行任务”的行动派。

以下是 PEARL 的工作原理,通过简单的概念进行拆解:

问题所在:会“白日做梦”的助手

目前的 AI 助手在处理多步骤任务时经常表现挣扎。如果问它们:“找一个公园,然后找出是谁建造了它,再计算他们名字中的字母数量”,它们通常会:

  1. 忘记计划: 在完成第一步后就迷失了方向。
  2. 幻觉: 凭空捏造不存在的工具。
  3. 犯错: 使用了正确的工具,但设置错误(比如试图用锤子去开门)。
  4. 放弃: 如果犯了错,它们不知道如何修复,只会原地打转。

解决方案:PEARL 的两阶段训练

PEARL 通过将训练分为两个截然不同的阶段来解决这个问题,就像在让飞行员驾驶飞机前先进行飞行员培训一样。

第一阶段:“游乐场”(离线工具探索)

在 AI 真正尝试解决用户的现实问题之前,它会进入一个安全、受控的“游乐场”。

  • 类比: 想象一位从未下过厨的厨师。在为顾客上菜之前,他会在厨房里花好几个小时去触摸每一个锅具、平底锅和香料。他尝试打开和关闭炉灶,搅拌食材,并观察如果操作错误会发生什么。
  • PEARL 的做法: AI 会主动通过试错的方式尝试使用每一个可用工具。它学习如何精准地握住“扳手”(工具),以及如果转错方向会发生什么。这建立了一个“心理使用手册”,这样当它真正开始工作时,就不会手忙脚乱或发明假工具。

第二阶段:“将军”(利用强化学习进行战略规划)

一旦 AI 知道如何使用工具,它就需要学习如何规划一系列动作。

  • 类比: 想象一位国际象棋选手。仅仅知道棋子的走法(第一阶段)是不够的;你需要知道赢下比赛的策略。
  • 创新之处: PEARL 使用了一种特殊的训练方法——强化学习(具体为 GRPO)。
    • 系统不仅仅是在任务结束时说“做得好”或“做得不好”,而是会在 AI 计划的每一步都给它一份“计分卡”。
    • 如果 AI 出于正确的理由使用了正确的工具,它就会得到分数。如果它跳过了步骤或选错了工具,就会失去分数。
    • 这教会了 AI 预判下一步,并在开始行动之前制定出一份完美的“蓝图”。

结果:超级可靠的智能体

论文在两个极具挑战性的基准测试(ToolHop 和 T-Eval)上测试了该方法,这些测试要求 AI 必须串联使用多个工具来回答问题。

  • 得分: PEARL 实现了 56.5% 的成功率,创下了新的纪录(达到 SOTA 顶尖水平)。
  • 对比: 它击败了规模更大、成本更高的模型(如 GPT-4o)以及仅通过标准训练进行“记忆”的模型。
  • 可靠性: 它在实际调用工具时的错误率极低(仅为 3.8%),证明了“游乐场”训练确实有效。

为什么这很重要

论文声称,PEARL 通过分离“规划”与“执行”解决了这两者的矛盾。它训练了一个专门的“规划者”(Planner)来进行战略思考,以及一个已经成为工具使用专家的“执行者”(Executor)。

最令人兴奋的发现是,这个规划者制定计划的能力如此之强,以至于如果你将它的计划交给其他强大的 AI 模型,那些模型处理任务的能力也会随之大幅提升。这就像拥有一位天才将军,他能写出精妙的作战计划,让任何士兵——无论经验多么匮乏——都能遵循计划并赢得战争。

简而言之: PEARL 教会 AI 先在沙盒中练习使用工具,以免弄坏它们,然后再教会它如何在开始游戏之前,制定出一套完美的逐步行动计划。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →