← 最新论文
🤖 AI

PIVOT: Bridging Planning and Execution in LLM Agents via Trajectory Refinement

PIVOT 是一种自监督框架,它通过规划、检查、演化和验证的四阶段流程,迭代优化候选轨迹,从而弥合大语言模型智能体中规划与执行之间的鸿沟,在显著降低计算成本的同时实现了最先进的性能。

原作者: Tuo Zhang, Alin-Ionut Popa, Yan Xu, Rui Song, Dimitrios Dimitriadis

发布于 2026-05-13
📖 1 分钟阅读☕ 轻松阅读

原作者: Tuo Zhang, Alin-Ionut Popa, Yan Xu, Rui Song, Dimitrios Dimitriadis

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是关于PIVOT论文的解析,将其拆解为简单的概念和日常类比。

核心问题:“白日梦厨师”

想象你雇佣了一位非常聪明的厨师(AI 智能体)为晚宴烹饪一顿复杂的多道式大餐。

  • 计划: 厨师坐下来,写下一份精美详尽的菜单,并列出所需的所有食材。在纸面上看起来完美无缺。
  • 现实: 当厨师开始烹饪时,他们发现没有所需的特定鱼类、烤箱坏了,或者忘了买酒。由于他们没有在烹饪过程中检查厨房,他们仍然坚持执行原始计划。结果呢?一顿烧焦的饭菜,或者一道与订单不符的菜肴。

在 AI 领域,这被称为计划与执行错位。AI 制定了一个出色的计划,但当它尝试进行实际工作(如搜索网络或预订航班)时,会遭遇其未预料到的障碍。它没有停下来修正计划,而是继续执行,导致错误不断累积,直到整个任务失败。

解决方案:PIVOT(计划–检查–演化轨迹)

作者们创建了一个名为PIVOT的新系统来解决这个问题。不要把 PIVOT 想象成一个只是烹饪速度更快的厨师,而要把它想象成一个聪明的副厨,不断检查工作并帮助主厨实时调整。

PIVOT 的工作流程分为四个简单的步骤,形成一个循环:

1. 计划(蓝图)

在 AI 接触任何工具(如搜索引擎或计算器)之前,它必须编写一个结构化的计划。

  • 类比: 这就像厨师在去杂货店之前,确切地写下需要购买什么以及购买的顺序。他们必须思考可能会出现什么问题(例如:“如果商店没有三文鱼,我就买鳟鱼代替”)。

2. 检查(试味)

随着 AI 逐步执行计划,它会暂停并检查:“这真的起作用了吗?”

  • 类比: 想象厨师在每一步之后都品尝酱汁。如果酱汁太咸,他们不会等到用餐结束才意识到。他们会立即发现错误。
  • 神奇之处: 如果出现问题,PIVOT 不会只说“错误”。它像侦探一样,从错误处向后追溯,找出计划偏离正轨的确切时刻。它会问:“为什么会失败?”以及“是哪一步导致了这个问题?”

3. 演化(转向)

一旦找到错误,AI 不会扔掉整顿饭。它只修复损坏的部分。

  • 类比: 如果厨师发现鱼变质了,他们不会烧掉整个厨房并重新开始。他们会将鱼换成另一种蛋白质,但保留开胃菜和沙拉完全不变。
  • 工作原理: AI 保留计划中有效的部分(“已验证的前缀”),并重写仅失败的部分(“未支持的后续部分”)。它利用“试味”反馈来指导这次重写。

4. 验证(最终质量检查)

在提供最终答案之前,AI 会根据原始规则进行最后一次检查。

  • 类比: 在服务员将食物端上桌之前,主厨最后一次核对订单:“我们包含素食选项了吗?摆盘对吗?我们忘了餐巾吗?”这确保了在匆忙中没有遗漏任何细节。

为什么这比其他方法更好?

其他 AI 方法通常试图通过以下方式修复错误:

  • 更努力地尝试: 只是给 AI 更多思考时间(这往往导致更混乱的思考)。
  • 从头开始: 如果某一步失败,他们就扔掉整个计划,从头开始尝试(浪费时间和金钱)。
  • 过于僵化: 使用不适合特定问题的严格检查清单。

PIVOT 的不同之处在于:

  1. 它是手术式的: 它只修复损坏的部分,节省时间和精力。
  2. 它从混乱中学习: 它利用实际失败来创建“文本梯度”(一种对如何修复错误的具体指令的 fancy 说法),而不是仅仅猜测。
  3. 它是高效的: 论文声称,PIVOT 使用比其他方法少3 到 5 倍的“令牌”(AI 用于思考和交流的货币)就能获得相同或更好的结果。这就像用一半的杂货账单获得一顿完美的饭菜。

结果

研究人员在两类困难任务上测试了 PIVOT:

  1. 旅行与购物: 规划带有严格规则(预算、日期、特定酒店)的复杂行程。
  2. 一般问题: 使用工具解决开放式问题。

发现:

  • 有人类协助: 如果 AI 陷入困境时有人类提供反馈,与标准方法相比,PIVOT 可以将成功率提高高达94%
  • 无人协助: 即使 AI 必须自行修复(自主运行),其表现仍远优于其他 AI 智能体,通常显著超越它们。
  • 成本: 它在实现这些结果的同时,使用的计算能力比竞争对手少得多。

总结

PIVOT 是一个框架,教导 AI 智能体制定计划、检查工作、仅修复损坏部分,并双重检查最终结果。它阻止 AI 盲目遵循糟糕的计划,转而帮助它们动态适应,使它们更可靠、更高效,并具备处理复杂现实世界任务的能力。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →