← 最新论文
🤖 AI

Training the Orchestrator: A Supervised Approach to End-to-End PDDL Planning with LLM Agents

本文介绍了 HALO,一种混合型智能体学习编排器,它利用经验证器认证的细化轨迹来训练一个用于端到端 PDDL 规划的小型、高性价比策略,在实现与前沿大语言模型相当的成功率的同时,将编排成本降低了一个数量级以上。

原作者: Rajesh Mangannavar, Zachary Coalson, Pranay Dugar, Prasad Tadepalli

发布于 2026-06-23
📖 1 分钟阅读☕ 轻松阅读

原作者: Rajesh Mangannavar, Zachary Coalson, Pranay Dugar, Prasad Tadepalli

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是该论文的解释,使用了简单的语言和日常类比。

核心问题: “翻译官”瓶颈

想象一下,你想组装一件复杂的家具。你有一个粗略的草图和一份用普通英语编写的想法清单(自然语言)。然而,真正负责制造家具的机器(经典规划器)只理解一种非常严格、机械化的代码,叫做 PDDL

如果你要求普通的 AI(大语言模型或 LLM)来编写这段代码,它经常会出错。它可能会凭空捏造不存在的零件,或者忘记列出螺丝,或者写出机器无法读取的指令。

为了解决这个问题,研究人员创建了一个“维修团队”。他们有一个经理(编排器/Orchestrator),负责观察破碎的代码,并雇佣一个专家(智能体/Agents)团队来修复特定的错误。一位专家负责修复语法,另一位负责逻辑,还有一位检查零件是否匹配。

难点在于: 在旧系统中,经理是一个极其昂贵的高端 AI(比如 GPT-5 或 Gemini)。每当团队需要修复一个错误时,你都必须支付高额费用给经理,请他思考问题并挑选下一个专家。如果一个项目需要 10 个步骤来修复,你就得付 10 次经理的费用。这使得整个过程对于小型实验室或本地计算机来说成本过高。

解决方案:HALO(实习生经理)

该论文的作者 Rajesh Mangannavar 及其团队提出了疑问:“我们真的需要在每一步都使用超级昂贵的经理吗?我们能否训练一个便宜的本地实习生来胜任这项工作?”

他们创建了 HALO(混合智能体学习编排器/Hybrid Agent-Learned Orchestrator)。其工作原理包含三个关键技巧:

1. 从“获胜剧本”中学习

通常情况下,训练 AI 是很难的,因为你不知道每一步的“正确答案”是什么。但在该系统中,有一个裁判(验证器/Verifier)来检查最终的家具。

  • 如果最终方案可行,裁判会说:“做得好!”
  • 团队发现:每当裁判说“做得好”时,他们所使用的经理与专家的序列就是一套获胜策略。

他们提取了数千份这样的“获胜剧本”,去掉了昂贵经理的声音,仅保留了记录,即:“当代码看起来像 X 时,获胜团队选择了专家 Y。”他们利用这些数据来训练一个小型、廉价的 AI(HALO),使其模仿这些获胜的决策。

2. “规则手册”捷径

HALO 不仅仅是一个大脑,它还是一个带着“小抄”的大脑。作者意识到,有些决策非常显而易见,甚至不需要人类去思考。

  • 例子: 如果代码为空,规则是“调用紧急处理智能体”。
  • 例子: 如果代码有拼写错误,规则是“调用语法智能体”。
  • 例子: 如果计划完美,规则是“停止”。

HALO 会首先检查这些简单的规则。如果规则适用,它会立即行动,而无需动用它的“大脑”(AI 模型)。只有当问题真正复杂时,HALO 才会使用其训练好的 AI 来做出决策。

3. 更大的工具箱

团队还扩大了专家团队。他们在原有的 13 位专家基础上增加了 8 位,使总数达到 21 位。其中一些新专家是“确定性”的,这意味着它们是运行瞬间且成本为零的简单计算机脚本,而不是昂贵的 AI 模型。这让 HALO 拥有了更多快速解决问题的工具。

结果:更快、更便宜,且同样出色

团队在 11 种不同类型的规划问题(如物流、机器人移动和调度)上测试了 HALO 与昂贵的高端 AI 经理的表现。

  • 成功率: HALO 与昂贵的 AI 表现一样出色,有时甚至更好。它解决问题的成功率与高端 AI 持平。
  • 速度: 由于 HALO 对简单问题使用简单规则,对难题使用小型本地模型,因此它做决策的速度更快。
  • 成本: 这是最大的胜利。
    • 旧方法(使用 GPT-5)每个任务大约花费 0.18 美元
    • HALO 每个任务大约只需 0.004 美元
    • 这大约便宜了 45 倍。 这就像是从为每一餐都聘请一位名厨,转变为聘请一位使用食谱处理简单菜肴的高水平本地厨师。

核心结论

这篇论文证明了,你并不需要一个“超智能”的 AI 来管理一个维修智能体团队。如果你有一个严格的裁判(验证器)能告诉你计划是否成功,你就可以训练一个小型、廉价的 AI 来从这些成功案例中学习。

这使得复杂的规划系统可以在实验室的一台电脑上(甚至是一台笔记本电脑上)运行,而无需在每次做出决策时都支付昂贵的云端 API 费用。它将一项奢侈的服务变成了一个任何人都能在本地运行的工具。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →