GATS: Graph-Augmented Tree Search with Layered World Models for Efficient Agent Planning
该论文介绍了 GATS,这是一个通过分层世界模型和基于 UCB1 的树搜索来取代昂贵的 LLM 推理的规划框架,旨在实现多样化复杂任务下的 100% 成功率以及确定性的零调用规划,其性能显著优于 LATS 和 ReAct 等现有方法。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下你正在试图解决一个巨大的、棘手的迷宫。你有一个超级聪明的伙伴(一个大型语言模型,简称 LLM)可以和你交谈并建议你该往哪转弯。但这里有个限制:每当你向你的伙伴寻求建议时,他们都必须进行长时间的午睡来思考,而且有时当你询问同一个问题时,他们的回答也会有所不同。如果迷宫中有死胡同或者需要长序列的转向,每一步都向你的伙伴求助会变得既昂贵又混乱。
这就是研究人员 Maureese Williams 和 Dymitr Nowicki 用他们的系统 GATS(图增强树搜索)所解决的问题。他们找到了一种极其高效的导航方式,几乎不需要唤醒他们的超级聪明伙伴。
旧方法:“每步一问”法
以往的方法,比如 ReAct 和 LATS,有点像是一个徒步旅行者在每一个岔路口都会停下来问向导:“我该往哪走?”
- ReAct 只是问一次然后就出发。它很快,但经常会走进死胡同。在测试中,这种方法在这些棘手的迷宫场景中仅有 64% 的成功率。
- LATS 更聪明一些;它先询问向导,然后针对下一步再次询问,再询问下一步,从而构建出一棵可能性的树。但因为它需要为树上的每一个分支都询问向导(LLM),所以它会变得很累且成本很高。在测试中,LATS 的成功率为 92%,但它在每个任务中需要询问向导大约 37 次。此外,因为向导有时会随机猜测,如果你两次尝试同一个迷宫,你可能会得到不同的路径。
新方法:GATS(“制图者”策略)
GATS 改变了游戏规则。GATS 不再为每一次转向都询问向导,而是使用一个分层世界模型(Layered World Model)来构建自己的内部地图。你可以把这张地图看作拥有三个知识层:
- 第一层(精确规则手册): 对于系统已经完全掌握的行为(例如“如果我按下这个按钮,门就会打开”),它使用简单的、即时的检查。无需思考。这就像知道 2+2 永远等于 4。
- 第二层(经验日志): 如果系统以前见过某个行为发生,但没有完美的规则,它会检查自己的旅行日记。“上次我这样做时,成功了 9/10 次。”这是从数据中学习到的,而不是靠猜测。
- 第三层(超级天才伙伴): 只有当系统遇到全新的、未知的事务时,才会唤醒 LLM 向导。但神奇之处在于:一旦向导给出了答案,GATS 就会将答案记录在地图中。下次遇到相同的情况时,G只看地图即可。它永远不会再为那个特定的事物询问向导。
结果:速度、确定性与成功率
研究人员在 100 个合成规划任务上测试了它,这些任务设计得非常复杂,具有分支路径和死胡同。
- GATS 达到了 100% 的完美成功率。
- LATS 为 92%。
- ReAct 为 64%。
但真正的关键点是?GATS 在实际规划这些任务期间零次调用 LLM。它完全利用自己的地图和规则完成了所有思考。因为它不依赖于 LLM 的随机猜测,所以 GATS 每次运行都能产生完全相同的完美计划。它的方差为零。
他们还进行了大规模的“压力测试”,涵盖了 120 个任务,分布在 12 个困难类别中,如编码工作流、预订机票和复杂的迷宫导航。
- GATS 依然保持了 100% 的成功率。
- LATS 降至 88.9%。
- ReAct 则大幅跌落至 23.9%。
为什么有效(秘诀所在)
论文指出,GATS 之所以获胜,是因为它使用了系统化搜索(称为 UCB1),而不是随机猜测。想象一个侦探在有条不紊地检查每一个线索,而不是仅仅凭直觉行动。
- 系统化 vs. 随机性: LATS 依赖 LLM 来猜测哪条路径看起来更好。如果 LLM 的“直觉”错了,整个计划就会失败。GATS 系统地检查所有选项,确保不会仅仅因为向导那天状态不好就错过了正确的路径。
- 确定性 vs. 随机性: 因为 GATS 在大多数步骤中都使用自己的地图,所以结果始终是一致的。而依赖 LLM 的 LATS,如果你两次运行同一个任务,它可能会给你不同的答案。
这意味着什么(以及它不意味着什么)
作者非常明确地说明了他们成功的局限性。这些结果是基于模拟和合成任务的,在这些受控环境中,游戏的规则(“动作规范”)是预先已知的。在这些受控环境中,GATS 是冠军。
然而,论文明确排除了 GATS 目前是解决一切问题的“万灵药”这一观点。如果你把 GATS 扔进一个完全荒野、开放式、没有任何规则或过去日志可供学习的世界,它将不得不更多地依赖 LLM(第三层),这会使其变慢且效率降低。作者建议,为了让 GATS 在现实世界中大放异彩,我们需要先建立更好的地图(世界模型),例如通过学习人类如何实际使用工具的日志。
简而言之,这篇论文表明,对于可以定义规则的规划任务,我们不需要在每一步都向超级智能 AI 求助。我们可以构建一张智能的、自动更新的地图,从而以 100% 的成功率、零成本和零混乱来应对复杂的难题。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。