← 最新论文
🤖 machine learning

Does The Way You Plan Matter? An Empirical Study of Planning Representations for LLM Web Agents

本文介绍了 PlanAhead 框架,通过实证研究证明,自然语言规划表示的选择(例如顺序子目标、叙述、伪代码或清单)以及底层大语言模型均显著影响多模态网络代理在 WebArena 高难度任务上的鲁棒性和成功率。

原作者: Alejandra Zambrano, Sara Vera Marjanovic, Imene Kerboua, Xing Han Lù, Leila Kosseim

发布于 2026-05-29
📖 1 分钟阅读☕ 轻松阅读

原作者: Alejandra Zambrano, Sara Vera Marjanovic, Imene Kerboua, Xing Han Lù, Leila Kosseim

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在雇佣一个非常聪明但略显笨拙的机器人来帮你进行网购。你告诉它:“帮我买一个用于磨牙的夜间护齿器。”这个机器人需要浏览网站、找到商品并完成结账。

有时,机器人能成功。但其他时候,它会陷入死循环、买错东西,或者干脆放弃。

这篇论文提出了一个简单的问题:你撰写指令的方式重要吗?

大多数人认为,如果你给机器人一个清晰、分步的清单(就像食谱一样),效果会最好。但这项研究背后的研究人员却想知道:如果机器人用故事的方式效果更好呢?或者用清单?甚至用计算机代码脚本呢?

以下是他们研究的简要分解,以通俗易懂的方式解释:

1. 问题:机器人会迷路

即使拥有最先进的人工智能大脑,网络代理(浏览互联网的机器人)也常常失败。它们可能会错过关键步骤、被弹窗搞糊涂,或者忘记原本要做什么。研究人员怀疑,它们所接收到的计划的格式才是罪魁祸首。

2. 实验:"PLANAHEAD"厨房

研究人员建立了一个名为PLANAHEAD的测试厨房。他们并没有发明新的机器人,只是改变了他们提供给现有机器人的食谱

他们选取了 158 项极具挑战性的任务(例如在复杂的网站上购买特定商品),并将这些任务交给不同的人工智能模型。但在机器人开始行动之前,研究人员用四种不同的“语言”之一为它提供计划:

  • 食谱(顺序子目标): 标准方式。“第一步:去这里。第二步:点击那个。”
  • 故事(叙述): 一段描述旅程的段落。“为了买到夜间护齿器,你应该先搜索……"
  • 清单(要求): 一份必须发生的事项列表,但不一定按顺序排列。“购物车里必须有该商品。地址必须填写完整。”
  • 代码(伪代码): 带有“如果/那么”规则的逻辑脚本。“如果找到商品,点击购买。如果没找到,再次搜索。”

3. 新的评分标准:超越“通过/失败”

通常,研究人员只统计机器人成功完成任务的次数(成功率)。但人工智能是不可预测的;有时它运气好,有时运气差。

作者发明了两种新的评分机器人表现的方法:

  • 达成率 (AR): “如果我们让机器人尝试五次,它是否曾经成功过这项任务?”这衡量了该任务对该机器人来说是否可行。
  • 已解决任务一致性 (STC): “如果机器人成功了,它成功的频率有多高?”这衡量了可靠性。它是 100% 的时间都做对,还是只有 20% 的时间做对?

4. 令人惊讶的结果

研究发现,一种方法并不适用于所有情况。 提供指令的“最佳”方式完全取决于你使用的是哪个机器人大脑。

  • “讲故事”的机器人: 一个模型(GPT-4.1-mini)在接收到叙述时表现最好。它似乎比枯燥的步骤列表更能理解任务的“故事”。
  • “列清单”的机器人: 另一个模型(Qwen)喜欢清单。它非常擅长明确知道需要满足哪些要求,而不管顺序如何。
  • “写代码”的机器人: 第三个模型(Gemini)出人意料地在伪代码上表现很好,尽管它并不是写给人类看的。它似乎喜欢逻辑上的“如果/那么”结构。

主要启示:
研究人员还发现,将工作拆分为两个机器人通常比只用一个机器人效果更好。

  • 规划者: 一个机器人读取目标并撰写计划(食谱)。
  • 执行者: 第二个机器人读取该计划并实际点击按钮。
  • 为什么有效: 这就像有一位主厨负责写食谱,而一位副厨负责实际烹饪。主厨不会被切洋葱分心,而厨师也不会被菜单搞糊涂。

5. 结论

论文得出结论,你如何规划至关重要。
如果你希望你的智能体成功,不能只是扔给它一份通用的步骤清单。你必须将计划的格式与你所使用的 AI 模型的个性相匹配。有时故事比清单好;有时清单比故事好。

通过测试这些不同的格式,研究人员表明,仅仅通过改变我们与这些数字代理交流的方式,就能让它们变得更加稳健和可靠。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →