Does The Way You Plan Matter? An Empirical Study of Planning Representations for LLM Web Agents
本文介绍了 PlanAhead 框架,通过实证研究证明,自然语言规划表示的选择(例如顺序子目标、叙述、伪代码或清单)以及底层大语言模型均显著影响多模态网络代理在 WebArena 高难度任务上的鲁棒性和成功率。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在雇佣一个非常聪明但略显笨拙的机器人来帮你进行网购。你告诉它:“帮我买一个用于磨牙的夜间护齿器。”这个机器人需要浏览网站、找到商品并完成结账。
有时,机器人能成功。但其他时候,它会陷入死循环、买错东西,或者干脆放弃。
这篇论文提出了一个简单的问题:你撰写指令的方式重要吗?
大多数人认为,如果你给机器人一个清晰、分步的清单(就像食谱一样),效果会最好。但这项研究背后的研究人员却想知道:如果机器人用故事的方式效果更好呢?或者用清单?甚至用计算机代码脚本呢?
以下是他们研究的简要分解,以通俗易懂的方式解释:
1. 问题:机器人会迷路
即使拥有最先进的人工智能大脑,网络代理(浏览互联网的机器人)也常常失败。它们可能会错过关键步骤、被弹窗搞糊涂,或者忘记原本要做什么。研究人员怀疑,它们所接收到的计划的格式才是罪魁祸首。
2. 实验:"PLANAHEAD"厨房
研究人员建立了一个名为PLANAHEAD的测试厨房。他们并没有发明新的机器人,只是改变了他们提供给现有机器人的食谱。
他们选取了 158 项极具挑战性的任务(例如在复杂的网站上购买特定商品),并将这些任务交给不同的人工智能模型。但在机器人开始行动之前,研究人员用四种不同的“语言”之一为它提供计划:
- 食谱(顺序子目标): 标准方式。“第一步:去这里。第二步:点击那个。”
- 故事(叙述): 一段描述旅程的段落。“为了买到夜间护齿器,你应该先搜索……"
- 清单(要求): 一份必须发生的事项列表,但不一定按顺序排列。“购物车里必须有该商品。地址必须填写完整。”
- 代码(伪代码): 带有“如果/那么”规则的逻辑脚本。“如果找到商品,点击购买。如果没找到,再次搜索。”
3. 新的评分标准:超越“通过/失败”
通常,研究人员只统计机器人成功完成任务的次数(成功率)。但人工智能是不可预测的;有时它运气好,有时运气差。
作者发明了两种新的评分机器人表现的方法:
- 达成率 (AR): “如果我们让机器人尝试五次,它是否曾经成功过这项任务?”这衡量了该任务对该机器人来说是否可行。
- 已解决任务一致性 (STC): “如果机器人成功了,它成功的频率有多高?”这衡量了可靠性。它是 100% 的时间都做对,还是只有 20% 的时间做对?
4. 令人惊讶的结果
研究发现,一种方法并不适用于所有情况。 提供指令的“最佳”方式完全取决于你使用的是哪个机器人大脑。
- “讲故事”的机器人: 一个模型(GPT-4.1-mini)在接收到叙述时表现最好。它似乎比枯燥的步骤列表更能理解任务的“故事”。
- “列清单”的机器人: 另一个模型(Qwen)喜欢清单。它非常擅长明确知道需要满足哪些要求,而不管顺序如何。
- “写代码”的机器人: 第三个模型(Gemini)出人意料地在伪代码上表现很好,尽管它并不是写给人类看的。它似乎喜欢逻辑上的“如果/那么”结构。
主要启示:
研究人员还发现,将工作拆分为两个机器人通常比只用一个机器人效果更好。
- 规划者: 一个机器人读取目标并撰写计划(食谱)。
- 执行者: 第二个机器人读取该计划并实际点击按钮。
- 为什么有效: 这就像有一位主厨负责写食谱,而一位副厨负责实际烹饪。主厨不会被切洋葱分心,而厨师也不会被菜单搞糊涂。
5. 结论
论文得出结论,你如何规划至关重要。
如果你希望你的智能体成功,不能只是扔给它一份通用的步骤清单。你必须将计划的格式与你所使用的 AI 模型的个性相匹配。有时故事比清单好;有时清单比故事好。
通过测试这些不同的格式,研究人员表明,仅仅通过改变我们与这些数字代理交流的方式,就能让它们变得更加稳健和可靠。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。