← 最新论文
💬 NLP

Are Online Skill and Memory Modules Always Worth Their Tokens? A Budget-Constrained Study of Web Agents

这项研究表明,当在固定的 Token 预算下进行评估时,原生 Web 智能体在成功率上往往能达到甚至超过具有记忆和技能模块等在线增强方法的水平,这表明这些模块所表现出的明显优势在考虑到其 Token 开销后往往会消失。

原作者: Sina Hajimiri, Masih Aminbeidokhti, Jose Dolz, Ismail Ben Ayed, Issam H. Laradji, Spandana Gella, Nicolas Gontier

发布于 2026-06-16
📖 1 分钟阅读☕ 轻松阅读

原作者: Sina Hajimiri, Masih Aminbeidokhti, Jose Dolz, Ismail Ben Ayed, Issam H. Laradji, Spandana Gella, Nicolas Gontier

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在雇佣一支侦探团队来解决网站上的一系列谜题(任务)。你有一个严格的预算,用于支付他们“思考时间”(token)的费用。

这篇论文提出了一个简单但令人惊讶的问题:是雇佣一名背着写满笔记、地图和各种工具的沉重背包(记忆与技能)的侦探更好,还是雇佣一名更简单、只需更多时间去观察和独立思考的侦探更好?

研究人员发现,令人惊讶的是,拥有更多时间的简单侦探通常能解决更多的谜题,并且花费更少的钱。

以下是他们研究结果的详细拆解,使用了日常生活的类比:

1. “背包” vs. “额外的一小时”

  • 增强型智能体(那个背包): 一些研究人员一直在构建带有“背包”的智能体。这些背包包含:
    • 技能: 预先写好的脚本(比如如何买票的“小抄”)。
    • 记忆: 来自以往案件的笔记(比如记得登录按钮通常在左边)。
    • 工作流: 解决特定问题的分步指南。
    • 代价: 每当智能体打开背包阅读笔记或使用脚本时,都会消耗金钱(token)。它还会占用大脑的空间,使得执行任务时的实际“思考”过程变得更加拥挤。
  • 原生智能体(那额外的一小时): 研究人员创建了一个没有背包的“纯净版”智能体。相反,他们给了它同样的总预算,但利用这些预算让它能进行更多的步骤(观察更久、点击更多按钮、思考得更深),且没有任何干扰。

结果: 在大多数情况下,拥有额外时间的纯净智能体比背着背包的智能体解决了更多的任务。因为“背包”往往需要太高的携带和开启成本,导致智能体没有足够的资源来完成实际的工作。

2. “作弊”失败的“小抄”

研究调查了三种流行的“背包”方法:

  • AWM(工作流记忆): 就像一名侦探在做过一次“如何买衬衫”后,写下了操作步骤。
  • ASI(技能诱导): 就像一名侦达编写了一个程序来自动化某项任务。
  • ReasoningBank(推理库): 就像一名侦探记录下“什么成功了,什么失败了”的日志。

研究人员发现,这些“小抄”往往会适得其反。

  • “失效地图”问题: 网络环境在不断变化。为某个版本网站编写的技能,如果网站更新了,可能会立即失效。而纯净智能体通过实时观察屏幕,能够自然地进行适应。带着脚本的智能体会试图遵循旧指令,从而导致崩溃。
  • “错误笔记”问题: 智能体有时会把失败尝试的笔记记录下来,并误以为是成功的。随后,它们尝试使用这些错误的笔记,导致更多的失败。
  • “拥挤桌面”问题: 每当智能体阅读背包里的笔记时,它都必须重新阅读整条笔记。这使得“思考”过程变得更慢、更昂贵,留给实际工作的预算也随之减少。

3. “单次运行”的错觉

论文指出,目前评估这些智能体的方式存在一个重大缺陷。

  • 单次运行陷阱: 通常,研究人员运行一次智能体,然后说:“看,它解决了 80% 的任务!”
  • 现实情况: 研究人员进行了三次测试。他们发现结果波动巨大。一个智能体可能因为运气好猜对了而第一次就解决了任务,但在第二次尝试时却失败了。
  • 教训: 你不能信任单次测试运行。这就像根据一名篮球运动员偶然投中一个幸运球的表现,就断定他很有实力一样。你需要看他打很多场比赛,才能看出他是否真的优秀。

4. “并行”优势

还有一个实际的区别:

  • 背包智能体就像一场接力赛。它们必须完成任务 1,才能写下对任务 2 有帮助的笔记。它们必须一个接一个地进行。
  • 纯净智能体则像是一支独立的工人团队。由于它们不依赖于前序任务的笔记,你可以同时派出 10 名智能体去解决 10 个不同的任务。这在现实世界中让它们的速度更快。

核心结论

论文总结道,虽然“技能”和“记忆”在理论上听起来很棒,但对于它们所提供的收益而言,往往增加了过多的成本和复杂性。

如果你有一个固定的预算,通常更明智的做法是给一个有能力的 AI 更多的时间去直接思考和探索,而不是强迫它背着一个沉重且昂贵的预制工具背包。那些“华丽”的智能体在纸面上看起来很好,但当你计算总成本(包括背包的成本)时,简单直接的方法往往胜出。

对未来的关键启示: 在评估 AI 智能体时,我们不应只看它们解决了多少任务。我们需要统计它们所做的一切(包括其记忆和工具)的总成本,并且要多次运行测试,以确保结果是真实的,而非仅仅是运气。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →