← 最新论文
🤖 AI

Where Did It Go Wrong? Process-Level Evaluation of Web Agents with Semantic State Tracking

本文介绍了 WebStep,这是一个具有自动语义状态追踪功能的创新基准测试,旨在实现对网络智能体(web agents)的过程级评估,从而揭示传统基于结果的指标无法捕捉到的、关于特定技能缺陷和错误类型的细粒度且具可操作性的见解。

原作者: Jiwan Chung, JiHyuk Byun, Vibhav Vineet, Seon Joo Kim

发布于 2026-06-16
📖 1 分钟阅读☕ 轻松阅读

原作者: Jiwan Chung, JiHyuk Byun, Vibhav Vineet, Seon Joo Kim

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在雇佣一名私人助理来为你跑腿办事,比如在网上买一件特定的衬衫,或者预订一张机票。

旧方法:“他们做到了吗?”测试
目前,大多数针对 AI 网络智能体(Web Agent)的测试就像老师通过只看最终答案来给学生的作业评分一样。

  • 场景: 你要求两名助理寻找一封来自“David”的特定邮件并将其加星标。
  • 助理 A 立即找到了正确的邮件并进行了加星标操作。(通过)
  • 助理 B 迷路了,打开了错误的邮件,感到困惑,但最终还是偶然找到了正确的邮件并进行了加星标操作。(通过)
  • 助理 C 找到了正确的邮件,但却不小心点击了“删除”而不是“加星标”。(失败)

在旧系统中,助理 A 和助理 B 得到了相同的成绩:100%。但助理 B 表现得一团糟,而助理 C 虽然差一点点就成功了,却犯了一个微小的错误。旧系统无法告诉你他们为什么失败,也无法告诉你如何帮助他们改进。这就像是在说,“你得到了正确答案,所以你是天才,”却忽略了那个天才其实是在随机猜测,而另一个学生是真的理解了数学题。

新方法:“GPS 追踪器”(WEBSTEP)
这篇论文介绍了一个名为 WEBSTEP 的新基准测试。你可以把这想象成给每个 AI 智能体配备了一个 GPS 追踪器,它不仅记录它们最终到达了哪里,还记录了它们走的每一步。

WEBSTEP 不仅仅是检查最终结果,它还构建了一个网站的“数字孪生”。当 AI 在屏幕上点击按钮和输入内容时,系统会在后台秘密地记录这些行为的“含义”:

  • AI 是否知道进行搜索 (Search)
  • 它是否知道利用筛选 (Filter) 功能来缩小范围?
  • 它是否知道在购买前查看 (Inspect) 商品详情?
  • 它是否知道进行提交 (Commit)(点击最后的“购买”或“加星标”按钮)?

他们的发现
通过观察不同 AI 模型的“GPS 轨迹”,研究人员发现了一些旧有的“通过/失败”测试所忽略的惊人现象:

  1. “勇敢但笨拙” vs. “谨慎但缓慢”:
    两个 AI 模型可能拥有完全相同的成功率(例如 32%)。但当你查看 GPS 时,你会发现一个模型实际上非常擅长探索(找到正确的物品),但在执行(点击正确的按钮)方面表现糟糕。而另一个模型擅长点击按钮,却很容易迷失方向。旧的测试将它们视为完全相同的模型;新的测试则能看出它们需要完全不同的训练。

  2. 特定的弱点:
    某个 AI 可能精通筛选(寻找最便宜的商品),但在查看(检查商品是否有保修)方面表现很差。另一个 AI 则可能恰恰相反。新系统可以指出:“嘿,这个 AI 擅长搜索,但它总是跳过查看详情这一步。”这就像教练告诉一名跑步者:“你的起跑很棒,但你在最后的栏架处绊倒了”,而不是仅仅说:“你输掉了比赛。”

  3. “走错路”的瞬间:
    系统可以精准定位 AI 何时偏离了轨道。它是打开了错误的门?是在过早购买错误的商品?还是陷入了死循环?这有助于开发人员明确知道 AI 大脑的哪个部分需要修复。

  4. 更难的任务揭示真实水平:
    在简单的任务中,所有的 AI 看起来都差不多。但随着任务难度增加(例如在数百个极其相似的商品中寻找特定的一件),差异就会爆发式增长。最好的 AI 会保持冷静并遵循地图,而其他的则会迷失在人群中。

底线
这篇论文认为,我们不能仅仅根据 AI 网络智能体最终是否“成功”来评判它们。就像教练不仅仅是看记分牌一样,我们也需要观察整个比赛过程。WEBSTEP 提供了观察比赛、发现具体错误并为 AI 智能体提供所需针对性指导的工具。它将一个简单的“通过/失败”成绩单,变成了一份详细的成绩报告,准确地告诉你智能体在哪里出了错,以及如何修复它。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →