← 最新论文
💻 computer science

WebRetriever: A Large-Scale Comprehensive Benchmark for Efficient Web Agent Evaluation

本文介绍了 WebRetriever,这是一个包含 800 个不同网站上的 1,550 个任务的大规模基准测试,并结合了一种新颖的 NavEval 框架和三种互补的评估协议,旨在通过提供对真实场景中网络智能体性能更全面、更细粒度的评估,来解决现有基准测试的局限性。

原作者: Wei Dong, Tianyu Fu, Zhe Yu, Hanning Wang, Anyang Su, Zhizhou Fang, Yuyang Chen, Shuo Wang, Minghui Wu, Ping Jiang, Zhen Lei, Chenxu Zhao

发布于 2026-07-08
📖 1 分钟阅读☕ 轻松阅读

原作者: Wei Dong, Tianyu Fu, Zhe Yu, Hanning Wang, Anyang Su, Zhizhou Fang, Yuyang Chen, Shuo Wang, Minghui Wu, Ping Jiang, Zhen Lei, Chenxu Zhao

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

大局观:“驾照”难题

想象一下,你正在教一个机器人开车。在过去,研究人员是在一个极其微小、空旷且没有交通、没有行人、也没有天气变化的停车场里测试这些机器人。机器人在这些测试中表现得非常出色。但当你把它们放到真实的公路上,面对施工区域、混乱的标志和激进的驾驶员时,它们立刻就撞车了。

这篇论文指出,目前的“网络智能体”(Web Agents,即为你浏览网页的 AI)测试就像那个空旷的停车场。它们规模太小、过于简单,无法反映真实世界的复杂性。作者构建了一个全新的、庞大的测试集——WebRetriever,旨在观察这些 AI 司机是否真的能应对现实世界的交通。


1. 新的测试赛道:WebRetriever

作者为 AI 智能体创建了一个巨大的障碍赛道。

  • 旧方式: 之前的测试可能只有 4 到 100 个网站。这就像是在一条街道上进行驾驶测试。
  • 新方式 (WebRetriever): 他们构建了一个拥有 800 个不同网站1,550 个特定任务的赛道。
    • 多样性: 它不仅仅是购物。它还包括专业任务,如查看股市、阅读法律文件以及导航政府门户网站。
    • 类比: 如果说旧的测试是在安静的死胡同里进行的驾驶考试,那么 WebRetrievers 就是在高峰时段穿梭于繁忙城市的试驾,其中涉及复杂的交叉路口、单行道和施工绕行。

2. 新的裁判:NavEval

如何给一个机器人司机评分?你不能让一名人类去观察每一次试驾;这既昂贵又缓慢。

  • 旧方式: 之前的自动化裁判就像是一个只看汽车最终照片的裁判。“车是否到达了终点线?”如果是,则通过。但这忽略了一个事实:驾驶员可能为了到达那里而闯了三个红灯或走错了路。
  • 新方式 (NavEval): 作者构建了一个更聪明的裁判,名为 NavEval。NavEval 不仅仅看最终的照片,它更像是一架飞机的黑匣子记录仪
    • 它倾听引擎的声音(网络请求)。
    • 它观察方向盘的动作(点击和操作)。
    • 它检查 GPS 历史记录(访问过的 URL)。
    • 结果: 这个裁判如此准确,以至于它与人类专家的意见一致率达到了 90%。它可以分辨出机器人是“作弊”了,还是真的解开了谜题。

3. 三个难度等级

论文引入了三种不同的测试方式,就像带有递增难度等级的电子游戏:

  • 等级 1:“寻找大门”测试 (Protocol I)

    • 任务: “前往关于‘知情同意’的页面。”
    • 目标: 智能体能否在没有任何帮助的情况下,通过导航找到正确的页面?
    • 现实情况: 即便是这种简单的目标,大多数 AI 智能体也失败了。它们在链接构成的迷宫中迷失了方向。
  • 等级 2:“带地图”测试 (Protocol II)

    • 任务: “前往关于‘知情同意’的页面。”
    • 转折: 这次,我们给智能体一份逐步操作说明书(就像带有语音导航的 GPS)。
    • 结果: 智能体的表现有所提升,但并不完美。它们仍然难以完美地遵循指令,这表明它们需要更多的训练来理解复杂的指令。
  • 等级 3:“全任务”测试 (Protocol III)

    • 任务: “前往该页面,阅读文档,并准确告诉我第三段的内容。”
    • 转折: 仅仅到达页面是不够的。智能体必须阅读、理解并提取特定的信息。
    • 现实情况: 这是智能体真正挣扎的地方。许多智能体虽然能找到页面,却无法阅读细则。这就像一个会停车但看不懂停车罚单的司机。

4. 令人震惊的结果

当作者运行测试时,结果让 AI 行业感到汗颜:

  • 停车场 vs. 高速公路: 在旧的、简单的测试中得分 90% 的智能体,在这个新的、现实的测试中得分低于 20%
  • “到达”陷阱: 仅仅到达正确的网页并不意味着完成了任务。在最难的测试中,智能体完成完整任务(找到页面 + 获取正确答案)的成功率仅为 12% 左右

总结

该论文声称,我们一直以来都高估了 AI 网络智能体的能力,因为我们是在一个“无菌”环境中测试它们。WebRetriever 是一个全新的、大规模且真实的测试场,它表明这些智能体在现实世界中仍然相当笨拙。它们有时能找到正确的门,但经常迷路,并且在到达目的地后阅读细则的能力非常糟糕。

作者还提供了一个全新的、高度准确的“裁判”(NavEval),以便未来我们可以自动测试这些智能体,并在无需人类观察每一个动作的情况下,准确了解它们的表现水平。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →