← 最新论文
🤖 AI

GTA: Generating Long-Horizon Tasks for Web Agents at Scale

本文介绍了GTA,这是一个可扩展的框架,通过整合爬虫、基于检索的种子生成和自动化验证,自动生成具有可执行轨迹的真实多跳网络代理任务,以克服现有基准测试的局限性并实现稳健的训练与评估。

原作者: Tenghao Huang, Kung-Hsiang Huang, Prafulla Kumar Choubey, Yilun Zhou, Muhao Chen, Jonathan May, Chien-Sheng Wu

发布于 2026-05-29
📖 1 分钟阅读☕ 轻松阅读

原作者: Tenghao Huang, Kung-Hsiang Huang, Prafulla Kumar Choubey, Yilun Zhou, Muhao Chen, Jonathan May, Chien-Sheng Wu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个机器人如何使用互联网。这个机器人拥有大脑(语言模型)和双手(用于点击和输入的工具),但目前它非常笨拙。它能找到简单的答案,比如“法国的首都是什么?”,但在处理复杂任务时却举步维艰,例如“找到飞往东京的最便宜航班,检查酒店是否有游泳池,并确认航班时间是否与我的医生预约相符”。

问题在于,我们一直未能给予这个机器人足够多的“优质”练习。

问题:用一张破损的地图进行训练

目前,针对这些网络机器人的大多数测试,就像给它们一张只有“起点”和“终点”却没有如何到达的指示的地图。

  • 旧基准测试:这些就像人类手工编写的谜题。它们数量稀少,且往往只测试简单的单步任务。
  • 自动尝试:一些研究人员曾尝试让机器人自行探索网站以生成新谜题。但这就像让一个幼儿在商场里闲逛寻找玩具:它们只找到了闪亮且显眼的事物(如玩具店),而忽略了其他部分(如药店或美食广场)。此外,这种方法成本极高且速度缓慢。

正因如此,机器人出现了“过拟合”现象。它们死记硬背了被给予的具体谜题,却无法应对现实世界中混乱的局面——在这些情境中,它们必须跨越不同的页面和网站来解决问题。

解决方案:GTA(“架构师”方法)

作者介绍了GTA(大规模生成网络智能体的长视野任务)。请将 GTA 想象成一位不是分发练习卷的教师,而是一位正在建造训练馆的大师级建筑师

以下是他们构建它所使用的简单步骤:

  1. 爬取(绘制城市地图):GTA 不是让机器人盲目游荡,而是首先派遣一支数字“侦察兵”舰队来绘制整个网站(如电子商务商店、政府网站和新闻门户)的地图。它们构建了包含每个页面及其连接方式的完整“城市地图”。
  2. 种子(挑选挑战):GTA 不是猜测困难任务的样子,而是在地图上随机挑选两个位置(例如,关于特定鞋子的页面和关于特定折扣的页面)。
  3. 生成(编写任务):要求人工智能编写一个任务,该任务必须访问这两个位置才能解决。例如:“查找 A 页面上鞋子的价格,然后检查 B 页面是否有使其更便宜的优惠券。”
  4. 质量控制(裁判):在任务发布之前,严格的裁判会进行检查。
    • 是否可解?(你真的能得到答案吗?)
    • 是否清晰?(是否只有一个正确答案?)
    • 是否多跳?(它是否迫使机器人访问不止一个页面?)
  5. 黄金路径(答案键):至关重要的是,GTA 记录了机器人应该采取的确切路径。这使得研究人员能够完美地重放任务,并确切地看到机器人哪里出错了。

为何这很重要:“人类与机器人”的差距

作者用当前的机器人测试了这个新训练馆,发现了一个巨大的差距:

  • 机器人:面对这些新的多步任务时,机器人大多数时候都失败了(得分通常低于 20%)。它们迷路了、过早放弃,或者试图使用搜索栏而不是正确地导航网站。
  • 人类:当人类尝试相同的任务时,他们轻松解决了问题(成功率达 85%)。
  • 搜索引擎:即使是简单的谷歌搜索也无法解决这些任务,因为答案不在一个地方;它隐藏在不同的页面之间。

GTA 的关键特征

  • 它是一个“活”的训练馆:与那些静态(冻结在时间中)的旧测试不同,GTA 可以持续从实时网站生成新任务。这防止了机器人仅仅死记硬背答案。
  • 它是全球性的:它支持多种语言(英语、意大利语、日语、德语、中文),而不仅仅是英语。机器人在非英语网站上的表现甚至更加糟糕。
  • 它是跨网站的:某些任务要求机器人从一个健康网站跳转到一个金融网站来解决问题,这模拟了真实人们使用互联网的方式。

核心结论

GTA 是一个新的、大规模的、自动化的系统,用于为网络机器人创建逼真的、高难度的训练任务。它证明了当前的机器人在驾驭现实互联网复杂的多步性质方面仍然相当薄弱。通过提供一种生成无尽、高质量且可验证挑战的方法,GTA 帮助研究人员确切地了解机器人失败的原因,从而构建出更好的机器人。

它不是什么

  • 它不是医生或企业现在就可以使用的工具。
  • 它并不声称已经解决了网络智能体的问题;它只是提供了一种更好的测试方法,并展示了还有多少工作要做。
  • 它不涉及需要登录私人账户或进行真实购买的任务(出于安全规则考虑)。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →