← 最新论文
🤖 AI

Online Skill Learning for Web Agents via State-Grounded Dynamic Retrieval

本文提出了状态锚定动态检索(State-Grounded Dynamic Retrieval, SGDR),这是一种在线技能学习方法,通过一种能将技能动态匹配至任务目标及当前网页状态的机制,实现逐步的技能复用,从而增强了网络智能体,并在 WebArena 基准测试中表现优于静态检索基准。

原作者: Jiaxi Li, Ke Deng, Yun Wang, Jingyuan Huang, Yucheng Shi, Qiaoyu Tan, Jin Lu, Ninghao Liu

发布于 2026-06-04
📖 1 分钟阅读☕ 轻松阅读

原作者: Jiaxi Li, Ke Deng, Yun Wang, Jingyuan Huang, Yucheng Shi, Qiaoyu Tan, Jin Lu, Ninghao Liu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个机器人如何在互联网上导航,去完成诸如预订机票、填写表格或在论坛上寻找特定帖子等任务。这个机器人是一个“网页智能体”(web agent)。

问题在于,互联网是混乱且不断变化的。机器人可能知道如何开始一项任务,但一旦它点击了一个按钮并跳转到一个新页面,旧的指令可能就不再适用了。

这篇论文介绍了一种教导这些机器人的新方法,称为 SGDR(状态锚定的动态检索,State-Grounded Dynamic Retrieval)。以下是它的工作原理,通过简单的解释如下:

问题所在:“一劳永逸”式的指令

把传统的方法想象成在旅程开始时给机器人一张单一、静态的地图

  • 旧方法: 你告诉机器人,“去商店买牛奶。”机器人根据这句话从记忆中挑选出一个“购物技能”,然后就一直沿用这个技能直到结束。
  • 缺陷: 如果机器人走进商店发现布局变了,或者它卡在了乳制品区,那张最初的地图就派不上用场了。机器人会陷入困境,因为它无法根据自己当前实际所处的位置来更新策略。这就像是试图用一张十年前的地图,在一部全新的建筑里进行导航。

解决方案:“智能 GPS”法

作者提出的 SGDR 就像是一个智能 GPS,它会根据你当前的位置和交通状况,每隔几秒钟就更新一次路线。

SGDR 使用了以下三个主要技巧:

1. 将任务拆分为“章节”(滑动窗口提取)

SGDR 不会将整个旅程保存为一个巨大的、僵化的故事,而是将其拆分为细小的、可复用的**“章节”**。

  • 类比: 想象你在学习烤蛋糕。你不是把整个食谱作为一个巨大的文本块来记忆,而是学习具体的“动作”:“如何打蛋”、“如何拌入面粉”以及“如何检查是否烤好”。
  • 工作原理: 当机器人成功完成一项任务时,它会回顾自己做了什么,并将过程切分成这些细小的、可复用的“动作”(子程序)。这使得它以后即使在执行不同的烘焙任务时,也能精准抓取“打蛋”这个动作。

2. “双语”技能卡(文本-代码表示)

机器人学习到的每一个“动作”都存储为一张两部分的卡片

  • 部分 A(描述): 一句简单的纯英文句子(例如,“点击登录按钮”)。这有助于机器人找到正确的卡片。
  • 部分 B(代码): 执行该动作所需的实际计算机指令。
  • 重要性: 这确保了机器人不仅是在“读”要做什么,它还拥有立即执行该动作的实际工具。

3. “上下文感知”搜索(状态锚定的动态检索)

这是最重要的一部分。每当机器人采取一步行动时,它不仅会问:“我的目标是什么?”它还会问:“我现在在哪里?”

  • 旧方法: “我需要买牛奶。” -> 检索“去杂货店”技能。(停止思考)。
  • SGDR 的方式:
    • 第 1 步: “我需要买牛奶。” -> 检索“去杂货店”。
    • 第 2 步: (机器人到达商店)。“我现在在门口,门锁着。” -> 检索“开门”技能。
    • 第 3 步: (机器人进入店内)。“我在乳制品区。” -> 检索“拿起牛奶”技能。

机器人会根据它当前看到的网页,而不仅仅是原始目标,不断重新评估其“技能库”。

结果:有效吗?

研究人员在一个名为 WebArena 的现实网页模拟环境中测试了它(该环境包含购物网站、管理面板、论坛等)。

  • 更高的成功率: 使用 SGDR 的机器人比使用旧有“静态地图”方法的机器人解决了更多的任务。
    • 使用强大的 AI 模型(GPT-4.1)时,成功率比之前最好的方法提升了约 10%
    • 使用更小、更高效的模型时,也实现了 10% 的提升。
  • 更快的执行速度: 机器人不仅成功率更高,而且完成任务所需的步骤更少。因为它能立即抓取正确的“动作”,所以不必浪费时间去猜测或尝试错误的行动。

总结

论文认为,要让机器人精通网页操作,它们不能仅仅依赖于开始时制定的计划。它们需要能够观察当前处境,找到符合该特定时刻的特定“动作”,并执行它。SGDR 是让它们实现这一目标的系统,它将僵化的、一次性的计划转变为灵活的、循序渐进的指南,随着旅程的展开不断进行调整。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →