← 最新论文
💬 NLP

Scalable Behaviour Cloning on Browser Using via Skill Distillation

本文提出了一种通过将人类交互轨迹蒸馏为组织在技能图谱中的紧凑且可检索的自然语言技能,从而训练浏览器智能体的一种可扩展方法,旨在利用现有的用户数据来克服决策瓶颈,而非依赖于人工设计的任务。

原作者: Kaisen Yang, Zheng Jiang, Yuzhao Peng, Houde Qian, Boshi Zhang, Youjie Zheng, Shijin Hong, Qingle Liu, Ruoyu Han, Bohan Lyu, Bingxiang He, Eren Cai, Calvin Xiao, Qinhuai Na

发布于 2026-07-01
📖 1 分钟阅读☕ 轻松阅读

原作者: Kaisen Yang, Zheng Jiang, Yuzhao Peng, Houde Qian, Boshi Zhang, Youjie Zheng, Shijin Hong, Qingle Liu, Ruoyu Han, Bohan Lyu, Bingxiang He, Eren Cai, Calvin Xiao, Qinhuai Na

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在试图教一个机器人如何使用网络浏览器。你可以给机器人看一段视频,展示人类如何在特定的表单上点击“提交”,机器人可能会学会点击那个精确的点。但一旦网站的布局发生变化,或者按钮向左移动了两英寸,机器人就会失败。这就像是通过背诵某辆特定汽车方向盘的确切位置来教人开车;如果他们换了一辆车,就会撞车。

这篇名为 BrowserBC 的论文指出,问题并不在于机器人不会点击按钮或输入字母。问题在于它们不知道下一步该做什么,当它们迷失方向时。它们缺乏“决策先验”(decision priors)——即人类在浏览网站时所具备的那种直觉或常识。

以下是作者如何解决这一问题的,他们使用了简单的类比:

1. 问题所在:机器人是“失忆症患者”

目前的 AI 智能体就像从未去过某个城市的游客。它们能看到路标(网页),也能行走(点击和输入),但它们不知道捷径在哪里,不知道哪里是死胡同,也不知道如何识别自己是否已经到达了目的地。它们最终会在原地打转,尝试各种随机的操作直到碰巧成功。

作者说,我们有一个巨大的、尚未开发的资源来解决这个问题:人类已经度过的数十亿小时的互联网浏览时间。 每当人类成功填写一个表单或找到一件商品时,他们都会留下旅程的“痕迹”。

2. 解决方案:将“足迹”转化为“说明书”

该论文提出了一种称为技能蒸馏(Skill Distillation)的系统。它不是保存人类点击按钮的原始视频(因为这太杂乱且具有时效性),而是将这些行为转化为自然语言技能(Natural Language Skills)

可以这样理解:

  • 原始痕迹: 一个人在从家走到杂货店的过程中,停在红灯前,被地上的裂缝绊了一下,然后买了一盒牛奶的视频。这太具体了。如果明天路封了,这个视频就毫无用处。
  • BrowserBC 技能: 一张写好的食谱卡片,上面写着:“购买牛奶:前往商店,找到乳制品柜台,拿起一盒,并检查保质期。如果商店关门了,请去下一家。”

这种“食谱卡片”就是一张技能卡(Skill Card)。它不在乎具体的街道名称或红绿灯的颜色。它在乎的是任务的逻辑

3. 图书馆:一个“技能图谱”

如果你只是收集成千上万张这样的食谱卡,你最终会得到一堆混乱的东西,有的说“买牛奶”,有的说“去乳制品区”,从而导致混乱。

作者将这些卡片组织成一个技能图谱(Skill Graph)。想象一个组织良好的图书馆或流程图:

  • 如果你需要“填写表单”,系统会在图谱中寻找通用的“填写表单”卡片。
  • 如果该表单是关于“支付”的,它会链接到更具体的“支付表单”卡片。
  • 如果表单提交失败,它会链接到一张“恢复”卡片,上面写着:“如果出错,请检查您的电子邮件地址。”

这使得系统可以在不变得杂乱无章的情况下变得聪明。它是在整合知识,而不是仅仅囤积知识。

4. 魔法技巧:“一次蒸馏,高效使用”

这是论文中最强大的部分。

  • 蒸馏器(The Distiller): 一个非常聪明、昂贵的 AI(就像一名博士生)观察人类浏览网站。它编写出完美的“技能卡”(即食谱)。
  • 执行器(The Executor): 一个较小、较便宜、较快的 AI(就像一名高中实习生)随后拿到这张卡片去执行实际工作。

“博士生”负责完成一次性的深度思考,以创建规则手册。而“实习生”只需遵循规则手册即可。这意味着你不需要为每一项任务都配备一台超级计算机。你可以记录下人类的专业知识一次,然后让成千上万个更小的、更便宜的机器人永久使用这些知识。

5. 结果:减少徘徊,提高成功率

作者在真实网站上进行了测试,发现使用这些“技能卡”的智能体:

  • 解决了更多任务: 它们的成功率比没有技能卡的智能体高出约 20% 到 35%。
  • 步骤更少: 它们不再到处乱逛,而是知道该往哪走。
  • 能从错误中恢复: 当事情出错时,它们知道如何修复,因为技能卡中的“恢复”部分告诉了它们该怎么做。
  • 适用于新网站: 因为技能是用通用的语言编写的(而非特定的坐标),所以即使网站设计发生了变化,它们依然有效。

总结

论文认为,智能网络智能体的未来不在于让它们点击得更快或看得更清,而在于赋予它们一个人类智慧的图书馆。通过将杂乱的人类浏览历史转化为清晰、可重用的“说明手册”,我们可以教会机器人如何像人类一样运用常识来导航互联网,而无需每次都从头开始学习。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →