← 最新论文
🤖 machine learning

Grounding Computer Use Agents on Human Demonstrations

原作者: Aarash Feizi, Shravan Nayak, Xiangru Jian, Kevin Qinghong Lin, Kaixin Li, Rabiul Awal, Xing Han Lù, Johan Obando-Ceron, Juan A. Rodriguez, Nicolas Chapados, David Vazquez, Adriana Romero-Soriano, Reih
发布于 2026-06-11
📖 1 分钟阅读☕ 轻松阅读

原作者: Aarash Feizi, Shravan Nayak, Xiangru Jian, Kevin Qinghong Lin, Kaixin Li, Rabiul Awal, Xing Han Lù, Johan Obando-Ceron, Juan A. Rodriguez, Nicolas Chapados, David Vazquez, Adriana Romero-Soriano, Reihaneh Rabbany, Perouz Taslakian, Christopher Pal, Spandana Gella, Sai Rajeswar

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教一个非常聪明但视觉笨拙的机器人如何使用电脑。你可以通过语言指令告诉它:“点击绿色的按钮来保存文件”,但机器人根本不知道那个按钮在哪里。它可能会点错另一个绿色的东西,或者因为按钮太小或看起来像别的东西而完全错过目标。这个问题被称为**“接地”(grounding)**——即将你的语言与机器人需要触摸的屏幕精确位置联系起来。

这篇论文介绍了一种全新的解决方案,旨在让机器人学习这一过程变得更好、更快、且更少浪费精力。

问题所在:机器人在图标的海洋中迷失了

桌面电脑非常杂乱。它们拥有高分辨率的大屏幕,上面挤满了看起来几乎一模一样的微小图标、菜单和按钮。以往教授机器人的尝试使用了海量的数据,但其中大部分是“嘈杂”的,或者是通过计算机生成而非由真人生成的。这就像试图通过给某人看一百万张模糊的计算机生成汽车照片来教他们开车;他们可能会学会理论,但在现实世界中会撞车。

解决方案:GROUNDCUA(“专家导师”数据集)

作者创建了一个全新的大规模数据集,名为 GROUNDCUA。你可以将其理解为不是一堆随机的照片,而是一个专家演示库

  • 真人、真任务: 他们聘请了受过训练的专家,在 87 种不同的桌面应用程序(如绘图工具、电子表格和编程软件)中执行真实的各项任务。
  • “X射线”视觉: 当这些专家工作时,系统会截取屏幕截图,并且至关重要的一点是,它标注了屏幕上每一个可见的元素。如果专家点击了一个微小的“保存”图标,系统会记录下它的确切位置、外观以及专家当时正在进行的操作。
  • 规模: 他们收集了 56,000 张截图,包含超过 350 万个标注元素。这就像是给了机器人一本教科书,其中的每一张图片里的每一个物体都由人类老师进行了命名和解释。

新模型:GROUNDNEXT(“明星学生”)

利用这个高质量的数据集,团队构建了一个全新的 AI 模型家族,名为 GROUNDNEXT

  • 两步训练法:
    1. 监督式微调 (SFT): 首先,他们使用 70 万个最优秀的示例来教授该模型。想象一下一名学生正在研读一本由专家编写的完美教科书。
    2. 强化学习 (RL): 接着,他们让模型进行练习。当它猜对时,它会得到一个“做得好”的奖励;当它猜错时,它会收到一个“再试一次”的信号。这进一步精炼了它的技能。

结果:体积虽小,大脑强大

令人惊讶的部分在于:团队训练其模型时使用的数据量不到其他顶尖模型的十分之一

  • 效率: 他们拥有 30 亿参数的模型(一个相对较小的“大脑”)表现得与那些使用数百万个杂乱数据点训练的更大模型一样好,甚至更好。
  • “黑马”胜利: 在测试 AI 作为电脑用户(点击、打字、拖拽)的任务中,他们的小型模型击败了包括一些来自大型科技公司在内的庞大竞争对手。这就像是一个研读了几本完美书籍的学生,表现优于一个读了一百万本随机杂志的学生。
  • 泛化能力: 尽管他们只针对桌面电脑训练了该模型,但它在理解手机和网站方面也表现出了惊人的能力,这表明它学习的是使用电脑的“原则”,而不仅仅是死记硬背特定的屏幕。

为什么这很重要

论文指出,质量胜过数量。与其向这个问题投入越来越多的数据,他们证明了如果你拥有高质量、经人工验证的数据,你就可以用更少的资源构建出更可靠的电脑使用智能体。

他们正在向公众发布数据集(GROUNDCUA)和模型(GROUNDNEXT),希望帮助其他研究人员构建更好、更可靠的机器人,让它们能够真正帮助我们使用电脑,而不至于迷失在图标之中。

简而言之: 他们通过向机器人展示数千个完美的、人类演示的范例,教会了机器人如何使用电脑,并证明了高质量的教学可以事半功倍。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →