✨ 要点🔬 技术摘要
想象一下,你正试图教一个非常聪明但视觉笨拙的机器人如何使用电脑。你可以通过语言指令告诉它:“点击绿色的按钮来保存文件”,但机器人根本不知道那个按钮在哪里。它可能会点错另一个绿色的东西,或者因为按钮太小或看起来像别的东西而完全错过目标。这个问题被称为**“接地”(grounding)**——即将你的语言与机器人需要触摸的屏幕精确位置联系起来。
这篇论文介绍了一种全新的解决方案,旨在让机器人学习这一过程变得更好、更快、且更少浪费精力。
问题所在:机器人在图标的海洋中迷失了
桌面电脑非常杂乱。它们拥有高分辨率的大屏幕,上面挤满了看起来几乎一模一样的微小图标、菜单和按钮。以往教授机器人的尝试使用了海量的数据,但其中大部分是“嘈杂”的,或者是通过计算机生成而非由真人生成的。这就像试图通过给某人看一百万张模糊的计算机生成汽车照片来教他们开车;他们可能会学会理论,但在现实世界中会撞车。
解决方案:GROUNDCUA(“专家导师”数据集)
作者创建了一个全新的大规模数据集,名为 GROUNDCUA 。你可以将其理解为不是一堆随机的照片,而是一个专家演示库 。
真人、真任务: 他们聘请了受过训练的专家,在 87 种不同的桌面应用程序(如绘图工具、电子表格和编程软件)中执行真实的各项任务。
“X射线”视觉: 当这些专家工作时,系统会截取屏幕截图,并且至关重要的一点是,它标注了屏幕上每一个可见的元素 。如果专家点击了一个微小的“保存”图标,系统会记录下它的确切位置、外观以及专家当时正在进行的操作。
规模: 他们收集了 56,000 张截图,包含超过 350 万个标注元素 。这就像是给了机器人一本教科书,其中的每一张图片里的每一个物体都由人类老师进行了命名和解释。
新模型:GROUNDNEXT(“明星学生”)
利用这个高质量的数据集,团队构建了一个全新的 AI 模型家族,名为 GROUNDNEXT 。
两步训练法:
监督式微调 (SFT): 首先,他们使用 70 万个最优秀的示例来教授该模型。想象一下一名学生正在研读一本由专家编写的完美教科书。
强化学习 (RL): 接着,他们让模型进行练习。当它猜对时,它会得到一个“做得好”的奖励;当它猜错时,它会收到一个“再试一次”的信号。这进一步精炼了它的技能。
结果:体积虽小,大脑强大
令人惊讶的部分在于:团队训练其模型时使用的数据量不到其他顶尖模型的十分之一 。
效率: 他们拥有 30 亿参数的模型(一个相对较小的“大脑”)表现得与那些使用数百万个杂乱数据点训练的更大模型一样好,甚至更好。
“黑马”胜利: 在测试 AI 作为电脑用户(点击、打字、拖拽)的任务中,他们的小型模型击败了包括一些来自大型科技公司在内的庞大竞争对手。这就像是一个研读了几本完美书籍的学生,表现优于一个读了一百万本随机杂志的学生。
泛化能力: 尽管他们只针对桌面电脑训练了该模型,但它在理解手机和网站方面也表现出了惊人的能力,这表明它学习的是使用电脑的“原则”,而不仅仅是死记硬背特定的屏幕。
为什么这很重要
论文指出,质量胜过数量 。与其向这个问题投入越来越多的数据,他们证明了如果你拥有高质量、经人工验证的数据 ,你就可以用更少的资源构建出更可靠的电脑使用智能体。
他们正在向公众发布数据集(GROUNDCUA)和模型(GROUNDNEXT),希望帮助其他研究人员构建更好、更可靠的机器人,让它们能够真正帮助我们使用电脑,而不至于迷失在图标之中。
简而言之: 他们通过向机器人展示数千个完美的、人类演示的范例,教会了机器人如何使用电脑,并证明了高质量的教学可以事半功倍。
技术摘要:基于人类演示的计算机使用智能体对齐(GROUNDCUA 与 GROUNDNEXT)
问题陈述
开发能够代表用户操作软件的可靠计算机使用智能体(Computer-Use Agents, CUAs),其核心在于对齐(grounding) :即能够将自然语言指令准确地映射到特定的屏幕 UI 元素上。尽管针对 Web 和移动端交互存在大量数据集,但针对桌面环境 的高质量资源仍然非常有限。桌面应用面临着独特的挑战,包括高分辨率显示器、密集的布局、视觉相似的元素,以及在训练期间未曾见过的用户特定人工制品所带来的变异性。现有的自动化数据集通常存在辅助功能信号不完整、小图标控制项代表性不足,以及缺乏精确定位所需的细粒度标注等问题。因此,当智能体无法识别出所需的精确按钮、菜单项或控件时,往往无法正确执行计划。
方法论
1. GROUNDCUA 数据集
为了解决高质量桌面数据匮乏的问题,作者推出了 GROUNDCUA ,这是一个源自专家演示的大规模、人工标注的数据集。
数据收集: 该数据集包含来自 87 个开源应用程序 (涵盖 12 个类别,如 Office、开发、CAD、科学计算)的 56,000 张截图 。不同于以往依赖自动遍历或随机状态生成的做法,该数据由受过训练的标注员通过执行真实任务(例如编辑电子表格、运行模拟实验)来收集。
标注过程: 提取了用户动作发生前一刻的关键帧。标注员提供了 356 万个经人工验证的标注 ,为每个可见元素标注了边界框(bounding boxes)、文本名称和类别。大约 50% 的元素被分配到了高层类别(如菜单、按钮、滑块)。
指令生成: 利用密集的标注(边界框、OCR、上下文),作者构建了一个 70 万条指令微调数据集 。指令生成了三种类型,以模拟现实世界的多样性:
直接型 (Direct): 描述属性或文本(例如,“点击‘保存’按钮”)。
功能型 (Functional): 侧重于动作(例如,“打开一个新标签页”)。
空间型 (Spatial): 使用相对位置(例如,“点击‘文件’左侧的图标”)。
规模与多样性: 该数据集具有高分辨率图像(0.39M 至 7.0M 像素),且平均每张截图有 64 个标注 ,其密度显著高于现有基准。它包含了容易被自动化流水线忽略的细粒度元素,如小型图标和工具栏。
2. GROUNDNEXT 模型家族
作者开发了 GROUNDNEXT ,这是一系列基于 Qwen2.5-VL-Instruct 的视觉语言模型(参数量分别为 3B 和 7B),旨在将指令映射到目标 UI 坐标。
第一阶段:监督微调 (SFT): 模型在从 GROUNDCUA 整理出的 70 万个指令-图像对上进行训练。视觉编码器和语言模型均进行了微调。
第二阶段:强化学习 (RL): 使用 相对留一法 (Relative Leave-One-Out, RLOO) 优化进行后训练阶段。
奖励函数: 一个定制的离散奖励,基于预测坐标与真实边界框之间的归一化距离。预测落在框内的获得正向奖励,落在框外的则根据其距离受到惩罚。
数据: 使用了 10,000 个新样本(与 SFT 集不同)进行 RL,以确保泛化能力。
核心贡献
GROUNDCUA 数据集: 目前规模最大的专家标注桌面对齐数据集,拥有 56,000 张截图、356 万个以上的元素,并具备跨 87 个应用程序的高分辨率多样性。它填补了密集、细粒度桌面监督数据的空白。
GROUNDNEXT 模型: 一个通过两阶段 SFT+RL 流水线训练的 3B 和 7B 模型家族。它们在桌面基准测试中实现了最先进(SOTA)的性能,且使用的训练样本(700K SFT + 10K RL)显著少于之前使用数百万样本训练的模型。
效率与泛化性: 该工作证明了高质量、专家驱动的数据可以优于规模更大但精度较低的数据集。尽管仅在桌面数据上进行训练,这些模型在移动端和 Web 环境中也表现出了强大的跨平台泛化能力。
结果
基准测试
模型在五个基准测试上进行了评估:ScreenSpot-Pro 、OSWorld-G 、UI-Vision 、MMBench-GUI 和 ScreenSpot-v2 。
SFT 性能: GROUNDNEXT-3B (SFT) 取得了 66.4 的平均分(包含 UI-Vision)和 68.4 的平均分(不含 UI-Vision),大幅领先于下一个最佳的 3B SFT 基准模型(GUI-Actor-3B,领先幅度为 +12.1 分)。GROUNDNEXT-7B (SFT) 在 7B SFT 组中同样处于领先地位。
RL 性能: 加入 RL 后进一步提升了结果。GROUNDNEXT-3B (RL) 达到了 68.4 (平均值),而 GROUNDNEXT-7B (RL) 达到了 70.5 。
对比: 尽管使用的 SFT 数据量不到 JEDI(900 万样本)的十分之一,GROUNDNEXT 依然超越了现有的 SFT 基准模型,并与经过 RL 微调的系统保持了竞争力。
智能体性能(OSWorld 验证)
在以 OpenAI o3 作为规划器的多步智能体设置下进行评估:
GROUNDNEXT-3B (RL) 取得了 50.6 的总分,显著优于其他 3B 开源模型(例如 OpenCUA-A3B 为 17.7),并超越了更大的模型如 OpenCUA-72B (46.1) 以及闭源 API 如 Qwen3-VL-Flash (41.6)。
它取得了与 JEDI-7B (51.0) 相当的性能,尽管其规模不到后者的一半,展示了极高的实际应用价值。
分析
数据质量 vs. 数量: 在来自各种数据集(Aguvis, UGround, JEDI 等)的 100K 样本上训练相同的基座模型表明,GROUNDCUA 带来了最高的性能,证实了密集的专家监督比单纯的原始规模更有效。
RL 增益: RL 提供了适度但持续的改进。在 SFT 阶段使用 GROUNDCUA 训练的模型在 RL 阶段的增益较小,这表明 SFT 数据本身已经具有高度的信息量。
跨领域: 模型在移动端和 Web 界面(MMBench-GUI, ScreenSpot-v2)上也表现出良好的泛化性,尽管在 Web 任务上的表现略低于桌面端,这表明未来需要整合多领域数据。
重要性与主张
论文声称,高质量、专家驱动的数据集对于推进通用计算机使用智能体至关重要 。核心结论是,数据质量和密度可以替代原始的数据规模 。通过专注于对真实世界桌面交互进行人工验证和细粒度标注,作者证明了较小的模型可以通过高效的训练实现卓越的对齐性能。
这项工作将 GROUNDCUA 和 GROUNDNEXT 定位为面向开源研究社区的基础资源,旨在解锁可靠、可适应智能体的核心能力。作者强调,虽然目前的 RL 奖励设计较为简单,但 GROUNDCUA 中的密集标注为开发更精确的奖励信号奠定了基础。他们还强调了数据集中使用开源应用程序的重要性,以确保对现实世界软件功能的广泛且符合许可要求的覆盖。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。