想象一下,你正在教一个机器人管家如何使用你的电脑。你希望它能像人一样点击按钮、撰写邮件、整理文件。长期以来,研究人员主要训练这些机器人完成简单的点击任务,比如按下“提交”按钮或点击链接。这就像只教机器人如何按门铃。
但真实的电脑使用要复杂得多。有时你需要将文件从一个文件夹拖拽到另一个文件夹,绘制一个圆圈来裁剪照片,或者选中一段特定的文字进行删除。论文指出,当前的机器人管家在这些“长尾”任务上表现不佳,因为它们缺乏足够的练习。这就像一个只备考了选择题的学生,突然被要求写一篇论文。
以下是作者为了解决这一问题所采取的措施的简要说明,并辅以简单的类比:
1. 问题所在:“仅点击”的陷阱
作者分析了为何先进的 AI 模型(如 GPT-5.4)在尝试操作电脑时会失败。他们发现,虽然这些机器人在简单的点击任务上表现尚可,但当被要求执行复杂操作(如拖拽电子表格单元格或绘制形状)时,它们就会感到困惑。
- 类比:想象一场驾驶考试,你唯一练习过的就是转动点火钥匙。如果你突然需要平行停车或汇入高速公路,你一定会出事故。当前的 AI 模型在转动钥匙(点击)方面很出色,但在停车(拖拽和绘制)方面却糟糕透顶。
2. 解决方案第一部分:新的“驾驶考试”(CUActSpot)
为了解决这一问题,团队构建了一个名为CUActSpot的新基准测试。你可以将其视为为机器人设计的一项更新、更难的驾驶考试。
- 有何不同? 该测试不再仅仅要求机器人“点击红色按钮”,而是要求它:
- 拖拽文件到垃圾桶。
- 绘制线条连接两个形状。
- 选中文档中的特定单词。
- 裁剪照片中的人物。
- 五个世界:该测试涵盖了屏幕上五种不同的“世界”:标准应用程序(GUI)、文本文档、电子表格(表格)、绘图画布以及自然照片。
- 规则:他们制定了严格的评分规则。如果机器人试图拖拽文件,却意外点击了“禁止”区域(如弹出广告),它将立即失败。这确保了机器人是凭借精准度而非运气完成任务。
3. 解决方案第二部分:“魔法工厂”(数据合成)
最大的问题在于,缺乏足够的复杂操作示例来训练机器人。你无法仅仅等待人类录制数百万小时的拖拽和绘制操作,那太耗时了。
- 类比:与其等待真正的司机进行练习,不如团队构建了一个视频游戏模拟器。
- 工作原理:他们编写代码自动生成数百万个虚假的电脑屏幕。
- 他们创建了包含随机数字的虚假电子表格。
- 他们在画布上绘制了虚假的形状。
- 他们选取真实照片并标记其中的特定部分。
- “教师”(LLM):他们利用一个智能 AI(大语言模型)来观察这些虚假屏幕,并编写指令,例如“将绿色箭头拖拽到黄色圆圈的顶部”。该 AI 还计算了机器人需要移动到的精确坐标。
- 结果:他们生成了5000 万个练习样本。这就像在机器人真正接触实车之前,就给了它一百万小时的模拟器驾驶练习。
4. 发现:多样性优于数量
团队进行了实验,以探究什么能让机器人变得更聪明。他们发现了一个令人惊讶的事实:
- 旧方法:仅仅给机器人提供更多相同的内容(例如 1000 万个点击按钮的示例)并没有太大帮助。
- 新方法(多样性扩展):给机器人提供不同种类的任务(点击、拖拽、绘制、表格、文本),使其变得聪明得多。
- 类比:这就像一位厨师。如果你只练习切洋葱,你只会擅长切洋葱。但如果你练习切洋葱、切番茄、煎牛排和烤面包,你就会成为一名大师级厨师,能够应对任何食谱。机器人学会了,移动鼠标这项技能比它正在移动的具体物体更重要。
5. 结果:新机器人(Phi-Ground-Any-4B)
利用这项新的“驾驶考试”和“魔法工厂”生成的数据,他们训练了一个名为Phi-Ground-Any-4B的新模型。
- 成就:该模型相对较小(仅 40 亿参数),但在这些复杂任务上的表现却优于许多更大、开源的模型(有些超过 320 亿参数)。
- 局限性:该模型在旧式测试(仅关注点击标准按钮)方面仍略显薄弱,但在那些对真实世界电脑使用真正重要的新复杂任务上,它却是冠军。
总结
论文指出:“停止只教机器人如何点击。真实的电脑使用涉及拖拽、绘制和编辑。我们构建了一项新测试来衡量这些技能,建立了一个工厂来生成数百万个练习样本,并证明了教机器人执行广泛多样的操作,比仅仅教它们点击更能让它们精通电脑使用。”
技术摘要:覆盖计算机使用的人类动作空间:数据合成与基准测试
1. 问题陈述
计算机使用代理(CUAs)旨在自动化屏幕上的工作,但其在复杂、低频交互中的可靠性仍然较差,限制了用户的信任。对先进模型(如 GPT-5.4)失败案例的分析揭示了图形用户界面(GUI)操作中的“长尾”模式:虽然简单的点击处理得当,但大部分任务失败源于复杂、多样的交互,例如编辑表格、操作文本、在画布上绘图以及标注图像。
该论文指出了阻碍基于 GUI 的 CUAs 部署的两个主要瓶颈:
- 缺乏基准测试:现有基准测试(如 ScreenSpot-Pro、UI-Vision)主要“以点击为中心”和“以控件为中心”,侧重于标准 GUI 元素。它们无法评估复杂交互,如拖拽、自由手绘,或在非控件模态(表格、自然图像)上的操作。
- 数据稀缺:针对这些复杂交互的大规模训练数据严重短缺。当前的数据管道主要继承自网络爬取和辅助功能树范式,这些范式为控件生成点击标签,但缺乏实现可泛化定位能力所需的多样性。
2. 方法论
A. CUActSpot 基准测试
为了弥补评估缺口,作者引入了 CUActSpot,这是一个旨在反映超越简单点击的真实世界计算机使用场景的基准测试。
- 模态:涵盖五种不同的模态:GUI(标准控件)、文本(选择、插入)、表格(电子表格操作、单元格调整大小)、画布(图形对象操作)和自然图像(对象抠图、边界绘制)。
- 动作类型:包括点击(1 点)、拖拽(2 点)和绘制(N 点),涵盖有序(例如沿箭头拖拽)和无序动作。
- 评估指标:该基准测试采用严格的基于规则的评估系统,包括:
- 正确区域:预测坐标必须落在这些区域内。
- 禁止区域:落入此处的预测立即标记为错误,以防止指标博弈。
- 排序属性:用于对顺序敏感的动作(例如从起点拖拽到终点)。
- 构建:该基准测试由 206 个人工策划的多样化样本组成,涵盖 33 种详细任务类型,旨在最大限度地减少对专业软件知识的依赖,并专注于定位能力。
B. 基于渲染器的数据合成管道
为了解决数据稀缺问题,作者提出了一种完全合成的数据生成管道,可生成 5000 万个样本。
- 渲染:对于每种模态,基于代码的工具渲染截图并提取精确的坐标元数据(边界框、控制点、顶点)。
- GUI/表格:通过 Web 工具(Playwright、HTML/CSS 生成)渲染,具有随机化的样式和结构。
- 文本/画布:使用 Python 图形库(PyQt5、Matplotlib)渲染,具有随机化的字体、形状和布局。
- 自然图像:源自 SAM 数据集,使用轮廓提取算法对区域进行标注。
- 指令合成:提示高级大语言模型(OpenAI o3)从渲染的元数据中选择显著元素,执行中间坐标计算,并生成复杂操作指令及相应的动作轨迹(PyAutoGUI 代码)。
- 多样性:该管道确保视觉风格、任务结构和交互类型的高度多样性,避免单一模态扩展带来的偏差。
C. 模型训练
作者训练了 Phi-Ground-Any-4B,这是一个基于 Phi-3.5-VL 的 40 亿参数视觉 - 语言模型(VLM)。
- 训练策略:该模型在 5000 万个合成样本与 OpenCUA 数据结合的基础上进行预训练/中期训练。
- 消融研究:实验调查了数据构成的影响,具体比较了扩展单一模态与增加模态和任务多样性的效果。
3. 主要贡献
- CUActSpot 基准测试:一种新的评估标准,涵盖五种模态和复杂动作类型(拖拽、绘制),比以往的以点击为中心的基准测试更能反映真实的 CUA 需求。
- 数据合成管道:一个可扩展的、基于渲染器的框架,无需依赖人工标注即可为复杂 GUI 交互生成 5000 万个高质量训练样本。
- Phi-Ground-Any-4B:一个开源模型,在少于 320 亿参数的模型中,在复杂交互基准测试上实现了最先进的性能。
- 实证洞察:发现了**“多样性扩展”**,表明增加任务类型和模态的多样性比单纯扩展单一模态内的数据量对于提升通用交互能力更有效。
4. 实验结果
- 基准测试性能:在 CUActSpot 上,Phi-Ground-Any-4B 优于所有小于 320 亿参数的开源模型。其总得分为 44.4%,显著超越了 OpenCUA-7B(39.8%)和 UI-TARS-1.5-7B(28.5%)等模型。
- 与商业模型的比较:虽然 GPT-5.4 在 CUActSpot 上取得了更高的分数(63.6%),但 Phi-Ground-Any-4B 在开源解决方案中仍具有竞争力。
- 泛化能力:该模型表现出强大的跨任务泛化能力,成功完成了训练集中未明确存在的详细任务(例如编辑视觉内容内的文本)。
- 消融发现:
- 多样性扩展:在训练集中添加多样化的模态(文本、表格、画布、图像)始终能提升所有基准测试的性能,而扩展单一模态则收益递减。
- 基准测试敏感性:在特定软件数据上微调的模型(例如 Phi-Ground 的应用数据)在传统基准测试(ScreenSpot-Pro、UI-Vision)上显示出提升,但在 CUActSpot 上往往出现性能下降,这突显了分布偏移以及当前基准测试在衡量通用定位能力方面的局限性。
- OSWorld 评估:当作为端到端代理设置中的定位器(规划器为 GPT-5.4)使用时,Phi-Ground-Any-4B 在复杂的电子表格任务中表现出稳健的拖放能力,在特定定位场景中优于更大的模型。
5. 意义与主张
该论文声称,当前 GUI 定位研究中的“控件与点击”先验不足以支撑下一代计算机使用代理。通过引入 CUActSpot 和可扩展的合成管道,作者为社区提供了评估和训练模型以应对人类计算机交互“长尾”所需的工具。
作者强调,任务多样性是学习可泛化定位能力的关键驱动力,其重要性可能超过原始数据规模。他们将这项工作定位为迈向更稳健 CUAs 的诊断步骤,同时承认虽然合成数据实现了广泛覆盖,但与真实世界分布的对齐以及处理长程、有状态的场景仍是未来工作的开放挑战。基准测试、数据、代码和模型的发布旨在促进这一方向的进一步研究。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。