← 最新论文
💻 computer science

Covering Human Action Space for Computer Use: Data Synthesis and Benchmark

本文通过引入 CUActSpot 基准测试和基于渲染器的数据合成流程,解决了计算机使用代理在复杂、低频交互中可靠性不足的问题,该方案使一个 40 亿参数模型在多种图形用户界面模态下均能超越更大的开源模型。

原作者: Miaosen Zhang, Xiaohan Zhao, Zhihong Tan, Zhou Huoshen, Yijia Fan, Yifan Yang, Kai Qiu, Bei Liu, Justin Wagle, Chenzhong Yin, Mingxi Cheng, Ji Li, Qi Dai, Chong Luo, Xu Yang, Xin Geng, Baining Guo

发布于 2026-05-13
📖 1 分钟阅读☕ 轻松阅读

原作者: Miaosen Zhang, Xiaohan Zhao, Zhihong Tan, Zhou Huoshen, Yijia Fan, Yifan Yang, Kai Qiu, Bei Liu, Justin Wagle, Chenzhong Yin, Mingxi Cheng, Ji Li, Qi Dai, Chong Luo, Xu Yang, Xin Geng, Baining Guo

原始论文根据 CC0 1.0(http://creativecommons.org/publicdomain/zero/1.0/)发布到公有领域。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个机器人管家如何使用你的电脑。你希望它能像人一样点击按钮、撰写邮件、整理文件。长期以来,研究人员主要训练这些机器人完成简单的点击任务,比如按下“提交”按钮或点击链接。这就像只教机器人如何按门铃。

但真实的电脑使用要复杂得多。有时你需要将文件从一个文件夹拖拽到另一个文件夹,绘制一个圆圈来裁剪照片,或者选中一段特定的文字进行删除。论文指出,当前的机器人管家在这些“长尾”任务上表现不佳,因为它们缺乏足够的练习。这就像一个只备考了选择题的学生,突然被要求写一篇论文。

以下是作者为了解决这一问题所采取的措施的简要说明,并辅以简单的类比:

1. 问题所在:“仅点击”的陷阱

作者分析了为何先进的 AI 模型(如 GPT-5.4)在尝试操作电脑时会失败。他们发现,虽然这些机器人在简单的点击任务上表现尚可,但当被要求执行复杂操作(如拖拽电子表格单元格或绘制形状)时,它们就会感到困惑。

  • 类比:想象一场驾驶考试,你唯一练习过的就是转动点火钥匙。如果你突然需要平行停车或汇入高速公路,你一定会出事故。当前的 AI 模型在转动钥匙(点击)方面很出色,但在停车(拖拽和绘制)方面却糟糕透顶。

2. 解决方案第一部分:新的“驾驶考试”(CUActSpot)

为了解决这一问题,团队构建了一个名为CUActSpot的新基准测试。你可以将其视为为机器人设计的一项更新、更难的驾驶考试。

  • 有何不同? 该测试不再仅仅要求机器人“点击红色按钮”,而是要求它:
    • 拖拽文件到垃圾桶。
    • 绘制线条连接两个形状。
    • 选中文档中的特定单词。
    • 裁剪照片中的人物。
  • 五个世界:该测试涵盖了屏幕上五种不同的“世界”:标准应用程序(GUI)、文本文档、电子表格(表格)、绘图画布以及自然照片。
  • 规则:他们制定了严格的评分规则。如果机器人试图拖拽文件,却意外点击了“禁止”区域(如弹出广告),它将立即失败。这确保了机器人是凭借精准度而非运气完成任务。

3. 解决方案第二部分:“魔法工厂”(数据合成)

最大的问题在于,缺乏足够的复杂操作示例来训练机器人。你无法仅仅等待人类录制数百万小时的拖拽和绘制操作,那太耗时了。

  • 类比:与其等待真正的司机进行练习,不如团队构建了一个视频游戏模拟器
  • 工作原理:他们编写代码自动生成数百万个虚假的电脑屏幕。
    • 他们创建了包含随机数字的虚假电子表格。
    • 他们在画布上绘制了虚假的形状。
    • 他们选取真实照片并标记其中的特定部分。
  • “教师”(LLM):他们利用一个智能 AI(大语言模型)来观察这些虚假屏幕,并编写指令,例如“将绿色箭头拖拽到黄色圆圈的顶部”。该 AI 还计算了机器人需要移动到的精确坐标。
  • 结果:他们生成了5000 万个练习样本。这就像在机器人真正接触实车之前,就给了它一百万小时的模拟器驾驶练习。

4. 发现:多样性优于数量

团队进行了实验,以探究什么能让机器人变得更聪明。他们发现了一个令人惊讶的事实:

  • 旧方法:仅仅给机器人提供更多相同的内容(例如 1000 万个点击按钮的示例)并没有太大帮助。
  • 新方法(多样性扩展):给机器人提供不同种类的任务(点击、拖拽、绘制、表格、文本),使其变得聪明得多。
  • 类比:这就像一位厨师。如果你只练习切洋葱,你只会擅长切洋葱。但如果你练习切洋葱、切番茄、煎牛排和烤面包,你就会成为一名大师级厨师,能够应对任何食谱。机器人学会了,移动鼠标这项技能比它正在移动的具体物体更重要。

5. 结果:新机器人(Phi-Ground-Any-4B)

利用这项新的“驾驶考试”和“魔法工厂”生成的数据,他们训练了一个名为Phi-Ground-Any-4B的新模型。

  • 成就:该模型相对较小(仅 40 亿参数),但在这些复杂任务上的表现却优于许多更大、开源的模型(有些超过 320 亿参数)。
  • 局限性:该模型在旧式测试(仅关注点击标准按钮)方面仍略显薄弱,但在那些对真实世界电脑使用真正重要的新复杂任务上,它却是冠军。

总结

论文指出:“停止只教机器人如何点击。真实的电脑使用涉及拖拽、绘制和编辑。我们构建了一项新测试来衡量这些技能,建立了一个工厂来生成数百万个练习样本,并证明了教机器人执行广泛多样的操作,比仅仅教它们点击更能让它们精通电脑使用。”

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →