GUICrafter: Weakly-Supervised GUI Agent Leveraging Massive Unannotated Screenshots
GUICrafter 是一种弱监督 GUI 智能体,它利用两阶段课程学习框架在海量未标注截图和少量高质量数据上进行训练,在仅需 UI-TARS 等先进系统所用标注数据 0.1% 的情况下,实现了卓越的性能和跨设备泛化能力。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你想教一个机器人如何使用智能手机或电脑。过去的方法就像雇佣一名人类导师坐在机器人身边,针对每一项任务进行指导,指着每一个按钮说:“点这里”、“在那儿输入”、“把这个拖过去”。这极其昂贵、缓慢且难以规模化,因为有数以百万计不同的应用程序和网站,人类无法对它们全部进行标注。
GUICrafter 是一种改变游戏规则的新方法。它不再需要人类导师为每一节课进行辅导,而是教机器人通过观察和猜测来学习,并通过一点点帮助来进行自我纠正。
以下是它的工作原理,分为几个简单的步骤:
1. 问题所在:“数据荒漠”
目前,AI 智能体(能够操作屏幕的机器人)正困于“数据荒漠”。它们需要海量的标注数据(带有类似“点击红按钮”这种人类编写指令的截图)来进行学习。但收集这些数据的过程就像是试图用手去数沙滩上的每一粒沙子——既太慢又太贵。因此,这些机器人很难发现屏幕上的微小按钮,也无法处理它们从未见过的全新类型的应用。
2. 解决方案:“两阶段健身房”
研究人员构建了一个名为 GUICrafter 的系统,通过像健身房锻炼一样的两个阶段来训练机器人。
第一阶段:“荒野生存”课程(弱监督预训练)
想象一下,你把一名学生丢进一个拥有数百万个随机网页和应用截图的巨大图书馆里。没有人告诉他们具体该做什么。相反,系统会根据页面可以执行的操作给他们提供线索。
- 比喻: 这就像是通过向孩子展示成千上万扇门,但不告诉他们“这是一扇门”,从而教会他们识别“门”。系统会自动识别屏幕上的交互式元素(如按钮、文本框或菜单)。
- 任务: 机器人被给予一个简单的、通用的指令,比如“找到任何可点击的按钮”或“找到任何可以输入文字的地方”。
- 奖励: 如果机器人点击了一个真实的按钮,它会收到一个“做得好”的信号;如果它点击了空白区域,则会收到一个“再试一次”的信号。
- 结果: 机器人学会了如何看懂屏幕。它学会了区分按钮和图片,以及了解交互部分在哪里。它仅仅通过观察数百万张未经标注的截图就学会了这些,而不需要人类去标注每一张图。
第二阶段:“精调”课程(高质量强化学习)
现在机器人已经知道如何识别按钮和文本框了,但它仍然有点笨拙。它可能会点对了按钮,但动机错误,或者在被要求“寻找登录界面”时点错了按钮。
- 比观: 这就像是带那位已经知道如何识别门的同学去接受一位严厉老师的几次特定、高质量的课程。
- 任务: 系统使用极少量高质量的人类标注数据(仅为其他系统所需数据的 0.1%)。
- 奖励: 机器人会在特定的复杂任务上接受测试。如果成功,它会获得巨大的奖励;如果失败,它会精准地学习哪里出了问题。
- 结果: 机器人学会了建立联系。它现在不仅知道按钮在哪里,还知道为了实现特定目标应该点击哪个按钮。
3. 核心要素:“元任务”(Meta-Tasks)
与其为每一个任务编写唯一的指令(例如,“在亚马逊上点击‘购买’按钮”、“在 Gmail 上点击‘发送’按钮”),GUICrafter 使用了元任务。
- 类比: 与其教机器人 1,000 种不同的食谱,不如教它“烹饪”的概念。你会说,“如果你看到一个锅,就搅拌它。”
- 系统创建了通用的规则,如“点击任何可点击区域”或“在任何文本框中输入”。这使得机器人能够从广阔的、未经标注的互联网中学习,而无需人类为每一个网站编写新规则。
4. 结果:小数据,大智慧
论文声称,通过使用这种方法:
- 数据效率: GUICrafter 达到了与顶尖系统(如 UI-TARS)相当甚至更好的效果,而使用的数据量仅为对方的 0.1%。这就像是用极短的学习时间就拿到了博士学位。
- 泛化能力: 因为它在第一阶段是从“野外”数据(数百万个随机网站)中学到的,所以它比之前的模型更能应对全新的、未见过的应用和网站。
- 鲁棒性: 即使第一阶段的“线索”有时有些混乱或带有噪声(比如模糊的照片),机器人仍然能有效地学习,尤其是在经过第二阶段的精调之后。
总结
GUICrafter 是一种训练 AI 智能体使用电脑的方法,它先让它们通过“阅读”互联网来学习(学习识别按钮和字段),然后再通过一次极小规模、高质量的“期末考试”来磨练技能。它通过将整个互联网变成一个免费且庞大的训练场,解决了缺乏人类标注数据的难题。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。