← 最新论文
🤖 machine learning

ClawGUI: A Unified Framework for Training, Evaluating, and Deploying GUI Agents

本文介绍了 ClawGUI,这是一个开源的统一框架,旨在解决 GUI 智能体在训练、评估和部署方面的基础设施缺失问题,通过提供支持虚拟与真实环境的强化学习系统、标准化的评估流水线以及跨多平台的部署能力,显著提升了智能体的性能与实用性。

原作者: Fei Tang, Zhiqiong Lu, Boxuan Zhang, Weiming Lu, Jun Xiao, Yueting Zhuang, Yongliang Shen

发布于 2026-04-14
📖 1 分钟阅读☕ 轻松阅读

原作者: Fei Tang, Zhiqiong Lu, Boxuan Zhang, Weiming Lu, Jun Xiao, Yueting Zhuang, Yongliang Shen

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一个名为 ClawGUI 的全新开源框架。为了让你轻松理解,我们可以把“让 AI 学会操作手机或电脑屏幕”这件事,想象成培养一个超级管家

以前,培养这个管家有三个大难题:

  1. 训练太难:只能在模拟的“假手机”里练,练好了上真手机就水土不服;而且没人愿意把训练场地的图纸公开,大家只能闭门造车。
  2. 考试太乱:每个人出的考题(评测标准)都不一样,有的允许用放大镜看,有的要求必须用特定字体,导致大家的成绩没法直接比较,不知道谁是真的强。
  3. 落地太难:训练出来的管家要么只能听命令行指令(像黑客一样敲代码),要么只能在实验室里演示,没法真正走进普通人的手机,帮用户点外卖、回消息。

ClawGUI 就是为了解决这三个问题而生的“全能管家培养基地”。 它由三个紧密配合的部门组成:

1. 训练部:ClawGUI-RL(让管家在“真战场”上练级)

  • 以前的困境:就像让一个赛车手只在模拟器里练车,或者只在一个固定的赛道跑。一旦上了真实路况(真实的手机 App),或者赛道环境变了(App 更新),他就懵了。而且,以前的训练系统像是一个黑盒子,别人进不去。
  • ClawGUI 的解法
    • 真假混练:它不仅能用几十台虚拟的“假手机”同时训练,还能直接连上真实的物理手机进行训练。就像让赛车手既在模拟器练,又直接开真车上路。
    • 即时反馈(密集奖励):以前的训练是“做完整个任务才给分”,比如管家把菜买错了,最后才告诉他“你错了”,他不知道是哪一步错了。ClawGUI 引入了一个“过程奖励模型”,就像教练在旁边每一步都喊:“这一步点对了!”“那一步点偏了!”。这让管家能迅速纠正错误,学得更快、更准。
    • 开源共享:他们把整个训练场地和规则都公开了,谁都可以进来练,不再是一家独大。

2. 考试部:ClawGUI-Eval(一把尺子量到底)

  • 以前的困境:就像不同的学校用不同的试卷和评分标准。A 学校说“满分 100",B 学校说“满分 50",而且 A 学校允许用计算器,B 学校禁止。大家晒出的成绩单根本没法比,不知道谁是真的学霸。
  • ClawGUI 的解法
    • 统一考场:他们建立了一个标准化的“考试中心”,涵盖了 6 种不同的考试场景(比如找图标、导航、控制手机等)。
    • 固定规则:无论谁来考,题目怎么显示、怎么打分、分辨率多少,全部锁死,不再随意变动。
    • 结果惊人:他们用这套标准去复现了 11 个现有模型的成绩,95.8% 的情况下都能和官方数据对得上。这意味着,以后大家再比谁强,只需要看 ClawGUI 的榜单,不再会有“由于评分标准不同”导致的争议。

3. 部署部:ClawGUI-Agent(让管家真正住进你的手机)

  • 以前的困境:训练出来的管家要么太“高冷”,只能听懂复杂的代码指令(CLI),普通人不会用;要么只能演示,没法真正帮用户点外卖、查快递。
  • ClawGUI 的解法
    • 混合双打:它懂得“看人下菜碟”。如果某个 App 有后台接口,它就走快捷通道(像黑客一样高效);如果没有接口,它就直接动手点屏幕(像人一样操作)。既快又全。
    • 多平台接入:你不需要学新软件,直接在微信、钉钉、Telegram 等 12 种聊天软件里跟它说话,它就能去控制你的手机。
    • 有记忆的管家:它有一个“长期记忆库”。你第一次让它“把张三的微信置顶”,下次你再说“给张三发个消息”,它不用你重复教,因为它记得张三是谁,也记得你的习惯。

最终成果:ClawGUI-2B

在这个框架下,作者训练出了一个名为 ClawGUI-2B 的模型(虽然它只有 20 亿参数,属于“小个子”)。

  • 战绩:在真实的手机操作测试中,它的成功率达到了 17.1%
  • 对比
    • 比同体量的其他模型(MAI-UI-2B)高了 6%(相对提升 54%)。
    • 比那些参数大几十倍的“巨无霸”模型(如 72B 参数的 UI-Venus)还要强!

总结

ClawGUI 就像是为 AI 管家行业建立了一套“驾校 + 考驾照 + 网约车平台”的完整生态。
它不再让 AI 在封闭的实验室里自嗨,而是通过真实的训练环境公平的考试标准实用的落地工具,让 AI 真正学会像人一样操作手机,并且能走进千家万户,成为我们真正的个人助理。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →