Qwen-UI-Agent Technical Report: Toward Next-Generation Real-World Centric Foundation GUI Agents
Qwen-UI-Agent 是一个以现实世界为中心的通用 GUI 智能体,它通过混合动作空间和 AutoResearch 式的数据飞轮,统一了移动端、计算机、网页及 DeepSearch 环境,在实现移动端基准测试最先进性能的同时,也在更广泛的数字化任务中提供了极具竞争力的结果。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你有一个超级聪明的机器人朋友,它能处理你的数字上下文并完成你要求的任何事情。但现在,这个机器人就像一个只在完美的、安静的教室里学习过的学生。它知道如何在纸上解数学题,但如果你把它放在一个混乱的厨房里,面对粘糊糊的炉灶、吠叫的狗和卡住的门,它可能会感到困惑并掉落吐司。这就是目前“GUI智能体”(GUI agents)的现状——这些旨在像人类一样观察屏幕并点击按钮的计算机程序。它们在安全的模拟视频游戏中表现出色,但面对手机和电脑中混乱、不可预测的现实情况时,往往会跌跌撞撞。
科学家们正在提出的核心问题是:我们如何教这些数字助手停止做“教室里的学生”,开始成为“现实世界的专家”?我们需要它们不仅是点击按钮,还要理解当弹窗广告遮挡视线时该怎么办,如何在手机和笔记本电脑之间切换而不丢失思路,甚至在察觉到异常(比如航班取消)时,能在你开口之前就提供解决方案。如果我们能破解这个密码,这些智能体就能成为终极助手,处理从预订旅行到组织你的数字生活的一切事务,让技术不再感觉像是一个你必须与之搏斗的工具,而是一个真正“懂你”的伙伴。
遇见 Qwen-UI-Agent:在现实世界中学习生活的机器人
走进 Qwen-UI-Agent,这是一种由阿里巴巴 MAI-UI 团队开发的全新数字助手。把它想象成“在训练假人身上练习的机器人”与“真正上过擂台的战士”之间的区别。当其他智能体忙于在视频游戏模拟中获得完美分数时,Qwen-UI-Agent 被派往了野外,在超过 100 部真实的物理手机上进行学习,应对真实的 App、真实的互联网连接以及现实生活中的各种干扰。
团队意识到,要制作一个真正有用的智能体,不能仅仅让大脑变得更聪明,还必须改变它的整个身体和它所生活的环境。以下是他们实现这一目标的方法,我们使用了一些有趣的类比来解释其中的奥秘:
1. “现实世界健身房” vs. “视频游戏”
大多数 AI 智能体在“沙盒”中训练——那些在每次尝试后都会被完美重置的数字房间。这就像是在一个篮球场上练习,篮筐永远不动,球也永远不会弹错方向。但现实生活是混乱的。手机会有弹窗广告,App 会崩溃,你可能会遇到意料之外的权限请求。
Qwen-UI-Agent 是在 真实设备移动运行时(Real-Device Mobile Runtime) 中训练的。想象一个巨大的仓库,里面有超过 100 部真实的物理手机,运行着像你我一样使用的真实 App。该系统非常聪明,它能识别出“生病”的手机(即运行异常的手机),并立即将任务切换到健康的手机上,就像教练在比赛中更换球员一样。这使得智能体能够学习如何处理现实世界的混乱,从奇怪的弹窗到网络故障,而不是仅仅死记硬背视频游戏中的完美路径。
2. “瑞士军刀”式的动作空间
以前,智能体的动作就像只能用手的人(点击和轻触)。如果它们需要移动文件或进行复杂的计算,必须通过菜单点击数小时。Qwen-UI-Agent 拥有了一把 “瑞士军刀”。
它学会了将 GUI 动作(点击、输入、滚动)与 CLI 动作(在终端中输入命令,像个电脑巫师一样)结合起来。
- 类比: 假设你需要整理 100 张照片。普通的智能体会重复执行“打开”、“选择”、“移动”、“重复” 100 次。Qwen-UI-Agent 则可以直接说:“嘿,我直接用一条命令把所有文件都移走!”它还可以进行 批量(batch) 操作,这意味着它可以在一次规划中完成一整套动作序列,就像棋手在走棋前会思考三步之后,而不是一次只动一个棋子。这让它变得极其快速且高效。
3. “自动教练”数据飞轮
通常,教导一个机器人需要大量人类老师编写测试题并批改答案。这既慢又枯燥。Qwen-UI-Agent 使用的是一种 AutoResearch 风格的数据飞轮。
可以把这想象成一个机器人教练,它观察机器人的表现,发现哪里出错,然后立即创建一个针对该错误的、更难的专项练习。智能体本身可以帮助设计任务、发现自己的错误并规划下一轮训练。这是一个自我进化的循环,机器人通过自我教学变得更好,人类只需提供高层级的指导。
4. “主动管家”
大多数机器人都在等待你说:“嘿,做这个。”但 Qwen-UI-Agent 拥有一个 Harness 层,让它能够变得主动。
- 类比: 想象你收到一条航班取消的通知。普通的机器人会等着你告诉它去寻找新航班。Qwen-UI-Agent 会检测到通知,推断出可执行的事件,检查你的日历,查看列车时刻表,对比价格,并在你醒来之前就为你呈现一份完整的恢复方案。它不只是等待指令;它能从你的数字信号中识别出可执行的时刻,并提出合适的后续步骤。
结果:奏效了吗?
团队在一些非常艰苦的竞技场中对 Qwen-UI-Agent 进行了测试,结果令人印象深刻。
- 在真实手机上: 在名为 MobileWorld-Real 的基准测试中(使用带有真实 App 的真实手机),Qwen-UI-Agent 的成功率达到了 92.2%。它大幅领先于最优秀的闭源模型(如 Opus 4.8 和 GPT-5.6 Sol)。在另一个名为 AndroidDaily 的测试中,它达到了接近完美的 97.5%。
- 在电脑上: 在处理复杂的计算机任务(OSWorld-Verified)时,它取得了 79.5% 的成绩,排名第二,击败了许多顶尖模型。它还展示了处理长周期、复杂任务的能力,在难度更高的 OSWorld-v2 基准测试中获得了 40.0% 的部分进度得分,这意味着即使不能完美完成每一个步骤,它也能完成大部分困难工作。
- 在网页端: 它在 WebArena(一个导航复杂网站的测试)中得分 73.6%,并在 ScreenSpot-Pro 上得分 81.5%,证明了即使在按钮非常微小或难以看清的情况下,它也能找到正确的按钮。
这意味着什么
论文指出,要构建真正有用的 AI 智能体,我们不能仅仅让大脑变得更大,我们必须改变它们的学习方式和练习场所。通过在真实设备上训练、结合不同的动作方式(点击与编程)、并让智能体协助设计自身的训练,Qwen-UI-Agent 已经证明了:将“视频游戏中的机器人”转化为“能在现实生活中真正帮助你的机器人”是可能的。
这还不是一个完美的解决方案——作者承认在安全性方面仍存在挑战,且尚未实现完全自动化——但这是一个巨大的进步。它表明,通过结合正确的现实世界实践和智能训练循环,我们的数字助手终于准备好离开教室,加入我们的现实生活了。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。