← 最新论文
💻 computer science

Qwen-UI-Agent Technical Report: Toward Next-Generation Real-World Centric Foundation GUI Agents

Qwen-UI-Agent 是一个以现实世界为中心的通用 GUI 智能体,它通过混合动作空间和 AutoResearch 式的数据飞轮,统一了移动端、计算机、网页及 DeepSearch 环境,在实现移动端基准测试最先进性能的同时,也在更广泛的数字化任务中提供了极具竞争力的结果。

原作者: Hanzhang Zhou, Panrong Tong, Xu Zhang, Quyu Kong, Chenglin Cai, Tianyu Xia, Gongjie Zhang, Jianan Zhang, Long Li, Long Chen, Lei Wang, Gaole Dai, Pengxiang Li, Liangyu Chen, Yue Wang, Steven Hoi

发布于 2026-07-31
📖 1 分钟阅读☕ 轻松阅读

原作者: Hanzhang Zhou, Panrong Tong, Xu Zhang, Quyu Kong, Chenglin Cai, Tianyu Xia, Gongjie Zhang, Jianan Zhang, Long Li, Long Chen, Lei Wang, Gaole Dai, Pengxiang Li, Liangyu Chen, Yue Wang, Steven Hoi

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你有一个超级聪明的机器人朋友,它能处理你的数字上下文并完成你要求的任何事情。但现在,这个机器人就像一个只在完美的、安静的教室里学习过的学生。它知道如何在纸上解数学题,但如果你把它放在一个混乱的厨房里,面对粘糊糊的炉灶、吠叫的狗和卡住的门,它可能会感到困惑并掉落吐司。这就是目前“GUI智能体”(GUI agents)的现状——这些旨在像人类一样观察屏幕并点击按钮的计算机程序。它们在安全的模拟视频游戏中表现出色,但面对手机和电脑中混乱、不可预测的现实情况时,往往会跌跌撞撞。

科学家们正在提出的核心问题是:我们如何教这些数字助手停止做“教室里的学生”,开始成为“现实世界的专家”?我们需要它们不仅是点击按钮,还要理解当弹窗广告遮挡视线时该怎么办,如何在手机和笔记本电脑之间切换而不丢失思路,甚至在察觉到异常(比如航班取消)时,能在你开口之前就提供解决方案。如果我们能破解这个密码,这些智能体就能成为终极助手,处理从预订旅行到组织你的数字生活的一切事务,让技术不再感觉像是一个你必须与之搏斗的工具,而是一个真正“懂你”的伙伴。


遇见 Qwen-UI-Agent:在现实世界中学习生活的机器人

走进 Qwen-UI-Agent,这是一种由阿里巴巴 MAI-UI 团队开发的全新数字助手。把它想象成“在训练假人身上练习的机器人”与“真正上过擂台的战士”之间的区别。当其他智能体忙于在视频游戏模拟中获得完美分数时,Qwen-UI-Agent 被派往了野外,在超过 100 部真实的物理手机上进行学习,应对真实的 App、真实的互联网连接以及现实生活中的各种干扰。

团队意识到,要制作一个真正有用的智能体,不能仅仅让大脑变得更聪明,还必须改变它的整个身体和它所生活的环境。以下是他们实现这一目标的方法,我们使用了一些有趣的类比来解释其中的奥秘:

1. “现实世界健身房” vs. “视频游戏”

大多数 AI 智能体在“沙盒”中训练——那些在每次尝试后都会被完美重置的数字房间。这就像是在一个篮球场上练习,篮筐永远不动,球也永远不会弹错方向。但现实生活是混乱的。手机会有弹窗广告,App 会崩溃,你可能会遇到意料之外的权限请求。

Qwen-UI-Agent 是在 真实设备移动运行时(Real-Device Mobile Runtime) 中训练的。想象一个巨大的仓库,里面有超过 100 部真实的物理手机,运行着像你我一样使用的真实 App。该系统非常聪明,它能识别出“生病”的手机(即运行异常的手机),并立即将任务切换到健康的手机上,就像教练在比赛中更换球员一样。这使得智能体能够学习如何处理现实世界的混乱,从奇怪的弹窗到网络故障,而不是仅仅死记硬背视频游戏中的完美路径。

2. “瑞士军刀”式的动作空间

以前,智能体的动作就像只能用手的人(点击和轻触)。如果它们需要移动文件或进行复杂的计算,必须通过菜单点击数小时。Qwen-UI-Agent 拥有了一把 “瑞士军刀”

它学会了将 GUI 动作(点击、输入、滚动)与 CLI 动作(在终端中输入命令,像个电脑巫师一样)结合起来。

  • 类比: 假设你需要整理 100 张照片。普通的智能体会重复执行“打开”、“选择”、“移动”、“重复” 100 次。Qwen-UI-Agent 则可以直接说:“嘿,我直接用一条命令把所有文件都移走!”它还可以进行 批量(batch) 操作,这意味着它可以在一次规划中完成一整套动作序列,就像棋手在走棋前会思考三步之后,而不是一次只动一个棋子。这让它变得极其快速且高效。

3. “自动教练”数据飞轮

通常,教导一个机器人需要大量人类老师编写测试题并批改答案。这既慢又枯燥。Qwen-UI-Agent 使用的是一种 AutoResearch 风格的数据飞轮

可以把这想象成一个机器人教练,它观察机器人的表现,发现哪里出错,然后立即创建一个针对该错误的、更难的专项练习。智能体本身可以帮助设计任务、发现自己的错误并规划下一轮训练。这是一个自我进化的循环,机器人通过自我教学变得更好,人类只需提供高层级的指导。

4. “主动管家”

大多数机器人都在等待你说:“嘿,做这个。”但 Qwen-UI-Agent 拥有一个 Harness 层,让它能够变得主动。

  • 类比: 想象你收到一条航班取消的通知。普通的机器人会等着你告诉它去寻找新航班。Qwen-UI-Agent 会检测到通知,推断出可执行的事件,检查你的日历,查看列车时刻表,对比价格,并在你醒来之前就为你呈现一份完整的恢复方案。它不只是等待指令;它能从你的数字信号中识别出可执行的时刻,并提出合适的后续步骤。

结果:奏效了吗?

团队在一些非常艰苦的竞技场中对 Qwen-UI-Agent 进行了测试,结果令人印象深刻。

  • 在真实手机上: 在名为 MobileWorld-Real 的基准测试中(使用带有真实 App 的真实手机),Qwen-UI-Agent 的成功率达到了 92.2%。它大幅领先于最优秀的闭源模型(如 Opus 4.8 和 GPT-5.6 Sol)。在另一个名为 AndroidDaily 的测试中,它达到了接近完美的 97.5%
  • 在电脑上: 在处理复杂的计算机任务(OSWorld-Verified)时,它取得了 79.5% 的成绩,排名第二,击败了许多顶尖模型。它还展示了处理长周期、复杂任务的能力,在难度更高的 OSWorld-v2 基准测试中获得了 40.0% 的部分进度得分,这意味着即使不能完美完成每一个步骤,它也能完成大部分困难工作。
  • 在网页端: 它在 WebArena(一个导航复杂网站的测试)中得分 73.6%,并在 ScreenSpot-Pro 上得分 81.5%,证明了即使在按钮非常微小或难以看清的情况下,它也能找到正确的按钮。

这意味着什么

论文指出,要构建真正有用的 AI 智能体,我们不能仅仅让大脑变得更大,我们必须改变它们的学习方式和练习场所。通过在真实设备上训练、结合不同的动作方式(点击与编程)、并让智能体协助设计自身的训练,Qwen-UI-Agent 已经证明了:将“视频游戏中的机器人”转化为“能在现实生活中真正帮助你的机器人”是可能的。

这还不是一个完美的解决方案——作者承认在安全性方面仍存在挑战,且尚未实现完全自动化——但这是一个巨大的进步。它表明,通过结合正确的现实世界实践和智能训练循环,我们的数字助手终于准备好离开教室,加入我们的现实生活了。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →