← 最新论文
🤖 machine learning

Qwen-CUA: Native Computer Use for (almost) Everything

该论文介绍了 Qwen-CUA,这是一种基于 397B 混合专家模型骨干网络的原生计算机使用智能体,它仅通过屏幕截图和输入事件进行操作而不依赖 DOM 树,通过大规模云端部署训练、可验证奖励优化以及可扩展架构,在计算机使用基准测试中实现了最先进的性能。

原作者: Dunjie Lu, Shuai Bai, Tianyi Bai, Sicheng Fan, Chang Gao, Jian Guan, Feng Hu, Mianqiu Huang, Xingyang Huang, Yizhen Jiang, Yuheng Jing, Dehui Kong, Ning Li, Dayiheng Liu, Shixuan Liu, Zheng Liu, Que S
发布于 2026-08-04
📖 1 分钟阅读☕ 轻松阅读

原作者: Dunjie Lu, Shuai Bai, Tianyi Bai, Sicheng Fan, Chang Gao, Jian Guan, Feng Hu, Mianqiu Huang, Xingyang Huang, Yizhen Jiang, Yuheng Jing, Dehui Kong, Ning Li, Dayiheng Liu, Shixuan Liu, Zheng Liu, Que Shen, Bowen Wang, Junli Wang, Chencan Wu, Rui Xie, Tianbao Xie, Zhihui Xie, Haiyang Xu, An Yang, Tao Yu, Wenzhen Yuan, Xi Zhang, Zhenru Zhang, Mingkang Zhu, Zhaoqing Zhu, Yizhong Cao, Kai Dang, Binyuan Hui, Kaixin Li, Junyang Lin, Haiquan Wang, Zekun Wang, Yiheng Xu, Fan Yan, Mengqi Yuan, Danyang Zhang, Jiajun Zhang, Zhipeng Zhang, Fan Zhou, Fan Zhou

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下这样一个世界:你的电脑不再只是等待你点击按钮,而是能真正“观察”你的行为,并学习如何为你代劳。这就是“AI智能体”(AI agents)这一激动人心的前沿领域——这是一个让计算机学习在数字世界中像人类一样行动的科学分支。长期以来,这些智能体就像是只能阅读教科书(代码)或遵循严格说明书(API)的天才学生。它们擅长数学和逻辑,但如果你让它们使用一个杂乱、陈旧的程序,或者是一个每次刷新都会变化的网站,它们就会迷失方向。它们无法像人类那样“看到”屏幕;它们需要关于网站结构的特殊蓝图才能知道按钮在哪里。然而,我们的数字生活大部分发生在并不具备这些蓝图的屏幕上。这篇论文解决了如何教导 AI 成为一名真正的“数字学徒”的挑战:它只需观察屏幕,弄清楚该做什么,然后像人一样进行点击或输入,而无需任何特殊的捷径或隐藏地图。

研发该研究的团队推出了 Qwen-CUA,这是一种新型的 AI 智能体,旨在成为一名“原生”计算机使用者。把它想象成教机器人开车。与其给机器人一张包含每条道路和交通灯的完美数字地图(对于许多旧式或复杂的软件程序来说,这种地图并不存在),不如教机器人看向窗外,观察路况,并根据所见内容转动方向盘。Qwen-CUA 只通过“观察”计算机屏幕的截图来感知,并且只通过发送键盘和鼠标指令来进行“动作”。它不会窥探底层代码,也不会向软件寻求帮助;它只是观察并学习。

为了让这个机器人足够聪明以应对现实生活中的任务,研究人员必须建造一个庞大的“训练健身房”。他们创建了一个云端集群,拥有近 100,000 个虚拟 CPU(想象一下成千上万台计算机同时工作的城市),并设置了大约 40,000 个不同的任务供 AI 进行练习。这些任务涵盖了从简单的文件整理到专业软件中复杂的、多步骤的工作流。系统不仅是在任务结束时给予一个“做得好”或“再试一次”的反馈,其设计初衷是验证任务是否真正正确完成,从而让 AI 能够通过不断重复的过程从错误中学习。

结果令人印象深刻。在八个不同基准测试的评估中,Qwen-CUA 一致超越了它的前身 Qwen3.7,甚至足以与当今一些最强大、最昂贵的 AI 系统抗衡。例如,在名为 OSWorld-Verified 的测试中(该测试衡量 AI 处理日常桌面任务的能力),Qwen-CUA 得分为 86.2,而之前的模型得分为 73.3。当他们将规模扩大到名为 Qwen-CUA-Max 的更大模型(拥有超过一万亿个参数)时,得分攀升至 87.6

这篇论文最酷的地方之一在于它如何处理长而复杂的任务。想象一下,在写新章节时,你需要记住一周前读过的一个故事。AI 必须记住许多步骤前的屏幕状态,才能知道自己在任务中所处的阶段。研究人员通过赋予 AI 一种“视觉记忆”解决了这个问题,这种记忆可以保存最后 20 张截图,并将较旧的截图巧妙地“折叠”成摘要,以免其感到负担过重。这使得 AI 在进行长流程工作时能够保持冷静,而不会忘记故事的开头。

论文还探讨了安全性。他们针对 “RedTeamCUA” 对 AI 进行了测试,这是一项挑战,其中 AI 会被隐藏在屏幕中的虚假指令所误导。新模型在忽略这些陷阱方面表现得更好,将攻击成功率从 36.6% 降低到了 16.4%,同时仍能顺利完成自己的任务。

最后,研究人员探索了一种“混合”方法。他们发现,如果允许 AI 在使用鼠标和键盘技能的同时,配合使用命令行工具(类似于用于文件操作的文本式“魔法棒”),它就能更快地完成任务。然而,AI 有时会在错误的时机切换工具,因此虽然速度更快,但并非总是完美。作者认为,随着更多的训练,这种视觉观察与文本命令的结合将是让 AI 智能体实现真正高效的关键。

简而言之,这篇论文表明,我们不需要特殊的桥梁来将 AI 连接到我们的计算机。通过教导 AI 仅仅观察屏幕并像人类一样行动,我们可以构建出能够应对几乎任何软件(从最新的应用到最古老的程序)的智能体,同时通过大量的现实世界实践进行学习。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →