Qwen-CUA: Native Computer Use for (almost) Everything
该论文介绍了 Qwen-CUA,这是一种基于 397B 混合专家模型骨干网络的原生计算机使用智能体,它仅通过屏幕截图和输入事件进行操作而不依赖 DOM 树,通过大规模云端部署训练、可验证奖励优化以及可扩展架构,在计算机使用基准测试中实现了最先进的性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下这样一个世界:你的电脑不再只是等待你点击按钮,而是能真正“观察”你的行为,并学习如何为你代劳。这就是“AI智能体”(AI agents)这一激动人心的前沿领域——这是一个让计算机学习在数字世界中像人类一样行动的科学分支。长期以来,这些智能体就像是只能阅读教科书(代码)或遵循严格说明书(API)的天才学生。它们擅长数学和逻辑,但如果你让它们使用一个杂乱、陈旧的程序,或者是一个每次刷新都会变化的网站,它们就会迷失方向。它们无法像人类那样“看到”屏幕;它们需要关于网站结构的特殊蓝图才能知道按钮在哪里。然而,我们的数字生活大部分发生在并不具备这些蓝图的屏幕上。这篇论文解决了如何教导 AI 成为一名真正的“数字学徒”的挑战:它只需观察屏幕,弄清楚该做什么,然后像人一样进行点击或输入,而无需任何特殊的捷径或隐藏地图。
研发该研究的团队推出了 Qwen-CUA,这是一种新型的 AI 智能体,旨在成为一名“原生”计算机使用者。把它想象成教机器人开车。与其给机器人一张包含每条道路和交通灯的完美数字地图(对于许多旧式或复杂的软件程序来说,这种地图并不存在),不如教机器人看向窗外,观察路况,并根据所见内容转动方向盘。Qwen-CUA 只通过“观察”计算机屏幕的截图来感知,并且只通过发送键盘和鼠标指令来进行“动作”。它不会窥探底层代码,也不会向软件寻求帮助;它只是观察并学习。
为了让这个机器人足够聪明以应对现实生活中的任务,研究人员必须建造一个庞大的“训练健身房”。他们创建了一个云端集群,拥有近 100,000 个虚拟 CPU(想象一下成千上万台计算机同时工作的城市),并设置了大约 40,000 个不同的任务供 AI 进行练习。这些任务涵盖了从简单的文件整理到专业软件中复杂的、多步骤的工作流。系统不仅是在任务结束时给予一个“做得好”或“再试一次”的反馈,其设计初衷是验证任务是否真正正确完成,从而让 AI 能够通过不断重复的过程从错误中学习。
结果令人印象深刻。在八个不同基准测试的评估中,Qwen-CUA 一致超越了它的前身 Qwen3.7,甚至足以与当今一些最强大、最昂贵的 AI 系统抗衡。例如,在名为 OSWorld-Verified 的测试中(该测试衡量 AI 处理日常桌面任务的能力),Qwen-CUA 得分为 86.2,而之前的模型得分为 73.3。当他们将规模扩大到名为 Qwen-CUA-Max 的更大模型(拥有超过一万亿个参数)时,得分攀升至 87.6。
这篇论文最酷的地方之一在于它如何处理长而复杂的任务。想象一下,在写新章节时,你需要记住一周前读过的一个故事。AI 必须记住许多步骤前的屏幕状态,才能知道自己在任务中所处的阶段。研究人员通过赋予 AI 一种“视觉记忆”解决了这个问题,这种记忆可以保存最后 20 张截图,并将较旧的截图巧妙地“折叠”成摘要,以免其感到负担过重。这使得 AI 在进行长流程工作时能够保持冷静,而不会忘记故事的开头。
论文还探讨了安全性。他们针对 “RedTeamCUA” 对 AI 进行了测试,这是一项挑战,其中 AI 会被隐藏在屏幕中的虚假指令所误导。新模型在忽略这些陷阱方面表现得更好,将攻击成功率从 36.6% 降低到了 16.4%,同时仍能顺利完成自己的任务。
最后,研究人员探索了一种“混合”方法。他们发现,如果允许 AI 在使用鼠标和键盘技能的同时,配合使用命令行工具(类似于用于文件操作的文本式“魔法棒”),它就能更快地完成任务。然而,AI 有时会在错误的时机切换工具,因此虽然速度更快,但并非总是完美。作者认为,随着更多的训练,这种视觉观察与文本命令的结合将是让 AI 智能体实现真正高效的关键。
简而言之,这篇论文表明,我们不需要特殊的桥梁来将 AI 连接到我们的计算机。通过教导 AI 仅仅观察屏幕并像人类一样行动,我们可以构建出能够应对几乎任何软件(从最新的应用到最古老的程序)的智能体,同时通过大量的现实世界实践进行学习。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。