SCALECUA: Scaling Computer Use Agents with Verifiable Task Synthesis and Efficient Online RL
ScaleCUA 是一个统一的框架,通过利用用于可验证任务合成的 VeriGen、用于优化样本分配的 Frontier Sampling 以及用于加速训练的视觉上下文分割(Visual Context Segmentation),解决了数据稀缺和训练效率低下的问题,从而将开源计算机使用智能体提升至最先进的性能水平。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在试图教一个机器人像人类一样使用电脑。这个机器人必须观察屏幕、点击按钮、在终端中输入指令,并学会如何安装软件或整理文件。这就是**计算机使用智能体(Computer Use Agents, CUAs)**的世界。
长期以来,教导这些机器人就像是在玩一场没有计分板的游戏。你可以一直玩下去,但直到有人看完整个过程并对你说“做得好!”或“再试一次!”之前,你都不知道自己是否真的赢了。这使得学习过程变得极其缓慢且昂用,因为如果每场游戏都需要人工评分,你就无法同时运行成千上万场游戏。
SCALECUA 应运而生,它是一个全新的框架,充当了一个功能强大的、具有自我纠错能力的训练营,专门为这些机器人智能体设计。它解决了两个大问题:如何找到具有明确“获胜条件”的练习任务,以及如何让训练过程快到足以实际投入使用。
计分板问题:引入 VERIGEN
第一个障碍是,大多数计算机任务并没有内置的“游戏结束,你赢了”信号。为了解决这个问题,研究人员构建了 VERIGEN。
把 VERIGEN 想象成一个由三位机器人教练组成的团队,他们在巨大的、无限的虚拟计算机(Docker 容器)游乐场中工作。
- 提议者(The Proposer) 建议一个任务,例如“为你的电脑安装这个特定的主题”。
- 评判者(The Judger) 检查这些指令是否合理,以及“获胜条件”是否符合逻辑。
- 检查者(The Checker) 实际上会在虚拟计算机中尝试执行该任务,以观察其是否可行,以及“获胜条件”是否能被成功触发。
如果任务未能通过其中任何一项检查,它就会被丢弃。如果通过了,它就会成为一个经过验证的训练任务。最酷的部分在于?这组教练可以并行工作。他们可以同时运行 100 多名 这样的教练,并同时与 100 多个 虚拟计算机进行交互。
结果是,他们生成了超过 24,000 个经过验证的任务,以及近 3,000 个高质量的训练专用任务。与以往依赖于微小的、手动编写的任务列表的方法相比,这是一个巨大的飞跃。
训练策略:前沿采样(Frontier Sampling)
一旦你拥有了一座任务大山,该如何挑选哪些任务值得练习呢?一个常见的错误是随机挑选任务。但想象一下你在学习骑自行车:
- 如果你选择的任务太简单(在平地上骑行),你学不到任何东西。
- 如果你选择的任务太难(在陡峭的悬崖上骑行),你会摔倒并感到沮挫。
- 最完美的平衡点是“学习前沿(learning frontier)”——即那些你正处于“刚刚开始掌握”阶段的任务。
SCALECUA 使用了一种名为前沿采样的聪明策略。它会记录机器人在每一项任务上的表现得分。然后,它会将练习时间集中在那些机器人成功率恰好在 50% 左右徘徊的任务上。这确保了机器人始终在挑战极限,而不会陷入无法完成的挑战,也不会因为任务太简单而感到无聊。
提速技巧:视觉上下文分割(Visual Context Segmentation)
这里有一个棘手之处:计算机任务可能需要很长时间。一个任务可能涉及 47 个步骤(比如论文中提到的安装主题的例子)。如果你试图记住从第 1 步到第 47 步的每一个截图,你的大脑(或计算机的内存)会被淹没,导致训练速度极其缓慢。
研究人员通过视觉上下文分割解决了这个问题。想象你在读一个长篇故事,但与其把整本书都摊在桌上,你只让最近的几页可见。你会将之前的页面总结为文字摘要,但只盯着最近的页面来进行下一步决策。
这种技术保持了一个包含最近截图(大约 5 到 8 张图像)的“滑动窗口”,同时将较早的图像转化为文本摘要。这让机器人的记忆既新鲜又高效。研究发现,这种方法比尝试记住每一步的旧方法快了 2.83 倍,且不会导致机器人忘记如何解决问题。
结果:奏效了吗?
团队在一个名为 Qwen3.5-9B(一个 90 亿参数的视觉语言模型)的模型上测试了这个新系统。
- 在 OSWorld(一个针对通用桌面任务的基准测试)上,机器人的成功率达到了 68.7%。
- 在 ScienceBoard(一个针对复杂科学软件的基准测试)上,它达到了 54.0%。
这些数字意义重大。论文指出,这个 90 亿参数的模型击败了其他规模是其 四倍 的开源模型(如 320 亿参数的 EvoCUA),同时也超越了一些闭源模型,这表明训练的方法与机器人“大脑”的大小同样重要。
它没能做到的事情
了解这篇论文没有声称的内容也很重要。
- 它还不是所有电脑的万能钥匙。 测试是在 基于 Ubuntu 的桌面系统(一种特定的 Linux 计算机类型)上进行的。作者承认尚未在 Windows 或 macOS 上进行测试,因此我们尚不知道它在这些系统上的表现。
- 它有时间限制。 训练回合被限制在 50 个交互轮次 内。虽然这涵盖了大多数任务,但作者也指出,对于需要数百个步骤的超长、复杂的流程,这可能还不够。
- 这并非一个已解决的问题。 论文将此呈现为一个建立了开源智能体“最先进水平(state-of-the-art)”的新框架,但也承认向其他系统和规模的泛化仍是未来的工作。
简而言之,SCALECUA 是一个聪明的配方,它通过生成自己的练习题、专注于“难度适中”的水平,并只记住必要的过去信息来保持高效,从而教会机器人使用计算机。它表明,通过正确的训练工具,即使是较小的机器人大脑也能超越规模大得多的模型。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。