← 最新论文
💬 NLP

Scaling Agents for Computer Use

本文介绍了 Behavior Judge (BJudge),这是一个通过利用行为叙述(behavior narratives)对多个执行展开(execution rollouts)进行评估与筛选,从而提高计算机使用智能体可靠性的框架,其在 OSWorld 上的表现达到了最先进水平,并超越了人类水平。

原作者: Gonzalo Gonzalez-Pumariega, Vincent Tu, Chih-Lun Lee, Jiachen Yang, Ang Li, Xin Eric Wang

发布于 2026-02-05
📖 1 分钟阅读☕ 轻松阅读

原作者: Gonzalo Gonzalez-Pumariega, Vincent Tu, Chih-Lun Lee, Jiachen Yang, Ang Li, Xin Eric Wang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图通过观察电脑屏幕来教一个机器人做你的家务:洗衣服、做晚饭以及支付账单。这正是“计算机使用智能体”(Computer-Use Agents,简称 CUAs)想要实现的目标。它们是能够像人类一样点击按钮、输入文本并操作软件的 AI 程序。

然而,这里存在一个巨大的问题:这些机器人非常脆弱。如果它们在早期犯了一个微小的错误——比如点错了窗口或漏掉了一个弹窗——这个错误就会产生连锁反应。到第 50 步时,它们就已经完全迷失了。这就像是在一个有风的房间里搭建纸牌屋;一次小小的摇晃就会毁掉整个结构。

旧方法:“一锤定音”

此前,研究人员试图通过让机器人通过“更深入地思考”来解决这个问题。他们会让 AI 在进行下一次点击前生成五个不同的想法,并从中挑选出最好的一个。但这就像是要求一个人在去杂货店的路上想出五条不同的路线,选出最好的一条,然后出发。如果这个人由于第一个路口就产生了困惑,那么整个行程都会失败。

新思路:“竞赛”(宽扩展度)

该论文的作者提出了一种不同的策略,称为宽扩展度(Wide Scaling)。他们不再依赖一个机器人去做到完美,而是同时派出十个不同的机器人去尝试同一个任务。

把它想象成一场有十名选手的比赛。即使选手 #3 绊倒了,或者选手 #7 迷路了,也许选手 #5 会找到一条捷径并赢得比赛。目标是让十次尝试同时并行运行,然后选出胜者。

瓶颈:如何挑选胜者?

这里有一个棘手的部分:你如何知道这十个机器人中哪一个真正成功了?

  • 问题所在: 观看十段长达一小时的机器人尝试任务的视频是非常令人崩溃的。大部分视频内容都是无聊或无关的(比如机器人盯着空白屏幕看)。此外,许多任务都有不止一种“正确”的完成方式。简单的脚本无法仅通过观察原始屏幕录制来轻松判断机器人是成功还是失败。
  • 类比: 想象你要通过观看十部时长 3 小时的厨师烹饪电影来评判一场烹饪比赛。你会感到精疲力竭,并错过重要的时刻。你需要一种方法来总结这些动作。

解决方案:“行为评判员”(BJudge)

作者引入了一个名为 行为评判员(Behavior Judge,简称 BJudge) 的新系统。其工作流程如下:

  1. 竞赛: 他们使用不同的 AI 模型同时运行该任务十次。
  2. 翻译官(行为叙述生成器): 该系统不再向评判员展示原始的屏幕视频,而是充当一名翻译官。它观察每个机器人的尝试过程,并写出一个简短、清晰的故事(即“叙述”)。
    • 不是这样: “机器人将鼠标移动到像素 400, 200,点击,屏幕刷新,新窗口打开……”
    • 而是这样: “机器人点击了‘保存’,文档已成功保存到文件夹中。”
    • 它过滤掉了噪音,只关注因果关系:“我做了 X,结果发生了 Y。”
  3. 评判员(比较评估器): 现在,评判员不再需要观看十个小时的视频,而是阅读十个短篇故事。它会对这些故事进行横向对比。“故事 A 说文件已保存。故事 B 说文件被删除了。故事 A 获胜。”

实验结果

当他们在名为 OSWorld(一个包含现实世界计算机任务的基准测试集)上进行测试时:

  • 旧的最优方法: 原先表现最好的方法大约完成了 63.4% 的任务。
  • 人类水平: 人类完成任务的比例约为 72.36%
  • 新方法 (BJudge): 他们的系统达到了 72.6%

他们不仅超越了之前的机器人,甚至超越了人类

为什么这很重要

这篇论文表明,让 AI 智能体变得可靠的关键,不仅仅是让单个个体变得更聪明,而是要同时运行多个智能体,并拥有一个聪明的系统来挑选最佳结果。

他们还在不同的操作系统(Windows 和 Android)上进行了测试,发现该方法同样有效,证明了这种“竞赛与评判”的策略是让使用计算机的 AI 变得更加稳健的一种通用方式。

简而言之: 为了修复 AI 计算机的“脆弱性”,不要只制造一个完美的机器人。制造十个,让它们竞赛,将它们混乱的尝试转化为简单的故事,然后让一个聪明的评判员选出胜者。这一简单的改变让他们在复杂的数字任务上超越了人类的表现。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →