想象一下,你雇佣了一位非常聪明但极其缓慢的私人助理,在电脑上完成一项简单任务,比如更改文档中的字体大小。你预计只需 30 秒,结果助理却花了 12 分钟。这是为什么?
这篇论文《OSWorld-Human》正是针对这一问题展开研究。它考察了“计算机使用代理”(即控制鼠标和键盘的 AI 程序),并提出:“为什么它们如此缓慢,又该如何让它们更快?”
以下是其研究发现的简要解析,辅以通俗类比:
1. 问题所在:“过度思考”的助理
研究人员发现,尽管这些 AI 代理在“完成任务”(准确性)方面表现越来越好,但在“完成速度”(效率)方面却极差。
- 人类与机器人对比:一位人类专家可在 30 秒内完成文档行距调整,而 AI 代理却耗时 12 分钟。
- 瓶颈所在:延迟并非因为 AI 点击鼠标缓慢,而是因为它不断停下来思考。
- 类比:想象你开车去杂货店。人类司机直接驾驶;而这位 AI 司机却在每个路口都停下来,打电话给一位超级智能顾问询问:“这个转弯对吗?该左转吗?我刚才左转对吗?下一个路口呢?”
- 现实情况:AI 需要调用一个庞大的“大脑”(大型语言模型)来规划下一步行动、判断上一步是否成功,并反思已发生的情况。这些“电话”耗时最多。事实上,仅“规划”和“判断”步骤就占据了总时间的75% 至 96%!
2. 调查过程:拆解每一步
研究人员观察了两个流行的 AI 代理(Agent S2 和 GTA1)尝试解决 39 项不同的计算机任务,并拆解了每一秒的过程。
- “思考”税:AI 每执行一步,都必须向它的“大脑”发送一条巨大信息。随着任务变长,这条信息也变大,因为它必须包含之前所有操作的完整历史。
- 类比:这就像写日记。第一天你只写一句话;到了第 50 天,你却必须重写从第一天开始整本书的内容,只为添加一个新句子。这使得后期步骤耗时是早期步骤的3 倍。
- “走错路”循环:有时,AI 知道该做什么(例如“点击打开按钮”),却找不到屏幕上点击哪里。它点错位置,意识到错误,然后重试。
- 代价:这种“卡住”的情况频繁发生。在一个案例中,AI 试图打开一个文件夹,结果在循环中卡了 27 分钟,白白浪费了 8.47 美元的算力成本,仅仅因为它无法在屏幕上找到正确位置。
3. 解决方案:“人类基准”(OSWorld-Human)
为了证明这些机器人效率低下,研究人员创建了一个新基准,称为OSWorld-Human。
- 它是什么? 他们手动完成了全部 369 项任务,并记录下人类完成这些任务所采取的最短、最合理的路径。
- “分组”技巧:他们发现,人类常常一次性完成多件事,而无需停下来思考。
- 类比:人类看到一个文本框,输入名字,然后按下“回车键”,整个过程一气呵成。而 AI 却在看到文本框后停下,调用大脑规划输入,再次停下规划按“回车”,又一次调用大脑。
- 发现:研究人员发现,许多操作可以“分组”进行。如果 AI 能在一次“思考”中完成三次点击,将节省大量时间。
4. 结论:机器人在浪费步骤
研究人员用 16 个不同的 AI 代理测试了他们的新“人类基准”。
- 结果:即使是表现最好的 AI 代理,完成相同任务所需的步骤数也是人类所需步骤的2.7 至 4.3 倍。
- 评分:他们创建了一个新指标,称为加权效率得分(WES)。
- 如果 AI 完成了任务,但耗时是必要时间的 4 倍,其得分将大幅下降。
- 排行榜上得分最高的 AI,在旧测试中表现优异,但在新效率测试中仅得15.6%。这意味着它做了大量不必要的工作。
总结
该论文得出结论:当前的 AI 计算机代理就像聪明但笨拙的学生。他们知道答案,却花了太多时间举手、等待老师、重读笔记,以至于从未按时完成考试。
为解决这一问题,论文提出三点建议:
- 停止过度思考:减少 AI 调用其“大脑”进行规划和判断的次数。
- 分组操作:让 AI 在一次“思考”中完成多个步骤(如输入文字并按回车)。
- 提升定位能力:提高 AI 准确识别点击位置的能力,避免陷入循环。
目标不仅是让 AI 更聪明,更是让它更快、更实用,以适应现实世界的应用需求。
技术摘要:OSWorld-Human:计算机使用代理效率基准测试
1. 问题陈述
尽管由生成式人工智能驱动的计算机使用代理(CUAs)在 OSWorld 等基准测试中展现了日益提升的准确率,但它们面临一个关键瓶颈:极端的端到端延迟。最先进的系统完成人类专家仅需数秒或数分钟即可完成任务,往往需要数十分钟。这种差异使得当前代理在实际交互式或时间敏感的工作流中几乎无法使用。先前的研究主要集中于提高任务成功率,在很大程度上忽视了实际部署所需的时序效率。目前缺乏对延迟来源(例如特定代理步骤、模型调用)的系统性理解,也缺乏与人类执行相比究竟需要多少步骤的明确认知。
2. 方法论
作者利用OSWorld基准测试,对 CUAs 的时序性能进行了首次系统性研究。该基准测试涵盖了 Ubuntu、Windows 和 MacOS 上 9 个应用程序(例如 Chromium、GIMP、LibreOffice、VS Code)中的 369 个任务。
2.1 延迟与步骤分析
该研究使用两个领先的开源框架:Agent S2和GTA1,对代理轨迹进行了详细分解。
- 仪器化: 作者对特定步骤进行了性能分析,包括信息检索、步骤规划、步骤定位(寻找坐标)、动作执行、截图、判断和反思。
- 模型配置: Agent S2 使用 GPT-4.1 进行规划和反思,使用 UI-TARS-7B-DPO 进行定位。GTA1 使用 o3 进行规划和判断,使用 GTA1-7B 进行定位。
- 观察模态: 该研究分析了不同感知输入的影响:原始截图、无障碍(A11y)树和标记集(SoM)。
- 成本与失败分析: 作者分析了 GTA1 的 token 数量、财务成本以及失败模式(特别是导致循环的定位错误)。
2.2 OSWorld-Human 的构建
为了建立效率的基准真值,作者构建了OSWorld-Human,这是一个包含以下内容的经过人工标注的数据集:
- 最小人类轨迹: 针对所有 369 个 OSWorld 任务,人工标注者根据已验证的基准真值来源,确定了成功完成所需的最小步骤数。
- 动作分组: 该数据集包含“分组动作”轨迹,其中多个连续动作(例如点击、输入、按回车)若可从单次视觉观察中执行,则被合并为单个步骤。这识别出了减少大语言模型(LLM)调用机会的潜力。
2.3 评估指标:加权效率分数(WES)
作者提出了一项新指标加权效率分数(WES),用于根据人类轨迹评估代理。
- 公式: WES=WES+⋅(1−Stˉfail)
- WES+:成功任务中人类步骤与代理步骤的平均比率(thuman/tagent)。
- 惩罚乘数: 惩罚那些在消耗大量步骤预算后仍失败任务的代理(tˉfail是失败任务上的平均步骤数;S是允许的最大步骤数)。
- 目的: 该指标奖励以较少步骤成功的代理,并惩罚低效失败的代理,从而提供准确率和时序效率的全局视角。
3. 关键发现与结果
3.1 延迟来源
- LLM 调用是瓶颈: 用于规划、反思和判断的大型模型调用占据了延迟的绝大部分。
- 在Agent S2中,规划和反思占总任务延迟的76%–96%。
- 在GTA1中,规划和判断占总延迟的91%–96%。
- 依赖步骤的延迟: 随着代理完成任务所需的步骤增加,每个后续步骤的延迟也随之增加。这是由于“历史累积”机制,即提示词包含所有先前的步骤,导致上下文窗口变长且 token 数量增加。
- 观察影响: 包含 A11y 树会显著增加延迟(由于树生成时间和 token 量),并且通常会增加所需步骤数,尽管它可能减少特定应用程序(如 GIMP)的步骤数。
3.2 效率差距
- 当前代理的低效性: 即使是表现最好的代理,完成任务所需的步骤数也比人类轨迹多2.7 倍至 4.3 倍。
- WES 分数: OSWorld 排行榜上表现最佳的代理(Agent S2 搭配 Gemini 2.5)成功率为41.4%,但在单动作轨迹上的 WES 仅为15.6%,在分组动作轨迹上仅为9.6%。
- 失败分析: 对于 GTA1,**23%**的失败是由于定位错误造成的,即规划正确,但定位模型生成了错误的坐标,导致代理重复步骤或进入循环。在某些情况下,代理在单个循环中浪费了 72 多个步骤。
3.3 成本影响
- 计算成本严重偏向于规划。对于 GTA1,规划占总成本的87%,而判断占 13%。由于并行规划展开和重试机制,成本随步骤数呈二次方增长。
4. 主要贡献
- 首次系统性延迟研究: 对 OSWorld 基准测试上 CUAs(Agent S2 和 GTA1)的时序性能进行了详细分析,确定 LLM 调用为主要瓶颈。
- OSWorld-Human 数据集: 一个经过人工策划和交叉验证的基准,包含所有 369 个 OSWorld 任务的最优人类轨迹和分组动作轨迹。
- 新指标(WES): 提出加权效率分数,根据成功率和步骤效率评估代理,并对低效失败进行惩罚。
- 动作分组分析: 证明了将从单次观察中可执行的动作进行分组,可以显著减少所需的 LLM 调用次数和步骤数。
- 综合评估: 利用 OSWorld-Human 对 16 个最先进代理进行了评估,揭示当前系统的效率显著低于人类基准。
- 失败与成本分析: 确定定位错误是步骤浪费和循环的主要原因,并分解了当前代理架构相关的财务成本。
5. 意义与主张
该论文声称建立了首个统一框架,用于基准测试、分析和改进计算机使用代理的时序效率。作者认为,虽然准确率很重要,但时序效率对于实际可用性同样至关重要。
该研究强调,由于高延迟和过多的步骤数,当前代理在交互式场景中实际上无法使用。通过提供 OSWorld-Human 和 WES 指标,作者旨在引导未来的发展方向:
- 降低规划、判断和反思调用的延迟。
- 通过动作分组最小化每个任务的步骤数。
- 改进定位机制以防止循环和坐标错误。
- 压缩历史以管理 token 成本和延迟。
作者总结道,他们的工作和开源数据集将促进新的研究方向,以弥合当前代理能力与实际部署所需效率之间的差距。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。