← 最新论文
🤖 machine learning

OSWorld-Human: Benchmarking the Efficiency of Computer-Use Agents

本文介绍了 OSWorld-Human,这是一个人工标注的基准测试,揭示了当前计算机使用代理存在令人难以接受的延迟和低效问题,这主要是由于规划和反思过程中过多的模型调用所致,导致其完成任务所需的步骤数是人类的 2.7 到 4.3 倍。

原作者: Reyna Abhyankar, Qi Qi, Yiying Zhang

发布于 2026-05-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Reyna Abhyankar, Qi Qi, Yiying Zhang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你雇佣了一位非常聪明但极其缓慢的私人助理,在电脑上完成一项简单任务,比如更改文档中的字体大小。你预计只需 30 秒,结果助理却花了 12 分钟。这是为什么?

这篇论文《OSWorld-Human》正是针对这一问题展开研究。它考察了“计算机使用代理”(即控制鼠标和键盘的 AI 程序),并提出:“为什么它们如此缓慢,又该如何让它们更快?”

以下是其研究发现的简要解析,辅以通俗类比:

1. 问题所在:“过度思考”的助理

研究人员发现,尽管这些 AI 代理在“完成任务”(准确性)方面表现越来越好,但在“完成速度”(效率)方面却极差。

  • 人类与机器人对比:一位人类专家可在 30 秒内完成文档行距调整,而 AI 代理却耗时 12 分钟。
  • 瓶颈所在:延迟并非因为 AI 点击鼠标缓慢,而是因为它不断停下来思考
    • 类比:想象你开车去杂货店。人类司机直接驾驶;而这位 AI 司机却在每个路口都停下来,打电话给一位超级智能顾问询问:“这个转弯对吗?该左转吗?我刚才左转对吗?下一个路口呢?”
    • 现实情况:AI 需要调用一个庞大的“大脑”(大型语言模型)来规划下一步行动、判断上一步是否成功,并反思已发生的情况。这些“电话”耗时最多。事实上,仅“规划”和“判断”步骤就占据了总时间的75% 至 96%

2. 调查过程:拆解每一步

研究人员观察了两个流行的 AI 代理(Agent S2 和 GTA1)尝试解决 39 项不同的计算机任务,并拆解了每一秒的过程。

  • “思考”税:AI 每执行一步,都必须向它的“大脑”发送一条巨大信息。随着任务变长,这条信息也变大,因为它必须包含之前所有操作的完整历史。
    • 类比:这就像写日记。第一天你只写一句话;到了第 50 天,你却必须重写从第一天开始整本书的内容,只为添加一个新句子。这使得后期步骤耗时是早期步骤的3 倍
  • “走错路”循环:有时,AI 知道该做什么(例如“点击打开按钮”),却找不到屏幕上点击哪里。它点错位置,意识到错误,然后重试。
    • 代价:这种“卡住”的情况频繁发生。在一个案例中,AI 试图打开一个文件夹,结果在循环中卡了 27 分钟,白白浪费了 8.47 美元的算力成本,仅仅因为它无法在屏幕上找到正确位置。

3. 解决方案:“人类基准”(OSWorld-Human)

为了证明这些机器人效率低下,研究人员创建了一个新基准,称为OSWorld-Human

  • 它是什么? 他们手动完成了全部 369 项任务,并记录下人类完成这些任务所采取的最短、最合理的路径
  • “分组”技巧:他们发现,人类常常一次性完成多件事,而无需停下来思考。
    • 类比:人类看到一个文本框,输入名字,然后按下“回车键”,整个过程一气呵成。而 AI 却在看到文本框后停下,调用大脑规划输入,再次停下规划按“回车”,又一次调用大脑。
    • 发现:研究人员发现,许多操作可以“分组”进行。如果 AI 能在一次“思考”中完成三次点击,将节省大量时间。

4. 结论:机器人在浪费步骤

研究人员用 16 个不同的 AI 代理测试了他们的新“人类基准”。

  • 结果:即使是表现最好的 AI 代理,完成相同任务所需的步骤数也是人类所需步骤的2.7 至 4.3 倍
  • 评分:他们创建了一个新指标,称为加权效率得分(WES)
    • 如果 AI 完成了任务,但耗时是必要时间的 4 倍,其得分将大幅下降。
    • 排行榜上得分最高的 AI,在旧测试中表现优异,但在新效率测试中仅得15.6%。这意味着它做了大量不必要的工作。

总结

该论文得出结论:当前的 AI 计算机代理就像聪明但笨拙的学生。他们知道答案,却花了太多时间举手、等待老师、重读笔记,以至于从未按时完成考试。

为解决这一问题,论文提出三点建议:

  1. 停止过度思考:减少 AI 调用其“大脑”进行规划和判断的次数。
  2. 分组操作:让 AI 在一次“思考”中完成多个步骤(如输入文字并按回车)。
  3. 提升定位能力:提高 AI 准确识别点击位置的能力,避免陷入循环。

目标不仅是让 AI 更聪明,更是让它更快、更实用,以适应现实世界的应用需求。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →