← 最新论文
💻 computer science

How Benchmarks Mis-Score Computer-Use Agents

本文通过指出任务构建、观测和评分中导致错误失败判定(erroneous failure verdicts)的系统性缺陷,批判了当前计算机使用智能体基准测试的可靠性,并提出了一个用于提高评估准确性的诊断框架和设计规则。

原作者: Zihan Dong, Zhiyuan Ma, Zekun Wang, Yunqing Li, Zirou Liu, Ruixuan Deng, Qishi Zhan, Rui Qian

发布于 2026-07-31
📖 1 分钟阅读☕ 轻松阅读

原作者: Zihan Dong, Zhiyuan Ma, Zekun Wang, Yunqing Li, Zirou Liu, Ruixuan Deng, Qishi Zhan, Rui Qian

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在电视上观看一场高水平的烹饪比赛。评委们应该品尝菜肴并决定谁是赢家。但如果评委们使用的是一个坏掉的味觉测试呢?如果他们遵循的食谱是用消失的墨水写的,或者他们使用的烤箱实际上是一个无法加热的玩具呢?在人工智能的世界里,特别是“计算机使用智能体”(能够像人类一样点击、打字和浏览网页的智能机器人)领域,我们也面临着类似的问题。这些机器人正在接受测试,以看它们是否能胜任真实的工作,比如报税或预订机票。然而,我们用来给它们评分的“计分卡”往往是有缺陷的。它们可能会给一个表现出色的机器人一个不及格的分数,或者可能因为测试本身坏了而忽略了机器人失败的事实。这篇论文就像是一个侦探故事,作者们在调查为什么这些计分卡在对我们撒谎。

这篇题为《基准测试如何误判计算机使用智能体》(How Benchmarks Mis-Score Computer-Use Agents)的论文指出,我们目前测试这些 AI 机器人的方式存在严重缺陷。作者发现,当一个机器人得到“失败”(FAIL)的分数时,这个分数出错的可能性非常高。在他们对 150 个机器人被判定为失败的具体案例进行的调查中,他们发现这些“失败”判决中有 15.3% 其实是错误的。

以下是错误发生的原因:

  • 评委过于挑剔(10.7%): 有时机器人做了正确的事情,但自动检查器过于死板。这就像是因为厨师使用了一把与食谱卡上略有不同的刀,就判定他们失败一样,尽管食物的味道非常完美。
  • 测试本身坏了(4.7%): 有时机器人无法完成任务是因为测试环境损坏了。这就像是要求一位厨师在一个没有电的烤箱里烤蛋糕。机器人失败了,但并不是因为它厨艺不好;而是厨房坏了。

作者还观察了那些真正失败了的机器人。他们发现,失败的主要原因通常不是机器人点错了按钮(这就像是手脚笨拙),而是机器人大多因为陷入了错误规划的循环,或者没有意识到自己的行为不起作用(就像一位厨师不停地搅拌一个已经空了的锅)。

该论文建议,我们不能仅仅通过一个数字(如“通过率”)来判断一个 AI 是否优秀。那个数字隐藏了太多的秘密。相反,我们需要构建更难被破坏的更好测试,使用能理解不同解决问题的更聪明的评委,并提供测试的完整视频录像,以便我们能准确看到问题到底出在哪里。目标是停止因为并非机器人过错的原因而给它们不及格的分数,并帮助我们理解它们究竟需要学习什么,才能成为真正有用的帮手。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →