Computer Use at the Edge of the Statistical Precipice
本文指出了当前计算机使用智能体评估中因缺乏原则性的环境设计与方法论而导致的重大缺陷,并提出了PRISM设计框架、DigiWorld基准测试以及严格的统计聚合方法,以奠定开展有意义研究的前提条件。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在招聘一名新员工来管理一个繁忙的办公室。你想知道他是否真的聪明且善于变通,还是仅仅碰巧背下了某份特定练习题的答案。
这篇由 Meta 研究人员撰写的论文指出,当前我们测试“计算机使用代理”(即能够像人类一样点击按钮、输入文字和导航应用程序的人工智能)的方式存在缺陷。这就像基于一种允许应试者提前偷看答案的测试来招聘员工一样。
以下是问题及其解决方案的分解,采用简单的类比进行说明。
问题所在:“作弊小抄”陷阱
1. “盲目重放”诡计
研究人员发现了当前测试中存在一个令人震惊的缺陷。他们使用了一个非常简单的计算机脚本(仅 1MB,比一张单张图片还小),该脚本甚至不需要“查看”屏幕。它只是盲目地按照之前某款超级智能 AI 通过测试时所使用的完全相同的顺序,点击完全相同的按钮。
- 结果: 在当前的流行测试中,这种“盲目脚本”的得分实际上高于先进的 AI 模型。
- 类比: 想象一名学生参加数学考试。他并没有解题,而是记住了之前某版测试中计算器上按键的序列。如果考题从未改变,这名学生就能在不掌握任何数学知识的情况下获得 100 分。当前的 AI 基准测试就像那些一成不变的考题;AI 并非在“思考”,而只是在记忆路径。
2. “抛硬币”谬误
第二个问题在于研究人员如何计算分数。他们通常将每一次测试尝试视为完全独立的事件,就像抛硬币一样。
- 类比: 如果你让一个人操作 10 个不同的应用程序,他失败了 3 次,简单的平均值会显示他 70% 的表现良好。但如果这 3 次失败都发生在同一个应用程序中,仅仅因为该应用令人困惑,那么简单的平均值就掩盖了这样一个事实:这个人实际上在该特定应用上表现极差。当前的方法忽略了这些模式,使得排名不可靠。
解决方案:PRISM 与 DigiWorld
为了解决这一问题,该团队提出了一套名为PRISM的新规则,并建立了一个名为DigiWorld的新测试平台。
PRISM:公平测试的五项准则
将 PRISM 视为构建公平 AI 测试的“宪法”。
- 特权验证:测试不再要求人类(或其他 AI)查看截图并猜测任务是否完成,而是直接检查计算机的内部内存。这就像通过核对银行账本确认资金是否已转账,而不是询问柜员他们是否认为转账发生了。
- 真实环境:测试必须使用现实世界的应用程序,而非卡通化、简化的版本。你不能在玩具车赛道上测试驾驶员,却指望他们能应对真实的高速公路。
- 完整性检查配置:在测试开始前,系统会自动检查以确保任务实际上可行。它确保“银行账户”有资金可转账,或“电子邮件”存在可发送。不允许存在无法完成的任务。
- 沙箱执行:测试必须在密封、受控的环境中进行。它不应依赖每天变化的实时互联网。如果测试依赖一个实时网站,仅仅因为网站更新了设计,测试结果就会发生变化。
- 多因素可变性:这是最重要的规则。测试必须每次都要改变变量。
- 类比: 如果你只在晴天、直路上测试驾驶员,你就不知道他们能否在雨中或蜿蜒的山路上驾驶。DigiWorld 为每一次尝试都改变“天气”(视觉主题)、“交通”(数据内容)和“起点”(屏幕状态)。这迫使 AI 真正去“观察”和“推理”,而不是记忆路径。
DigiWorld:新测试赛道
研究人员构建了DigiWorld,这是一个包含 15 个真实移动应用程序(如银行、购物和旅行)的基准测试。
- 得益于“多因素”规则,他们可以生成每个任务的超过320 万种独特版本。
- 结果: 当他们在 DigiWorld 上运行“盲目重放”脚本时,该脚本惨败(得分仅为 6.9%)。脚本无法记忆 320 万种不同的路径。这证明了 DigiWorld 实际上是在测试 AI 能否思考,而不仅仅是能否记忆。
新的计分方式
最后,该论文提出了一种计算最终分数的更好方法。他们不使用简单的平均值,而是采用分层自举法(Hierarchical Bootstrap)。
- 类比: 想象你正在评判一场有 15 位不同评委的烹饪比赛。如果你只是平均所有评委的分数,你可能会忽略其中一位是“严苛评委”而另一位是“宽松评委”的事实。
- 新方法审视测试的结构:它将分数按应用程序分组,然后按场景分组,再按具体设置分组。它使用一种统计技术(威尔逊分数区间)来创建一个“置信范围”,而不是单一数值。这告诉我们“我们有 95% 的把握认为该 AI 的表现介于 40% 到 50% 之间”,而不仅仅是说“它是 45% 好”。
核心结论
该论文得出结论:我们无法信任当前的 AI 排名,因为这些测试太容易被作弊,且用于评分的数学方法过于简单。要了解 AI 是否真正准备好应对现实世界,我们需要DigiWorld(一个不断变化的测试,使记忆失效)和PRISM(一套确保测试公平、真实且统计合理的规则)。如果没有这些,我们仅仅是在衡量 AI 作弊的能力,而非其工作的能力。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。