Messier: A High-Resolution Corpus for Cross-Benchmark Agent Evaluation
本文介绍了 Messier,这是一个包含近一百万条标准化记录、跨越 30 个基准测试和多种领域的统一高分辨率语料库,它能够实现全面的跨基准智能体评估,揭示不同任务类型间进展的不均衡性,并为审计和扩展 AI 智能体能力提供基础架构。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图弄清楚哪位电子游戏角色才是各方面的绝对强者。你有一个擅长跳跃的角色,另一个是数学解谜的高手,还有第三个角色能完美地穿梭于迷宫之中。但问题在于,每个游戏的“技能”衡量标准都不一样。有的游戏只要你跳过一个坑就给你一颗金星;而有的游戏则要求你解开一道复杂的代数题才能打开门;还有的游戏则要求你在不触碰任何敌人的情况下收集关卡中的每一枚金币。如果你只看最终得分——比如一个单一的数字“95%”——你可能会认为它们表现得同样出色。但这个数字掩盖了混乱的细节。是因为角色跳不过去才失败,还是因为被一扇门卡住了?是因为角色做得完美无缺才拿到95%,还是因为仅仅失败了一个微小的环节,就被游戏判定为整场失败?
这正是研究 AI 智能体(AI agents)的科学家们面临的问题。这些不仅仅是聊天机器人,它们是能够使用工具、编写代码、浏览网页并在实时环境中做出决策的数字工作者。目前,已经存在数百种不同的测试(基准测试),但它们使用的语言各不相同。有些测试非常严格:如果你在 10 步食谱中漏掉了一步,你就会得到零分。而另一些测试则更为宽容。因此,想要比较一个擅长编程的智能体与一个擅长法律研究的智能体变得极其困难。这就像是试图仅凭一个单一的“运动能力”分数,就把马拉松选手与国际象棋大师进行比较。为了理解 AI 究竟是如何进步的,我们需要一种方法来观察这些分数背后的细节,看看它们究竟在哪里成功,又在哪里跌跤。
于是有了 MESSIER,这是一个庞大的新项目,它扮演着 AI 测试领域巨大且通用的“翻译官”角色。MESSIER 背后的研究人员不仅构建了一个新测试,还建立了一个巨大的库,收集了来自 30 种现有测试 的结果,涵盖了 11,891 项特定任务 以及 74,205 种不同的检查智能体是否成功的途径。他们收集了 714 种不同的 AI 智能体 的数据,甚至针对数据缺失的六个困难领域(如法律审查和量子电路设计)进行了全新的测试。总计,他们将近 一百万条试验记录 整理成了一个统一、标准的格式。你可以把它想象成将 3-30 家不同商店里杂乱无章的收据——每张收据都用着不同的货币和不同的计算规则——转化成一张单一、清晰的电子表格,让你能一眼看出买了什么、花了多少钱,以及哪家店最划算。
MESSIER 最令人兴奋的发现是,计分方式会改变故事的走向。论文指出,许多测试都采用了一种“严格”的规则:如果智能体在任务的任何一个小环节失败,整个任务就会被标记为失败。研究人员展示了,如果放宽这一规则,观察智能体到底做对了多少部分,进步的图景将会大不相同。例如,在一个法律基准测试中,严格的“全有或全无”评分显示智能体的成功率仅为 0.2%。但当他们深入观察细节时发现,智能体平均满足了 28.8% 的标准。这种严格的规则掩盖了大量的阶段性进展。这表明,虽然 AI 正在变得更好,但我们的衡量方式可能过于严苛,使得 AI 看起来比实际情况失败得更多。
这项研究还绘制出了 AI 真正“获胜”的地方以及仍然挣扎的地方。他们发现,AI 在“函数调用”(使用工具)方面几乎趋于完美,成功率为 0.97。它在编程方面也表现出色,在过去两年中进步神速。然而,AI 在“企业工作流”(complex, multi-step office jobs,如管理业务流程等复杂的多步骤办公任务)方面仍然面临困难。在这些领域,成功率仅为 0.57,这意味着智能体失败的次数多于成功的次数。研究人员还证明,你可以利用这个庞大的库来创建一个与主要排名高度吻合(相关性为 0.81)的 AI “技能量表”,而无需花费数百万美元去运行新的测试。
归根结底,MESSIER 是一个追求清晰度的工具。它表明,通过观察智能体失败的微观细节,而非仅仅看最终得分,我们可以获得关于 AI 实际能力的更真实画像。它并不是说 AI 已经解决了所有问题,但它确实暗示我们目前的衡量标准可能过于粗糙。通过标准化这些结果,作者希望停止在重复测试上的资金浪费,并帮助研究人员准确了解哪些工作 AI 已经准备好了,而哪些工作仍需要人类的参与。现在,这些数据已向所有人开放,将一堆混乱的数字变成了一张清晰的 AI 版图。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。