← 最新论文
🔬 materials science

The Double Measurement Confound in Agent Benchmarks: De-Scaffolding, Ground-Truth Scoring, and Reliability Beyond the Mean

本文识别了 LLM 智能体基准测试中存在的“双重测量混淆”问题,即固定的脚手架和有缺陷的评分器掩盖了模型的真实能力,并提出了一种包含审计与修复协议的测量理论框架,旨在将执行控制权转移给模型、实现基准真相评分,并报告超越平均值的可靠性指标。

原作者: Yonghong Zhang, Shadi Motaali, Vu Phong Dinh, Avin Piroutiniya, Jorge E. López de Vergara, Luis de Pedro, Ricardo Correia, Isabel M. Parra, Yong Xie

发布于 2026-09-10
📖 1 分钟阅读☕ 轻松阅读

原作者: Yonghong Zhang, Shadi Motaali, Vu Phong Dinh, Avin Piroutiniya, Jorge E. López de Vergara, Luis de Pedro, Ricardo Correia, Isabel M. Parra, Yong Xie

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在快速发展的人工智能领域,研究人员依赖于被称为“基准测试”(benchmarks)的标准测试来衡量大型语言模型的表现。这些模型被设计为能够作为智能体(agents)运行,具备使用数字工具解决复杂问题的能力,从分析数据到预订航班。为了确定哪种模型最优秀,科学家们通过这些测试运行模型并比较得分。其背后的基本假设是:更高的分数意味着更聪明、更强大的机器。然而,这种信心建立在一个脆弱的前提之上:即测试本身是在衡量机器的智能,而不是测试的设计巧妙程度或运行该测试的软件。如果测试存在缺陷,排名就会产生误导,可能引导开发者和企业走向错误的工具。

一组研究人员发现了一个关于目前这些智能体基准测试构建方式的特定隐藏缺陷,他们称之为“双重测量混淆”(double measurement confound)。他们发现,在许多流行的测试中,运行实验的软件承担了几乎所有的繁重工作,而人工智能仅仅是在填补空白。此外,用于评分的系统通常只检查答案在表面上看起来是否正确,而不是验证答案是否真实。当这两个问题同时发生时,它们创造了一种完美的性能幻象,使得即使是一个没有任何智能的简单计算机脚本,也能获得与最先进的人工智能同样高的分数。

为了揭露这一点,研究人员专注于一个旨在测试模型处理混乱、现实世界数据能力的基准测试,具体涉及包含错误、重复项和缺失页面的贸易统计数据。在这一测试的标准版本中,围绕模型的软件包装器(software wrapper)会自动处理每一个困难的决策。如果数据源连接失败,软件会自动重试连接;如果数据中存在重复项,软件会自动将其删除;如果数据分布在许多页面中,软件会自动抓取所有页面。人工智能仅被要求决定要查找哪些特定数据以及何时停止。由于软件承担了所有关键工作,结果无论使用哪种模型都是完全相同的。在一个引人注目的案例中,两个世界上最强大的模型,连同使用没有任何人工智能的简单基于规则的脚本,都获得了几乎相同的完美分数。这项测试测量的不是模型,而是运行它们的软件。

问题的第二部分在于结果是如何评分的。这些测试中的标准评分系统观察的是提交内容的格式。它检查模型是否提供了操作日志,以及数据结构是否整洁。它并不将提交的数据与实际正确答案进行对比。研究人员证明,只要文件看起来组织有序且日志书写正确,一个模型就可以提交一套完全虚构的假记录,并获得与提交了完美、正确数据的模型同样高的分数。这意味着测试奖励的是工作的“外观”,而非工作本身。

研究人员意识到,仅仅修复其中一个问题是不够的。如果他们只改变评分系统以检查真实性,由于软件仍在承担所有工作,模型之间仍然会持平。如果他们只移除软件的帮助,有缺陷的评分系统仍会掩盖模型的失败。他们必须同时移除这两个问题。他们剥离了辅助软件,迫使人工智能对重试连接、删除重复项和抓取页面等每一项决策都做出判断。然后,他们用一个直接将模型输出与已知正确答案进行对比的系统,取代了原有的格式检查评分器。

当他们应用这种“双重修复”后,原本平淡、缺乏信息量的排行榜转化为了清晰的能力光谱。突然之间,模型之间可以被区分开来了。最强大的模型保持了高分,证明了在不受限制的情况下它们能够处理困难任务。然而,其他此前得分很高的模型得分降至零,揭示了它们完全依赖于辅助软件才能运行。一些看起来平均表现强劲的模型被发现极其不可靠,在特定情况下会完全失效;而一些规模较小、知名度较低的模型则被证明具有惊人的连贯性和稳健性。

这项研究还显示,这些模型的可靠性取决于测试的具体条件,且差异巨大。一个模型可能在平均水平上表现出色,但在最坏的情况下会彻底失败,而标准的测试往往会掩盖这一细节。通过观察这些最坏情况下的结果,研究人员发现模型的排名发生了彻底变化。一个基于平均分看起来是顶尖表现的模型,实际上是最脆弱的;而一个此前被忽视的小型模型,被证明是最可靠的。

这项工作的影响不仅限于单一测试。研究人员将他们的新审计方法应用于其他现有的基准测试,并发现了同样的问题。在某些情况下,评分系统针对特定测试是正确的,但运行测试的软件仍然承担了过多的工作,使得排名取决于所使用的软件版本。在其他情况下,评分系统本身存在缺陷,奖励了错误的东西。研究人员得出结论:要真正理解一个人工智能智能体,我们必须确切知道有多少工作是由智能体完成的,又有多少是由测试为其完成的,并且我们必须根据智能体回答的真实性而非仅仅是其呈现的整洁度来进行评分。如果没有这些改变,我们今天看到的得分可能是在衡量测试本身,而非它声称评估的智能。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →