← 最新论文
💬 NLP

Automated Benchmark Auditing for AI Agents and Large Language Models

本文介绍了自动基准审计(ABA),这是一个智能体框架,能够系统性地识别出超过 25% 的人工智能基准测试中的关键缺陷,证明移除这些有问题的任务会显著改变模型排名并提升性能指标。

原作者: Junlin Wang, Federico Bianchi, Shang Zhu, Fan Nie, Yongchan Kwon, Bhuwan Dhingra, James Zou

发布于 2026-05-26
📖 1 分钟阅读☕ 轻松阅读

原作者: Junlin Wang, Federico Bianchi, Shang Zhu, Fan Nie, Yongchan Kwon, Bhuwan Dhingra, James Zou

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,人工智能的世界就像一个规模宏大、 stakes 极高的体育联盟。为了决定谁是最佳选手(即人工智能模型),我们举办名为基准测试(benchmarks)的竞赛。这些竞赛就像标准化考试或障碍赛,旨在评估人工智能的聪明程度或能力。

多年来,负责这些竞赛的人员一直手动检查规则,以确保测试的公平性。但随着人工智能选手变得越来越复杂,测试本身也变得极其繁琐。它们现在涉及虚拟计算机、隐藏的依赖关系以及难以让人类人工抽查的棘手评分脚本。

本文介绍了一种名为自动基准审计(Auto Benchmark Audit, ABA)的新工具。可以将 ABA 想象成一名超级侦探机器人,其唯一的工作就是在任何人尝试参与这些竞赛之前,审计它们以发现漏洞、陷阱和不公平的规则。

以下是本文如何通过简单的类比进行拆解:

1. 问题所在:“破损的障碍赛”

作者认为,许多当前的人工智能测试在纸面上看似完美,但实际上却暗藏故障。

  • 隐藏的陷阱:想象一场比赛,指示说“跑到终点”,但终点实际上位于一栋跑者未曾被告知的锁闭建筑内。跑者失败了,并非因为他们速度慢,而是因为赛道被操纵了。
  • 模糊的指示:或者想象一项测试要求“写一首关于猫的诗歌”,但评分机器人只接受以某种特定但未说明的方式押韵的诗歌。如果你写了一首很棒的诗却不符合那种押韵方式,你就会得零分。
  • 缺失的工具:有时测试要求人工智能使用特定工具(例如扳手),但人工智能的“车间”(即计算机环境)中实际上并没有那把扳手。

论文声称,人类专家要么太忙,要么过于轻信,无法发现所有这些细微的错误。他们通常因为是自己编写了测试而假设测试是公平的,从而忽略了那些导致无法通过的微小细节。

2. 解决方案:“侦探机器人”(ABA)

作者构建了一个名为 ABA 的智能体框架(一种智能人工智能系统),用于审查这些测试并发现缺陷。

  • 工作原理:ABA 不像只是阅读指示,而是像侦探一样行动。它有两种模式:
    • 静态模式:它阅读规则手册、问题和评分代码,以检查它们在逻辑上是否合理。
    • 轨迹模式:它实际观察一次“试运行”,即人工智能尝试解决问题的过程。它能看到人工智能在哪里卡住、缺少哪些工具,或者评分脚本是否崩溃。
  • 报告:当 ABA 发现问题时,它不会只说“这很糟糕”。它会提供一份详细的报告单:
    • 类别:是问题本身不好?环境损坏?还是评分者不公平?
    • 严重程度:是轻微的不便(如拼写错误)还是致命的大问题(如测试根本无法通过)?
    • 修复方案:它确切地建议如何重写规则或修复代码以使其公平。

3. 调查结果:他们发现了什么

该团队派遣他们的侦探机器人审计了168 场不同的竞赛,其中包含超过34,000 个任务。这些任务涵盖了从编程和数学到医疗建议和安全性的所有内容。

令人震惊的结果

  • 超过四分之一的任务存在故障:他们发现,**25.7%**的任务存在“严重”问题。这意味着用于对全球最聪明的人工智能进行排名的近四分之一的问题存在根本性缺陷。
  • “干净”的任务很少见:实际上只有不到 60% 的任务是“干净”的(即完全公平)。
  • 不同领域,不同问题
    • 数学测试大多存在糟糕的指示(问题不明确)。
    • 编程测试经常存在损坏的环境(计算机未安装正确的软件)。
    • 安全测试通常存在不公平的评分者(机器人法官过于严格或过于宽松)。

4. 影响:为何这会改变排行榜

这篇论文最重要的部分在于,当他们移除损坏的任务后会发生什么。

  • “排名洗牌”:当他们从竞赛中剔除损坏的任务并重新计算分数时,排行榜发生了变化。一些原本排名较低的人工智能模型突然跃升,而另一些则下降了。
  • 分数提升:平均而言,一旦移除损坏的任务,人工智能模型的分数提高了约9-10%。这证明这些模型并不一定像我们想象的那么“笨”;它们之所以失败,只是因为测试对它们不利。

5. 验证:侦探是否判断正确?

为了确保他们的侦探机器人不是在凭空捏造,作者将他们的发现与现实世界的事件进行了核对:

  • “实地修复”:他们发现了一些案例,基准测试的原始创建者已经修复了机器人发现的完全相同的问题,但并未借助机器人的帮助。
  • 专家审查:人类专家审查了机器人的发现,并同意机器人关于损坏测试的判断是正确的。

总结

简而言之,这篇论文指出:“我们制造了一个机器人来检查人工智能测试,结果发现其中近四分之一存在故障。当我们修复这些测试时,人工智能的分数发生了显著变化,证明我们此前并未准确衡量人工智能的进步。”

作者正在发布他们的侦探机器人以及他们发现的所有数据,以便人工智能社区能够开始修复这些测试,并为未来构建更好、更公平的竞赛。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →