Benchmarking the Benchmarks: A Validity Audit of Tool-Calling Evaluation
本文对四个主要的工具调用基准测试进行了系统的有效性审计,揭示了显著的评估器与人类之间的失配以及影响当前排行榜得分的可复现性问题,并提出了一个统一的失败分类法,以及诸如 Tool-Veritas 和 Harness Lab 等新工具,以建立更严谨、可审计且符合人类标准的评估规范。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你是一位教练,正试图弄清楚你的哪位运动员最擅长玩一款复杂的视频游戏,这款游戏涉及解谜、物品管理以及与 NPC(非玩家角色)对话。为了决定胜负,你设置了一系列挑战,并使用一名计分员来评定他们的表现。
这篇论文本质上是对这些计分员本身进行的一场法证审计。作者们——来自 CoreThink AI 和斯坦福大学的研究人员——提出了一个简单但令人震惊的问题:“我们看到的得分究竟是在衡量运动员的技能,还是仅仅在衡量计分员有多糟糕?”
以下是他们发现的内容,通过日常类比进行了解释。
1. 问题所在:计分员很不靠谱
研究人员查看了目前用于对 AI 智能体进行排名(基准测试)的四个主要“计分系统”。他们提取了 496 个特定任务,让人类专家观察 AI 的游戏过程,然后将人类的判断与计算机计分员给出的成绩进行对比。
结果: 计分员有 18.5% 的时间是错误的。
- 假阴性(误判为失败): AI 实际上解决了谜题,但计分员因为一个微小的、无关紧要的错误(比如漏掉了一个逗号或用了一种略微不同的表达方式)而给了它一个“不及格”。
- 假阳性(误判为成功): AI 实际上失败了,但计分员却没有注意到失败,反而给了它一个“优秀”。
类比: 想象一名学生正确解决了数学题,但把最终答案写成了“42”而不是“42.”。老师(AI 智能体)知道数学是对的,但自动评分机(基准测试)却判定学生不及格,因为它要求精确的字符匹配。相反,一名学生可能答错了,但如果评分机由于混乱而产生误判,它可能会意外地给予满分。
2. 两种类型的故障计分员
研究发现,根据构建方式的不同,计分员会以两种截然不同的方式出错。
类型 A:“僵硬的机器人”(确定性基准测试)
这些系统就像一名严格的保安,只有当你的身份证件与照片完全一致(精确到像素)时才会让你进入。
- 缺陷: 它们非常“脆弱”。如果 AI 做对了事情,但顺序稍有不同,或者数据库以一种评分系统未曾预料到的方式更新了,机器人就会陷入恐慌并将其标记为失败。
- 论文中的现实案例: 一台 AI 正确取消了两笔航班预订,并计算了剩余航班的费用。然而,计分员预期的是一个特定的数字($1,628),该数字包含了被取消的航班。因为 AI 给出了符合用户需求的正确答案,但给出了与计分员僵化脚本不符的数字,导致 AI 被判定为失败。
类型 B:“醉酒的法官”(LLM-Judge 基准测试)
这些系统使用另一个 AI 来为第一个 AI 打分。这就像是让一名学生来批改自己的作业,但这个批改者本身也是一名疲惫且不稳定、表现不一的学生。
- 缺陷: 它们具有“随机性”(stochastic)。如果你运行两次完全相同的测试,这个“醉酒的法官”可能会给出两个完全不同的分数。
- 论文中的现实案例: 研究人员将同一项基准测试运行了 23 次。分数在 57.9% 到 76.8% 之间剧烈波动。这高达 18.9 个百分点的差距!如果你在排行榜上运行这项测试,仅仅因为法官当天的“心情”不同,获胜者就可能发生变化,而不是因为 AI 变得更聪明了。
3. 后果:破碎的排行榜
由于计分员如此不可靠,目前的“排行榜”(列出最佳 AI 模型列表)具有误导性。
- 类比: 想象一场比赛,终点线每次在运动员跨越时都会随机移动。有时终点线向后退 10 米,有时向前移 10 米。如果你仅凭一次奔跑就向世界宣布谁赢了,你就是在撒谎。论文认为,目前的 AI 排名往往反映的是测试本身的缺陷,而非 AI 的技能。
4. 解决方案:一种新的评分方式
作者们不仅提出了批评,还开发了两种新工具来解决问题。
Tool-Veritas:“事实优先”的法官
这是一个旨在兼顾两者优点的新型评分系统。
- 运作方式: 首先,它使用一个僵硬、不可更改的机器人来检查事实。文件是否保存了?银行账户是否更新了?如果事实错误,测试即刻结束。
- 安全网: 只有在事实完美的情况下,它才会允许一个像人类一样的 AI 法官去观察答案的“风格”或“语气”。
- 结果: 这个新系统与人类专家的意见一致率达到了 95.5%,相比之下,旧系统的协议率仅为 69–90%,这是一个巨大的进步。
Harness Lab:“回放摄像机”
这是一套充当体育赛事重播系统的软件。
- 功能: 它记录了 AI 做的每一个动作、每一条错误信息以及计分员做出的每一个决策。
- 重要性: 如果一个分数看起来很奇怪,你可以按下“倒退”,观看 AI 或法官出错的确切时刻,并进行修正。它使评分过程变得透明且可审计,而不是一个只给你一个最终数字的“黑箱”。
总结
论文得出结论:我们不能信任目前的 AI 智能体“分数”,因为测试本身是破碎的。要了解一个 AI 是否真的在进步,我们需要具备以下特征的测试:
- 可重复性: 运行两次测试应该得到相同的结果。
- 可审计性: 我们需要能够看到为什么给出某个分数。
- 与人类对齐: 测试应当与人类专家认为的成功标准保持一致。
作者们发布了他们全新的“事实优先”测试和“回放摄像机”软件,以帮助整个社区建立更好的、更公平的基准测试。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。