BenchGuard: Who Guards the Benchmarks? Automated Auditing of LLM Agent Benchmarks
本文介绍了 BenchGuard,这是一个自动化审计框架,它利用前沿大语言模型系统地识别和验证面向任务的智能体基准测试中的缺陷,证明了其在低成本下检测人工审查所遗漏的关键错误方面的有效性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象你是一位主持高风险烹饪比赛的厨师。你有一份食谱清单(即基准测试),参赛者(即AI 智能体)必须遵循这些食谱,以证明他们是顶级大厨。
多年来,业界一直假设:如果参赛者未能完成某道食谱,那是因为参赛者不够优秀。但这篇名为BENCHGUARD的论文指出,有时问题出在食谱本身。也许食谱上写着“使用一杯面粉”,但参考答案用的却是“一杯糖”。或者,食谱要求制作蛋糕,但评委的评分表却只懂得如何给派打分。
作者将这种现象称为“解决方案固化”:编写食谱的人过于执着于自己特定的做事方式,以至于忘记了编写清晰的指令,或者无意中写入了会惩罚有效、创造性解决方案的规则。
问题所在:“破损的尺子”
在人工智能领域,我们通过在复杂任务(如分析科学数据或修复软件漏洞)上测试模型来评估它们。这些测试不仅仅是多项选择题;它们是包含指令、代码和评分脚本的完整计算机程序。
论文指出,我们用来衡量人工智能的这些“尺子”往往是歪斜的。
- 食谱与解决方案:指令可能要求“分析文件 A",但正确答案键却使用了“文件 B"。
- 评委与规则:指令可能要求列出化学代码(SMILES),但评分脚本却只检查化学名称。
- 隐藏陷阱:由于这些测试涉及许多变动因素(指令、代码、环境),人类专家可能会分别检查指令和代码,心想“看起来不错!”,却忽略了两者实际上并不匹配的事实。
解决方案:BENCHGUARD(“超级检查员”)
作者开发了一种名为BENCHGUARD的工具。你可以把它想象成一位超级检查员,它利用另一种非常智能的 AI(即“前沿大语言模型”),在参赛者开始烹饪之前就对食谱进行审计。
BENCHGUARD 不仅仅是让 AI 去解决问题,而是让 AI批判测试本身。它审视拼图的所有部分——指令、参考代码、评分脚本和计算机环境——并检查它们是否相互一致。
它是如何工作的(类比):
想象一名侦探正在勘察犯罪现场。
- 指令:“小偷偷走了红色的花瓶。”
- 证据(黄金解决方案):一张照片显示被偷的是一个蓝色的花瓶。
- 评分脚本:一条规则规定,“如果报告提到‘蓝色’,则得 0 分。”
人类可能会因为专注于小偷而忽略这种矛盾。而 BENCHGUARD 则是那位同时审视这三部分的侦探,它会说:“等等!指令说是红色,证据显示是蓝色,而评分者却在惩罚任何注意到颜色的人。这个测试是破损的。”
他们的发现
该团队在两个著名的科学基准测试(ScienceAgentBench 和 BIXBench)上测试了 BENCHGUARD。结果令人震惊:
- 破损的测试很常见:即使是在已经经过人类专家多次检查的基准测试中,BENCHGUARD 也在一个数据集中发现了12 个已确认的错误。其中一些错误非常严重,以至于任务在字面上根本无法被正确解决。
- AI 抓住了人类遗漏的内容:在第二个数据集中,BENCHGUARD 发现了人类专家团队后来找到的83% 的错误。但它还发现了人类完全遗漏的新错误。
- 成本低廉:用该系统审计 50 个复杂任务的成本不到15 美元。为了确保你的尺子没有破损,这是一个微不足道的代价。
“跨工件”之谜
论文强调了一种特定类型的错误,称为“跨工件不匹配”。
- 案例 1:指令说“使用文件 X",但正确的代码使用的是“文件 Y"。
- 案例 2:指令说“给我一份化学代码列表”,但评分脚本只检查“化学名称”。
如果你单独查看指令或单独查看代码,这些错误是看不见的。你必须将它们放在一起看,才能发现不匹配之处。BENCHGUARD 正是专门设计用来发现这些隐藏矛盾的。
核心结论
论文得出结论:我们不能再仅仅依赖人类专家来检查我们的 AI 测试是否公平。人类会感到疲惫,并且会“锚定”于他们自己的思维方式。
作者提出了一种新的做法:AI 辅助基准测试。在我们发布测试以评估人工智能有多聪明之前,我们应该先用智能 AI 对测试进行审计。这就像拥有另一双永不疲倦的眼睛,专门训练用来发现人类会忽略的矛盾。
简而言之:如果你想了解你的 AI 是否聪明,请确保你给它的测试没有破损。BENCHGUARD 就是那个修复测试的工具,以便测试结果真正具有意义。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。