← 最新论文
💬 NLP

Benchmarking the Benchmarks: Testing the Predictive Validity of Commonsense Benchmarks

本文通过对 23 个模型在各种任务上的测试,评估了被广泛采用的常识基准测试的预测效度,并发现这些基准测试仅能提供与特定任务相关的、而非广泛的证据,来证明大语言模型在下游真实世界推理任务中的能力。

原作者: Ine Gevers, Walter Daelemans

发布于 2026-08-05
📖 1 分钟阅读☕ 轻松阅读

原作者: Ine Gevers, Walter Daelemans

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图判断一名新学生是否聪明。你给了他们一份关于日常生活的选择题标准化测试,比如“如果我掉落一个玻璃杯,它会碎吗?”或者“那个男孩为什么在哭?”如果他们得分很高,你就会假设他们擅长理解这个世界。这就是科学家目前测试人工智能(AI)的方式。他们使用“基准测试”(benchmarks)——即旨在测试 AI 是否具备“常识”的静态测验,而“常识”只是一个高级词汇,指的是关于世界、人类和物理规律的基本、不成文的规则。但问题在于:仅仅因为一名学生在多项选择题测验中拿了高分,并不意味着他真的能在现实生活场景中应对自如,比如与朋友进行谈判或修理一个坏掉的玩具。研究人员正在追问的大问题是:这些测试分数真的能预测 AI 在处理现实任务时的表现吗?还是说,它们只是擅长应付考试本身?

这篇题为《基准测试之基准测试》(Benchmarking the Benchmarks)的论文展开了一场侦探任务,旨在查明这些流行的 AI 测验是否真的有用。作者 Ine Gevers 和 Walter Daelemans 将这些基准测试视为天气预报。他们想知道:如果预报说“晴天”(高基准分数),是否真的意味着这一天会是“晴天”(AI 会成功完成现实任务)?为了测试这一点,他们不仅观察了一个测试,而是收集了 23 个不同的 AI 模型(可以把它们想象成 23 名不同的学生),并给了它们四个著名的常识测验,以及四个经过“重构”的相同测验版本(这些版本经过了清理,去除了容易引起误解的错误)。然后,他们观察了这些相同的模型在八个不同且更复杂的现实世界挑战中的表现,例如判断某人是否在说反话、理解对话中的隐藏含义,或预测物理事件接下来的发展。

结果可能会让你感到惊讶。作者发现,清理测验题目并没有让它们在预测现实世界表现方面变得更好。这就像是在做数学考试时,擦掉了错别字并重新打印;之前拿 A 的学生依然拿 A,挣扎的学生依然挣扎,但测试本身仍然无法告诉你他们是否能修好一辆汽车。事实上,对于大多数现实世界的任务,测验分数几乎没有任何预测作用。只有在非常特定的任务中,这些测验才是有帮助的:比如理解“错误信念”(理解别人可能不知道你所知道的信息)和“TRIP”(预测物理事件的步骤)。即便如此,这种联系也并不完美。

这项研究表明,这些基准测试测量的并不是一种单一、广泛的“常识”超能力。相反,它们测量的是一个模型在进行特定类型多项选择测试时的表现。如果你希望 AI 擅长理解讽刺或社交情绪,在这些标准测验中获得高分并不能保证它能做到这一点。作者得出结论:我们不能仅仅通过看排行榜,就假设排名第一的 AI 对所有工作来说都是最聪明的。这些分数在某些非常狭窄的领域是有用的,但它们并不是通往通用智能的魔力水晶球。论文认为,我们不能再假设修复测试题目会自动修复测试预测现实世界成功的能力,而应该专注于以更接近真实世界的方式来测试 AI。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →