← 最新论文
🤖 AI

When AI Benchmarks Plateau: A Systematic Study of Benchmark Saturation

本研究系统地分析了 60 个语言模型基准测试,旨在证明近半数基准测试存在饱和现象,而这一现象更多是由缺乏专家策展而非公开测试数据所驱动的,并最终为创建更具持久性的评估方法提供了设计见解。

原作者: Mubashara Akhtar, Anka Reuel, Prajna Soni, Sanchit Ahuja, Pawan Sasanka Ammanamanchi, Ruchit Rawal, Vilém Zouhar, Srishti Yadav, Chenxi Whitehouse, Dayeon Ki, Jennifer Mickel, Leshem Choshen, Marek Šu
发布于 2026-08-07
📖 1 分钟阅读☕ 轻松阅读

原作者: Mubashara Akhtar, Anka Reuel, Prajna Soni, Sanchit Ahuja, Pawan Sasanka Ammanamanchi, Ruchit Rawal, Vilém Zouhar, Srishti Yadav, Chenxi Whitehouse, Dayeon Ki, Jennifer Mickel, Leshem Choshen, Marek Šuppa, Jan Batzner, Jenny Chim, Jeba Sania, Yanan Long, Hossein A. Rahmani, Christina Knight, Yiyang Nan, Jyoutir Raj, Yu Fan, Shubham Singh, Subramanyam Sahoo, Eliya Habba, Usman Gohar, Siddhesh Pawar, Robert Scholz, Arjun Subramonian, Jingwei Ni, Mykel Kochenderfer, Sanmi Koyejo, Mrinmaya Sachan, Stella Biderman, Zeerak Talat, Avijit Ghosh, Irene Solaiman

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你是一位正在训练超级聪明机器人解谜的教练。为了选出谁是最优秀的,你给他们进行了一项测试。起初,分数各不相同:有的机器人得了40%,有的得了80%,还有一些天才级别的机器人达到了95%。这很棒!你可以清晰地看到谁在领先,谁还需要更多练习。但随后,奇怪的事情发生了。过了一段时间,每个机器人的得分都变成了99%或100%。分数停止了波动。好机器人与卓越机器人之间的差距消失了。这个测试已经变得太简单,无法区分差异了。在人工智能(AI)领域,这被称为“饱和”(saturation)。这就像是一个电子游戏关卡,由于被玩家通关了太多次,游戏开发者不得不发明一个更难的关卡,否则排行榜就会失去意义。

这篇题为《当 AI 基准测试进入平台期》(When AI Benchmarks Plateau)的论文,深入探讨了这一问题。研究人员研究了用于衡量 AI 语言模型智能程度的 60 种不同测试。他们想弄清楚为什么有些测试会迅速失效,而另一些测试却能持续发挥作用多年。他们构建了一个特殊的“饱和度计”来精确测量分数趋于平缓的程度。他们的重大发现是:那些陈旧且被使用次数最多的测试,往往最先崩溃。事实证明,仅仅隐藏答案(保持测试“私密”)或将题目改为选择题,并不能真正拯救一个测试免于变得无用。保持测试新鲜感的真正英雄是:拥有海量的题目数量,以及由专家精心设计使其具有挑战性。如果一个测试既陈旧又规模小,它几乎注定会撞到天花板,导致人们无法分辨谁才是最顶尖的 AI。

停滞的计分板的故事

让我们把 AI 基准测试的世界想象成一个巨大的、高风险的体育联赛。每年都有新队伍(AI 模型)加入联赛,它们需要证明自己是最优秀的。为此,它们参加一系列比赛(基准测试)。有些是短跑,有些是马拉松,有些则是障碍赛。

长期以来,这些比赛运行得非常完美。每当出现一名更快的选手时,他们都会打破旧纪录,赢得满堂喝彩。但随后,联赛开始注意到一个奇怪的趋势。选手们都在变快,但终点线却变得拥挤起来。很快,前五名选手冲过终点线的时刻几乎完全一致,甚至精确到了毫秒级。计分板卡住了。你无法再判断谁才是真正的速度之王,因为比赛太短,或者计时精度太模糊。

这就是本文作者试图解决的问题。他们问道:“为什么这些比赛不再起作用了?是因为选手变得太强了,还是因为赛道设计得太糟糕了?”

大规模调查:显微镜下的 60 场比赛

研究人员并没有凭空猜测;他们进行了一场大规模的侦探任务。他们收集了 60 种不同的 AI 基准测试——即那些被顶级 AI 公司和研究人员使用的“比赛”数据。他们检查了一切:比赛有多久的历史、包含多少题目、答案是公开的还是保密的,以及题目是谁编写的(人类还是计算机)。

为了衡量计分板的“停滞程度”,他们发明了一个聪明的工具,叫做饱和指数(Saturation Index)。你可以把它想象成一个“噪声检测器”:

  • 如果顶尖选手之间的差距相对于“噪声”(计时中的随机误差)很大,那么指数就很低,比赛仍然公平。
  • 如果顶尖选手之间的差距小于噪声,指数就会上升。此时比赛处于“饱和”状态。这就像是在飓风中试图听清一个耳语;你无法分辨谁在说话,因为风声太大了。

他们发现,在研究的 60 场比赛中,近一半已经饱和了。有些测试甚至高度饱和,以至于顶尖模型之间几乎无法区分。

他们打破的迷思

在这项研究之前,人们对于如何让比赛长期保持公平有一些看法。研究人员测试了这些想法,发现其中一些是错误的。

迷思 1:“如果我们隐藏答案,比赛就能维持更久的公平。”
许多人认为,如果保持测试题目保密(使用“私密”测试集),机器人就无法背诵答案。研究人员通过对比公开测试与私密测试验证了这一点。

  • 结果: 这并不重要。私密测试变得“卡住”的速度与公开测试一样快。一旦一个测试变得流行,即使答案是保密的,AI 模型也会如此精通这类问题的“风格”,以至于它们都能获得同样的高分。隐藏测试就像在浓雾中隐藏终点线;最终,每个人都能摸索到它的位置。

迷思 2:“选择题是问题所在。”
有些人认为,如果让 AI 写长篇开放式回答,而不是仅仅选择 A、B、C 或 D,测试就会持续得更久。

  • 结果: 并非如此。研究发现,采用选择题形式的测试与采用开放式写作形式的测试,其饱和速度几乎相同。回答的形式并不能挽救测试。

迷思 3:“仅限英语的测试比多语言测试更容易崩溃。”
看起来似乎很合逻辑:因为大多数 AI 主要是在英语环境下训练的,所以纯英语测试会变得太容易。

  • 结果: 看起来英语测试崩溃得更快,但研究人员意识到这只是时间的错觉。英语测试仅仅是更陈旧而已。多语言测试是新的,因此还没有经历足够的测试次数来达到饱和。当比较同等年龄的测试时,语言的重要性并不像想象中那么大。

真正的元凶:年龄与规模

那么,如果隐藏答案和改变形式都不管用,究竟是什么导致了测试的失效?研究人员发现了两个主要反派:

  1. 年龄(时间): 这是最大的因素。测试越陈旧,饱和的可能性就越大。把它想象成一首流行的歌曲:第一次听时它很新鲜,但在听了一千遍之后,你会知道每一个音符。AI 模型也是如此。随着测试在多年间被反复使用,模型学会了如何“钻空子”(gaming it)——不是通过死记硬背,而是通过成为这种特定类型谜题的专家。研究表明,超过 60 个月历史的测试比新测试更容易陷入停滞。

  2. 规模(题目数量): 这是第二大因素。题目很少的测试(小型测试集)饱和得更快。想象一场只有 3 个栏杆的比赛:如果你在一个上面绊倒,那将是大事;但如果你有 100 个栏杆,一次绊倒并不会改变胜负。小型测试具有“噪声”。如果一个 AI 在几个问题上运气好,它的分数就会飙升,让它看起来像个天才。但如果你有一个拥有数千个问题的庞大测试,运气就不再重要了。研究发现,拥有更多题目的测试能保持更长时间的公平和实用性,因为它们能够识别出最聪明模型之间的细微差别。

好消息:如何构建更好的比赛

论文并没有仅仅说“一切都坏掉了”,它还给出了构建持久测试的配方。

  • 让测试规模巨大: 如果你想让测试保持有用,请给 AI 数千个问题,而不只是几十个。这能减少“噪声”,让你看到真实的差异。
  • 保持新鲜感: 不要永远只用同样的题目。最好的测试是那些不断变化、增加新问题,或由懂得如何“戏耍” AI 的专家设计的测试。
  • 不要依赖秘密: 隐藏测试并不是万能护盾。你需要设计得足够好,使得即使 AI 知道规则,也必须付出艰苦努力才能获胜。

总结

作者谨慎地指出,拿到高分并不总是坏事。如果一个测试旨在衡量某种简单的东西,而每个 AI 都得到了 100%,那是好事!这意味着问题已得到解决。但问题在于,当一个测试本应能够区分“好 AI”与“卓越 AI”,却因为过于陈旧或规模过小而无法做到时,问题才真正出现了。

这项研究表明,我们不应该把这些测试视为永久的奖杯,而应该把它们视为“生命体”。它们需要成长、变化并变得更大,以跟上我们正在制造的超级智能机器人的步伐。否则,我们的排行榜只会显示一条平坦的直线,我们将无法得知谁才是真正的最强者。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →