There Is No Neutral Harness: Modern LLM Leaderboards Are Manufactured by Config-Fragile Items
本文表明,现代大语言模型排行榜在根本上是不可靠的,因为评估框架配置(例如提示词措辞和评分方法)是性能差异的主要驱动因素,其对模型排名的决定作用往往超过了模型实际能力的决定作用。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在快速发展的人工智能领域,研究人员依赖标准化测试来衡量计算机程序对语言的理解程度。这些被称为“基准测试”(benchmarks)的测试通常向模型展示一系列多项选择题,并记录其答对的题目数量。由此得出的得分被视为关于机器智能的确定性事实,使科学家能够将不同的模型进行对比排名并宣布胜者。多年来,业界一直基于这样一个假设进行运作:虽然模型的表现可能会因随机偶然性而略有波动,但整体排名反映了该技术的稳定真相。关于一个模型是否真的比另一个更聪明的问题,是通过观察一个数字——正确答案的百分比——来得到答案的。
然而,一项新的调查表明,这个单一的数字讲述了一个要复杂得多的故事。研究显示,模型获得的得分不仅是其智能的度量,也是其评估规则(evaluation harness)的产物。这些规则包括一些表面上看似微不足道的选择:选项排列的顺序、给机器的指令的具体措辞,以及决定答案是否正确的判定方法。虽然这些选择通常是随意做出的或基于便利性,但研究人员发现,改变这些选择可以彻底改写排行榜,使一个排名垫底的模型跃升至顶尖水平,反之亦然。研究结果意味着,我们目前对人工智能进行排名的做法远比此前认为的要不稳定得多,且“最佳”模型完全取决于测试是如何进行的。
为了揭示这种隐藏的不稳定性,加州大学圣地亚哥分校的一位研究人员设计了一个大规模实验,将测试规则本身作为一个变量。研究人员并没有运行单次测试并接受结果,而是创建了一个包含二十六种不同测试管理方式的矩阵。他们选取了来自四个主要家族的十二个不同语言模型,并要求它们回答相同的 3,679 道多项选择题。对于每一道题,他们都让模型通过所有可能的测试规则组合进行测试。这包括打乱选项顺序、改变问题的措辞方式,以及在两种不同的评分方法之间切换:一种是让模型生成文本响应,另一种是计算每个选项正确的数学概率。
结果令人震惊。当研究人员观察单个模型的得分时,他们并没有发现一个确定的准确率点。相反,他们发现了一个可能的得分区间。对于一个表现优异的模型,其得分范围从 31% 到 89% 不等,这完全取决于使用了哪一种共二十六种规则集。这意味着,同一台机器,凭借相同的内部代码和相同的知识,仅仅因为测试管理员改变了字母顺序或提示词风格,就可能被认定为几乎答对了所有问题,或者连三分之一的题目都无法答对。平均而言,在标准规则下被判定为答对的题目中,有 85% 在使用另一种同样有效的规则集时会被判定为错误。
最关键的发现是,这些波动并非在测试中均匀分布的随机噪声。不稳定性精确地集中在那些区分不同模型的题目上。当研究人员观察那些无论规则如何变化,两个相邻模型都能同时答对或答错的题目时,这些模型基本上是不分伯仲的。造成排名差异的题目仅存在于模型感到“不确定”的题目中。事实上,对于排名相邻的模型对,几乎所有的分差——平均约 96%——都是由这些不稳定的题目造成的。如果移除那些会随规则反复变化的题目,排名就会消失,模型之间也将变得难以分辨。
这种脆弱性意味着,“获胜者”的身份并非模型的固定属性,而是评估者的选择。在一种规则集下,某个特定模型可能夺得第一;而在另一种规则集下,一个完全不同的模型可能会胜出。在这项研究中,根据配置的不同,有四种不同的模型能够达到第一名的位置。一个在标准规则下排名第十一(共十二名)的模型,在另一种评分方法下跃升至第一。研究人员指出,评分方式的选择——即是阅读模型生成的文本还是计算概率——是影响最大的因素,它引起的排名变动比选项顺序或提示词措辞的影响都要大。
研究还考察了该领域的一个流行趋势:将这些大型测试压缩为一小组最具“信息量”的题目,以节省时间。其逻辑是,几百个精心挑选的问题就能代表整个测试。研究人员发现,这种做法实际上加剧了问题。被选为最具信息量的题目,恰恰是那些对测试规则最为敏感的题目。通过仅保留这些困难且高风险的题目,压缩后的基准测试比它们所取代的全量测试更加不稳定。规模较小的测试并不能提供更清晰的图景,反而提供了一个更加脆弱的图景,其排名更容易因设置的微小调整而发生变化。
最终,论文指出,目前将单一数字作为模型能力的真相进行报告的做法具有误导性。得分不是模型单独的属性,而是模型与特定规则交互作用的属性。研究人员建议,未来的报告不应再将排行榜视为固定的等级制度,而应开始呈现可能的得分范围。他提议,在比较模型时,科学家应该关注那些模型表现稳定且达成共识的题目,而不是那些由规则主导结果的题目。在社区就如何运行这些测试达成统一且不可更改的标准之前,排名将始终只是评估者选择的反映,而非人工智能的确定性度量。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。