← 最新论文
📊 statistics

Statistical Methods for Multiple Language Model Comparison on a Shared Evaluation

本文提出了一种统一的随机效应模型,该模型扩展了标准的配对统计方法,用于在共享的聚类评估上对多个语言模型进行严谨比较,并通过模拟实验和真实数据证明,准确的成对排序取决于对问题级相关性和多重比较的妥善处理。

原作者: Juan Francisco Mandujano Reyes

发布于 2026-08-25
📖 1 分钟阅读☕ 轻松阅读

原作者: Juan Francisco Mandujano Reyes

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在快速发展的人工智能领域,研究人员不断构建新的计算机程序,旨在理解并生成人类语言。为了确定哪个程序最聪明,他们会让这些程序接受一系列测试,就像学生参加标准化考试一样。这些测试包含数千个问题,涵盖了从历史、科学到逻辑和数学等主题。多年来,比较这些程序的标准方法一直是观察它们的平均分。如果一个程序的正确率百分比高于另一个程序,它就被宣布为获胜者。然而,这种简单的方法往往忽略了一个关键细节:问题本身并不都是一样的。有些问题本质上比其他问题更难,而且同一学科(如一组数学题)内的题目往往是相关的。如果两个程序都在同样的难题上遇到困难,它们的得分就是相关的,而非独立的。忽视这些联系可能会使一个程序看起来比实际更好或更差,从而导致引导该领域的排行榜出现令人困惑或错误的排名。

一位研究人员致力于通过开发一种更严谨的方法来同时比较多个语言模型,以解决这一问题。他们不再将每个问题视为孤立的事件,而是提出了一个承认测试本身结构的统计框架。他们将不同的计算机程序视为主要的研究对象,而将问题及其所属的问题组视为影响所有人的随机变量。通过使用单一且统一的统计模型,他们可以解释为什么所有程序都使用了同一套问题。这种方法使他们能够将模型的真实技能与特定问题的难度以及这些问题在阅读理解或翻译等类别中的自然分组区分开来。

该研究人员使用来自一个名为 MMLU-Pro 的主要基准测试的真实数据测试了他们的方法,该基准测试包含超过 12,000 个问题,涵盖 14 个不同学科领域。他们选择了六个规模相似的流行语言模型,并让它们回答了完全相同的 1,497 个问题。当他们使用新方法分析结果时,发现传统的模型比较方法经常导致错误的结论。在他们的模拟研究中,他们展示了如果你只是进行两两对比,而不纠正由于同时进行多次比较而产生的影响,那么你很有可能在差异实际上只是随机噪声时,就宣布差异存在。在现实世界的测试中,他们发现一旦应用了适当的统计修正,一些关于哪个模型优于另一个模型的说法就会消失。例如,一个模型看起来以微弱优势领先于另一个模型,但在考虑了多次比较和问题的结构后,这种差异在统计学上不再显著。

研究还强调了问题如何分组的重要性。当问题按主题(如一组数学题)进行聚类时,模型在这些问题上的表现是相关的。研究人员发现,忽视这种聚类会导致对得分不确定性的估计被低估,其程度高达近三倍。通过使用他们的混合效应模型(将这些组视为随机因子),他们可以准确测量有多少得分变化来自于学科内容,又有多少来自于模型的实际能力。这表明,虽然学科聚类确实发挥了作用,但差异的主要驱动因素是模型本身,但前提是必须对统计噪声进行适当控制。

最终,该论文为该领域未来如何发展提供了一套明确的建议。研究人员认为,在宣布多个模型之间的任何排名之前,科学家们应该首先进行一项广泛的测试,以观察该群体之间是否存在任何差异。如果这项测试显示存在差异,他们随后应该使用特定的、经过修正的方法来进行模型间的两两比较,以确保误报的概率保持在较低水平。他们还建议,当问题按主题分组时,这些组应该被纳入统计模型中,而不是尝试手动调整数值。通过遵循这些步骤,社区可以确保他们所依赖的排行榜反映的是人工智能的真实进步,而非数据分析方式产生的偏差。这项工作并不声称已经解决了评估中的所有问题,但它为在利益攸关且误差容限极小的领域中进行公平、准确的比较,提供了一个坚实且经过验证的基础。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →