The Flaw of Averages: Measuring Benchmark-Level Distributional Robustness
本文引入了“Harmony”,一种用于衡量语言模型基准测试分布鲁棒性的基于熵的指标,证明了低 Harmony 基准测试往往通过不均衡的子领域表现来误导对广泛模型能力的呈现,并建议在报告聚合准确率的同时报告 Harmony,以确保评估更具代表性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在快速发展的人工智能领域,研究人员依赖被称为“基准测试”(benchmarks)的标准测试来衡量语言模型的思考与学习能力。这些测试是该领域的标尺,决定了哪些模型被视为最具能力,并引导着未来发展的方向。然而,正如一名学生可能在数学考试中表现出色但在历史考试中不及格一样,语言模型可能在某一类问题上表现卓越,而在另一类问题上却表现挣扎。当这些各异的结果被汇总成一个单一的平均分时,细节就会消失。高出的总分可能表明一个模型具有广泛的能力,即便这种能力实际上仅集中在少数特定领域,从而掩盖了其他方面的显著弱点。这种现象创造了一种误导性的进步图景,即总结性统计数据隐藏了模型能力的真实分布。
约翰·霍普金斯大学的一个研究小组开发了一种新方法,旨在透过这些平均值去观察全貌。他们推出了一种名为 HARMONY 的诊断工具,用于衡量模型性能在单个测试的不同主题之间的分布是否均匀。这种方法不再仅仅询问模型答对了多少题,而是询问模型是否在各个领域都表现良好,或者其成功是否仅局限于一小部分学科。通过分析五个语言模型家族的十九个不同基准测试,研究人员发现许多流行的测试都存在缺乏平衡的问题。在这些情况下,综合得分往往夸大了模型的通用智能,因为测试被模型恰好擅长的课题所主导,而它在其他领域的失败则被平均值所淹没。
研究人员证明,这种不平衡不仅是一个理论上的担忧,而且会对我们评估人工智能的方式产生实际影响。他们对几个基准测试进行了处理,移除了其中彼此过于相似的问题,从而有效地重新平衡了测试,使其包含更广泛的主题。在原本就平衡良好的测试上,这种改变对最终得分几乎没有影响。然而,在不平衡的测试上,得分发生了剧烈变化。例如,在一个评估医学关键领域表现的基准测试中,一旦剔除过度代表性的题目,其综合准确率出现了实质性的、通常具有统计学意义的偏移,揭示了该模型之前的得分并不如看起来那样稳健。相比之下,一项常识知识测试保持了稳定,这表明其原始得分能更真实地反映模型的真实能力。
这项工作表明,目前通过单一数字对模型进行排名的做法往往是不充分的。研究人员认为,要真正理解一个模型的胜任能力,我们必须观察它在不同领域表现的均匀程度。他们发现,更大的模型并不自动变得更加均衡;在某些模型家族中,增加规模实际上使性能在特定领域更加集中,而在另一些家族中,性能则变得更加均匀。这表明,仅仅通过做大模型并不保证它们会拥有更通用的能力。该研究得出结论:每当报告基准测试得分时,都应附带一个关于这种分布平衡性的度量。只有通过承认模型强项与弱项所在之处,科学界才能避免陷入“认为平均分代表了广泛且可靠的智能”这一陷阱。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。