← 最新论文
💻 computer science

Lost in Aggregation: How Benchmarks Overlook Irreplaceable Model Strengths

本文认为,当前依赖于有利于一致性的聚合指标的表格机器学习基准测试忽略了数据集特有的不可替代优势,并提出应基于模型扩展各数据集峰值性能前沿的能力来进行评估。

原作者: Andrej Tschalzev, Stefan Lüdtke, Heiner Stuckenschmidt, Christian Bartelt

发布于 2026-08-20
📖 1 分钟阅读☕ 轻松阅读

原作者: Andrej Tschalzev, Stefan Lüdtke, Heiner Stuckenschmidt, Christian Bartelt

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在机器学习领域,科学家们不断构建新的计算机程序,旨在发现数据中的模式。这些程序通常被称为“模型”,它们会被测试于大量的现实世界问题之中,其范围从预测客户是否会购买某种产品到诊断某种医疗状况。为了决定哪一个程序是最优的,研究人员传统上依赖一种简单的方法:他们让每个模型在每个数据集上运行,计算每个模型的得分,然后将这些得分取平均值。这个平均值就像是一个最终成绩,告诉业界哪一个模型是最可靠的全能选手。这是一种寻找安全、默认选择且能在几乎任何场景下表现尚可的实用方法。然而,这种平均化的方法掩盖了一个关键细节。正如一名在所有考试中都得到 B 的学生,其平均分可能高于一名在一场困难考试中得到 A 而另一场得到 C 的学生一样,平均分可能会掩盖这样一个事实:某个特定的模型可能是唯一能够解决某个特定难题的模型。

一组研究人员最近指出,这种传统的模型排名方式忽略了故事中最有趣的部分。在一项于结构化数据研讨会上展示的研究中,他们提议不要通过“平均值”的视角,而是通过“峰值性能前沿”(peak performance frontier)的视角来观察数据。想象一张地图,地图上的每个最高点代表了计算机在特定问题上所能达到的最佳结果。研究人员提出了一个不同的问题:哪些模型实际上正站在那个最高峰之上?他们发现,那些旨在寻找最稳定表现者的标准排名系统,往往会忽视那些能够独特地达到特定困难数据集顶峰的模型。相反,这些系统倾向于奖励那些在各处表现都还不错、即便从未成为绝对最优的模型的模型。

为了调查这一点,研究人员检查了一个名为 TabArena 的大型动态基准测试的结果,该测试目前追踪着 27 个不同模型在 51 个精心挑选的数据集上的表现。他们开发了一种新的方法,用于对每个模型在每个特定数据集上的表现进行分类。他们没有仅仅看一个数字,而是提出了四个不同的问题。首先,该模型是否是唯一一个在该数据集上达到最高分的模型?如果是,它就是“不可替代的”(irreplaceable)。第二,它是否达到了最高分,即使其他模型也做到了?如果是,它就是“充分的”(sufficient)。第三,它是否未能达到顶峰但表现依然尚可?如果是,它就是“冗余的”(redundant)。最后,它的表现是否显著差于典型模型?如果是,它就是“易错的”(fallible)。通过应用这些类别,他们能够看到模型表现的真实全貌,从而将那些擅长处理一切的模型与那些对特定任务至关重要的模型区分开来。

分析揭示了标准排名与模型实际能力之间存在令人惊讶的脱节。传统的指标(如平均排名或胜率)被发现具有高度相关性,本质上是在测量同一件事:一致性和避免失败的能力。一个在每个数据集上表现尚可、但从未成为绝对最优的模型,往往会在这些传统排行榜上名列前茅。相比之下,那些拥有独特优势、能够比任何人都更好地解决特定问题的模型,在对其得分进行平均处理时,往往显得平庸。例如,一个在传统排行榜上排名第一的模型被发现从未成为任何数据集上的唯一最佳选择;其真正的优势在于避免糟糕的结果,而非实现巅峰表现。相反,一些在标准名单上排名较低的模型,却被发现是唯一能够达到多个特定数据集峰值性能的模型。

这一发现表明,目前衡量机器学习进步的方式是不完整的。研究人员证明,常见的聚合指标更擅长识别一个稳健的“默认模型”,而不是识别哪些模型对于实现最佳可能结果是必要的。他们发现,在所分析的 27 个模型中,有 9 个是“不可替代的”,这意味着每一个都是在至少一个数据集上能够达到巅峰表现的唯一模型。这表明这些模型拥有独特的学习方式,对特定类型的数据是有益的,而这种细微差别在简单平均得分时会完全丢失。研究还表明,标准指标在很大程度上偏向于“避免失败”;一个在少数几个数据集上表现不佳的模型会被大幅拉低分数,而一个在某些数据集上是最佳、但在其余数据集上表现平庸的模型,则无法获得足够的奖励。

这项工作的意义在于它如何评估进步的方式。研究人员建议,基准测试不仅应该询问一个新模型是否提高了平均得分,还应该询问它是否扩大了可达到的峰值性能范围。如果一个新模型能够解决其他任何模型都无法解决的问题,那么它就是一次真正的进步,即便其平均得分并不是最高的。通过将“好的默认选择”与“不可替代的力量”这两个概念剥离开来,研究人员提供了一个更清晰的现状图景。他们认为,该领域应该赞颂那些提供独特能力的模型,而不仅仅是那些始终保持稳健的模型。这种方法有助于识别哪些模型对于解决特定的困难问题是真正必要的,从而确保那些最具创新性和能力的工具不会仅仅因为不够一致而被忽视。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →