← 最新论文
🤖 machine learning

How Hard is it to Rig a Benchmark? A Social Choice Analysis of Leaderboard Robustness

本文应用计算社会选择理论证明,通过针对特定基准的训练来操纵机器学习排行榜是一个 NP 难问题,同时引入并评估了“实例级鲁棒性”,以表明胜率均值指标比算术平均值、中位数或成对多数得分具有显著更强的抗操纵性。

原作者: Polina Gordienko, Georg Schollmeyer, Frauke Kreuter, Christoph Jansen

发布于 2026-05-25
📖 1 分钟阅读☕ 轻松阅读

原作者: Polina Gordienko, Georg Schollmeyer, Frauke Kreuter, Christoph Jansen

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一场规模宏大、 stakes 极高的烹饪比赛,数百位厨师(AI 模型)根据他们烹饪 50 道不同菜肴(如数学问题、逻辑谜题或语言翻译等任务)的能力接受评判。比赛结束后,会公布一份“排行榜”,将厨师从最佳到最差进行排名。这份排行榜决定了谁获得聘用、谁获得资助,以及谁被视为“世界最佳”。

本文提出了一个简单却令人不安的问题:想要登上这份排行榜的顶端,作弊有多容易?

作者将这场竞争比作一场政治选举。在这个类比中:

  • 厨师是候选人。
  • **菜肴(任务)**是选民。
  • 排行榜规则是投票系统(例如,“谁赢得的菜肴最多?”与“谁的平均分最高?”)。

作弊手段:“针对基准的训练”

通常,厨师们会使用自己的秘密食材进行练习。但如果一位厨师在赛前秘密获得了实际考题(基准任务)的副本,并专门针对这些考题进行练习,会发生什么?

在现实世界中,这被称为“数据污染”或“在测试集上进行训练”。本文将其称为针对基准的训练。这就像一名学生在参加期末考试前,背下了考试中的确切题目。本文假设了最坏的情况:厨师可以完美掌握他们选择练习的任何菜肴。

核心问题:操纵比赛有多难?

作者想知道:如果一位厨师想要获胜,他需要背下并练习多少道菜肴,才能确保获得第一名?

作者将这个数字称为排行榜的**“鲁棒性”**。

  • 低鲁棒性:你只需要背下 2 或 3 道菜肴就能获胜。该系统脆弱且易于操纵。
  • 高鲁棒性:你需要背下 40 或 50 道菜肴。该系统坚固且难以操纵。

四种投票系统(聚合规则)

本文测试了四种不同的计算获胜者的方法,就像选举中不同的计票方式一样:

  1. 算术平均数(平均值):这是最常用的方法。你将所有分数相加,然后除以菜肴的数量。

    • 类比:如果你在一道简单的菜肴上得了 100 分,而在其余菜肴上得了 0 分,你的平均分就会很低。但如果你只在几道菜肴上得了 90 分,这可能会显著拉高你的平均分。
    • 结果极易被操纵。一位厨师只需要掌握一小部分菜肴(在一次测试中约为 24 道中的 13 道)就能跃居榜首。一两个“超级菜肴”就能带动整个团队。
  2. 中位数(中间的孩子):你将所有分数从低到高排列,然后选出正中间的那个。

    • 类比:如果你有 10 道菜肴,中位数就是第 5 高的分数。它不在乎你最低分是 0 还是 1;它只关心中间值。
    • 结果中等程度容易操纵。与平均值类似,你需要掌握约 12 道菜肴才能获胜。这比平均值稍难一点,但差别不大。
  3. 成对多数(一对一):对于每一对厨师,你计算厨师 A 在多少道菜肴上击败了厨师 B。如果厨师 A 在与厨师 B 的对决中赢得了超过一半的菜肴,那么厨师 A 赢得该场对决。

    • 类比:这就像循环赛。你需要在超过一半的类别中击败你的对手。
    • 结果中等程度容易操纵。你需要赢得约 12 道菜肴才能击败其他所有人。
  4. 平均胜率(“谁击败了谁”的平均值):这是最复杂的一种。对于每一道菜肴,你计算你击败了所有其他厨师的百分比。然后,你计算这些百分比的平均值。

    • 类比:想象你在每一道菜肴上都要与 1,000 名其他厨师对抗。要获得高分,你不仅需要“表现良好”;你需要在几乎每一道菜肴上都比大多数人表现更好。
    • 结果极难被操纵。在这种系统下获胜,一位厨师在一次测试中必须掌握24 道菜肴中的 22 道(92%),在另一次测试中必须掌握57 个科目中的 44.5 个(78%)
    • 原因?因为如果你只掌握了几道菜肴,你可能会在这些菜肴上击败其他厨师,但在你没有练习的菜肴上,你很可能会输给几乎所有人,从而拉低你的“胜率”。要获胜,你必须在所有方面都持续地优于所有人。

主要结论

本文得出结论:我们计票的方式比我们想象的更重要。

  • 如果我们使用平均值(算术平均数),排行榜就像纸牌屋。开发者可以通过秘密练习少数特定任务来操纵结果。这会制造一种“进步的假象”,即一个模型看起来很棒,是因为它背下了考题,而不是因为它实际上很聪明。
  • 如果我们使用平均胜率,排行榜就像一座堡垒。要操纵它,开发者必须背下几乎整个考题。这使得伪造成功变得困难得多。

那又怎样?

作者发现,目前流行的排行榜(如 MMLU 和 BIG-Bench)通常使用平均值,这使得它们非常容易受到作弊的影响。然而,如果它们切换到平均胜率,任何人想要操纵系统将变得极其困难。

本文并没有告诉我们如何作弊;相反,它充当了一个给这些比赛设计者的警告标签:“如果你使用平均值,你就是在邀请作弊者。如果你想要一场公平的比赛,请使用一种要求广泛、持续掌握的系统,而不仅仅是靠几次幸运的突破。”

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →