← 最新论文
💻 computer science

Reviewer Scores Are Not Comparable Across Research Areas in ML Peer Review

本立场论文认为,机器学习会议的录取结果是由测量设计缺陷而非个人偏见驱动的,通过对超过 5 万篇论文的分析证明了不同研究领域之间的评审分数在本质上是不可比的,导致在相同分数下,录取概率会因主题不同而产生高达 8 倍的差异。

原作者: Binyan Xu, Fan Yang, Xilin Dai, Kehuan Zhang

发布于 2026-07-31
📖 1 分钟阅读☕ 轻松阅读

原作者: Binyan Xu, Fan Yang, Xilin Dai, Kehuan Zhang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

评分卡之谜

想象一下,一场规模宏大、面向全球的科学竞赛,每年都有成千上万名才华横溢的学生提交他们的项目。为了决定谁能获得参加最终展示会的资格,评审团会给每个项目一个简单的数字分数,比如 1 到 10 分的评分。这项科学竞赛的规则本应是简单且公平的:7 分意味着“优秀的工作”,无论该项目的主题是什么。无论你设计的是一个会跳舞的机器人,还是一个预测天气的程序,亦或是一种教计算机阅读的新方法,7 分都应该代表同样的意思。

但如果“机器人”领域的评审员非常严苛,只有完美的机器人才能得到 7 分,而“天气”领域的评审员则超级兴奋,几乎看到任何像云的东西都会给 7 分呢?如果你不知道一个项目属于哪个领域,这单一的一个数字就会变得令人困惑。在某个领域,一个 7 分可能是通往成功的金钥匙,而在另一个领域,一个 7 分可能只是礼貌性的拒绝。这就是机器学习领域的研究人员试图解决的谜题。他们正在观察计算机如何学习识别模式、做出决策以及解决问题,并且他们提出了一个令人不安的问题:我们用来评价这些论文的“分数”是否真的公平,还是完全取决于你属于哪个“圈子”?

论文的大发现:评分系统失灵了

这篇由研究团队撰写的论文深入研究了顶级机器学习会议 ICLR 的数据。他们查看了 2021 年至 2026 年间提交的 5 万多篇论文,以观察这个“分数”是否真的对每个人都意味着同样的东西。他们的结论令人震惊:分数是不具备可比性的。

把它想象成一款电子游戏,不同关卡的玩家使用的是不同的控制器。在“热门”(Trending)关卡中(例如 AI 的热门新话题),控制器的灵敏度极高。轻轻一点就能获得高分。而在“传统”(Old School)关卡中(如较旧、已成熟的话题),控制器则非常僵硬,很难按下。如果你在“热门”关卡中得到 5.0 分,你可能是一个超级巨星;但如果你在“传统”关卡中得到 5.0 分,你可能正处于挣扎之中。论文发现,对于完全相同的评审员分数,一篇论文被接收的机会根据其主题的不同,最高可达 8 倍之差

例如,一篇关于“思考”或“推理”的论文,如果得分为 5.0,其被接收的概率为 52.6%。但一篇关于“图像识别”或“对抗性攻击”的论文,即使拥有完全相同的 5.0 分,其被接收的概率仅为 6.6%。这是八倍的差距!研究人员称之为“测量设计失效”。这并不是因为评审员很刻薄或者领域主席有偏见,而是因为系统本身出了问题,因为它试图用一把单一的尺子去衡量本质上完全不同的事物。

这不是什么(红鲱鱼/误导项)

作者非常谨慎地排除了导致这种差距的其他原因。他们问道:“是因为‘热门’话题的质量更高吗?”答案是否定的。如果真是这样,那些热门话题中的接收论文应该会有更高的分数。相反,数据表明事实恰恰相反:热门话题接收的论文分数反而比冷门话题更低。

他们还检查了是否因为“传统”话题拥有超级专业的评审员,从而导致评审标准更高。数据再次显示答案是否定的。那些难以取悦领域的评审员并不比其他人更自信或更专业,他们和其他人的热情程度是一样的。

最后,他们怀疑是否因为“热门”话题由于投稿量过大而导致了“质量稀释”。数据表明,话题增长的速度与质量下降之间没有关联。事实上,一些快速增长的话题保持了稳定的接收率,而另一些则出现了下滑。

真正的元凶:“热潮周期”与“补丁”

那么,为什么会发生这种情况呢?论文认为这是一个结构性问题。当一个话题处于“火热”状态时(如一个新的、令人兴奋的趋势),它会吸引大量的新手、初级评审员,他们充满热情且可能比较宽容。当一个话题处于“成熟”阶段时(如一个旧的、已建立的领域),它会吸引资深的专家,而专家们通常更加挑剔。因为系统并不知道分数是由给出的,所以它将一个兴奋的初学者给出的“6 分”与一个严厉的老手给出的“6 分”视为同等对待。

为了解决这个问题,领域主席(做出最终录取决定的人)必须进行猜测。他们利用自己的“社区先验知识”——基本上就是他们对于在特定话题中获得论文接收有多难的直觉。他们实际上是在用自己的直觉为一个破碎的系统打“补丁”。这意味着,对于一篇处于边缘地位的(“临界点”)论文,其命运并不取决于工作的质量,而取决于该话题目前是否“流行”。

我们该怎么办?

论文不仅指出了问题,还提出了一个三步走的计划,而无需彻底重建整个系统:

  1. 保持透明: 会议组织者应该发布一份报告,展示每个主题的接收率,并按分数进行细分。如果一篇论文得到了 5.0 分,每个人都应该能看到:“哦,话题 A 的 5.0 分有 50% 的机会被接收,但话题 B 的 5.0 分只有 6% 的机会。”这让隐藏的偏见变得可见。
  2. 创建定制规则手册: 不要对所有事情都使用通用的“1 到 10”量表,每个研究社区都应该编写自己的特定清单(准则),以定义什么是优秀的论文。一篇优秀的理论论文与一篇优秀的工程论文看起来是不同的,规则也应该反映这一点。
  3. 使用更好的信号: 论文建议使用“校准信号”。例如,系统不应只看原始数字,还可以根据评审员的历史记录(该评审员通常给高分还是低分?)来调整分数。此外,它还建议让作者在提交多篇论文时对自己的论文进行排序,这有助于系统比单纯的原始数字更好地理解工作的相对质量。

总结

论文的结论是,目前的系统就像一场比赛,不同赛道的选手在不同的路面上奔跑,但所有人都是用同一个秒表来计时。在“热门”赛道的选手之所以领先,并不是因为他们跑得更快,而是因为赛道更容易。作者认为,除非我们修复赛道,并确保所有赛道的评分都是公平的,否则优秀的论文仍可能仅仅因为它们所研究的话题目前不够“酷”而被拒绝。解决方案不在于责备评审员,而在于承认我们正在使用的尺子尺寸不对。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →