Is Peer Review Really in Decline? Analyzing Review Quality across Venues and Time
本文通过引入一种量化评审质量的新框架,对关于标准下降的流行叙事提出了挑战,并通过对主要人工智能和语言学会议的跨时空分析,证明了中位评审质量随时间推移保持稳定。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
核心问题:评审质量是在变差吗?
想象一下,你正在运营一场规模宏大的全球性选秀节目。每年,成千上万的歌手(研究人员)提交他们的歌曲(论文),由专家评审团(评审员)进行评判。最近,观众席中流传着很多闲言碎语:“评委们变懒了!他们不再仔细聆听了。由于歌手太多而评委不够,反馈质量正在下降。”
这篇论文提出了一个简单的问题:这些闲言碎语是真的吗? 评审质量是真的随着时间推移而下降了,还是仅仅是一种感觉?
问题所在:你不能拿“苹果”去比“橘子”
为了回答这个问题,研究人员试图衡量“评审质量”。但他们遇到了障碍。想象一下,试图比较 2018 年的一个三明治和 2025 年的一个三明治的质量。
- 在 2018 年,三明治可能只是放在一张餐巾纸上,没有任何说明。
- 在 2025 年,它装在一个精致的盒子里,并附带一份成分清单。
- 有些评委写长篇大论;有些则写要点。
- 有些评委使用特定的格式;有些则自由发挥。
由于不同年份和不同会议(如 ICLR、NeurIPS 和 ACL)之间的“形式”和风格变化巨大,直接进行公平比较是不可能的。这就像是用一把尺子测量一组人的身高,却用另一把卷尺测量另一组人一样。
解决方案:“评审翻译器”
为了解决这个问题,作者构建了一个通用翻译器来处理评审意见。
- 扁平化(Flattening): 他们将所有不同的形式全部拆解,合并成一段长且连续的文本块。
- 条目化(Itemization): 他们使用了一种智能 AI(大语言模型)来充当专业编辑。这个 AI 将杂乱的文本重新组织成标准板块:总结(Summary)、优点(Strengths)、缺点(Weaknesses)以及其他(Other)。
你可以把这想象成将每一个三明治,无论其包装如何,都切成标准的块,以便你可以分别品尝面包、肉和奶酪的味道。这使得他们能够将 2018 年的评审与 2025 年的评审进行直接对比。
他们如何衡量“质量”
一旦评审意见被标准化,团队便通过三个主要的“味觉测试”来衡量它们:
实质性(是否有足够的肉和骨头?):
- 轻量级: 评审有多长?(计算字符数)。
- 深度: 评审提出了多少个不同的观点或“条目”?
- 类比: 短小的评审像是一块小饼干;长的评审则是一顿正餐。他们统计了评审中包含了多少“咬”的信息量。
可操作性(歌手是否真的能改进他们的歌曲?):
- 评审是否给出了具体的指令?(例如,“修改图 3”对比“这很糟糕”)。
- 类比: 一个好的评审就像教练说:“你的左脚踩得太靠前了。”而一个坏的评审只是在大喊:“你跑偏了!”作者测量了文本中包含了多少具体的“修复建议”。
落地性/证据支撑(他们是否看了论文本身?):
- 评审是否指向了论文的具体部分?(例如,“见第 4 页,第 10 行”)。
- 类比: 一个有落地性的评审就像侦探指着桌上的证据。一个没有落地性的评审则是在没有观察线索的情况下瞎猜。
结果:闲言碎语是错误的
在分析了多年来顶级计算机科学会议的数千份评审后,数据讲述了一个令人惊讶的故事:
评审质量的中位数并没有下降。
尽管人们担心评审员精疲力竭或者 AI 让评审员变得懒惰,但“平均”水平的评审在今天依然和几年前一样有帮助、详尽且有据可查。关于质量下降的“闲言碎语”并没有得到数据的支持。
为什么我们会“觉得”质量在下降?
如果质量是一样的,为什么大家的感觉却是变差了?作者提出了几种理论(假设):
- “人多,噪音也多”理论: 即便平均质量保持不变,但随着投稿数量的增长,总数较差的评审也在增加。如果你有 100 份评审且其中 5 份很差,比例是 5%。如果你有 10,000 份评审且其中 500 份很差,比例仍然是 5%,但突然间有 500 个人感到愤怒。这种糟糕体验的容量让人们觉得一切都出了问题。
- “差的变得更差了”理论: 也许平均水平没问题,但那些绝对最差的评审变得比以前更糟了,而人们讨论最多的正是这些评审。
- “我们只是不知道”理论: 也许质量确实下降了,但以一种作者无法衡量的方式(比如评审的“灵魂”),而目前的工具无法捕捉到这一点。
总结
该论文的结论是,我们不应恐慌并认为系统正在崩溃。其“平均”评审水平依然稳固。然而,由于论文数量呈爆炸式增长,我们需要更加努力地确保每个人都能获得好的评审,而不仅仅是保证“平均水平”。
作者还构建了一个工具包(代码和数据),其他研究人员可以利用它来持续监测未来评审系统的“健康状况”,从而确保我们是用事实而非感觉来引导决策。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。