← 最新论文
💬 NLP

How Closely Do LLM Reviews Align with Human Peer Review?

本研究通过将三种领先的大型语言模型与 ICLR 2026 投稿的人类同行评审进行对比评估,发现虽然大型语言模型能够大致区分被接收论文与被拒绝论文,但它们无法复制人类在口头报告(oral)与海报展示(poster)之间的区分,并表现出特定提供商的评分偏差以及在识别缺陷方面的主题差异。

原作者: Abraham Camelo-Guerrero, Jairo Diaz-Rodriguez

发布于 2026-08-05
📖 1 分钟阅读☕ 轻松阅读

原作者: Abraham Camelo-Guerrero, Jairo Diaz-Rodriguez

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一个这样的世界:每一项新的科学思想在向世界分享之前,都必须通过一个守门人。几十年来,这个守门人一直是人类专家,即同行评审员,他们阅读论文,思考其优缺点,并给出评分。这有点像选秀节目的评委,只不过他们评判的不是歌唱,而是复杂的数学和计算机代码。最近,一种新型的评委进入了竞技场:人工智能,特别是大语言模型(LLMs)。这些是经过海量文本训练的超级智能计算机程序,它们可以阅读论文并像人类一样撰写评论。但这里有一个核心问题:这些 AI 评委是真的在像人类评委那样“思考”,还是仅仅在模仿文字?如果 AI 说一篇论文“很好”,它所表达的意思与人类说“很好”时是一样的吗?这正是科学家们试图解决的谜题,因为如果我们开始使用 AI 来决定哪些科学论文可以发表,我们需要知道它们是否在遵循与人类相同的规则。

这篇论文就像是一个巨大的、受控的实验,研究人员设置了一场“评审对决”。他们从一个主要的计算机科学会议(ICLR 2026)中提取了 300 篇真实的科学论文,并要求三种不同的 AI 模型——OpenAI 的 GPT-5.4、Google 的 Gemini 3.1 Pro 和 Anthropic 的 Claude Opus 4.6——对它们进行评审。为了确保公平竞争,研究人员对论文进行了匹配,使得对于每一篇“口头报告”(顶尖级别的焦点论文),都有对应的“海报展示”论文(优秀但非顶尖)和一篇“被拒绝”的论文。随后,他们将 AI 的评审结果与实际的人类评审以及会议的最终决定进行了对比。

结果既有“还不错”的一面,也有“非常不同”的一面。首先是好消息:所有三种 AI 模型都足够聪明,能够分辨出一篇论文是被接收了还是被拒绝了。它们能看到“森林”。然而,它们完全没能看到“树木”。虽然人类评审员会对“口头报告”论文与“海报展示”论文给出截然不同的分数(识别出口头报告论文略胜一筹),但 AI 模型却将它们视为完全一样。它们无法分辨出一篇“好”论文与一篇“卓越”论文之间的区别。

此外,这些 AI 模型不仅评分方式不同,甚至还有各自独特的“个性”。Google 的 Gemini 是这组中的“好人”,它系统性地给所有人更高的分数,甚至给那些被人类拒绝的论文也打了高分。OpenAI 和 Claude 则更像是“严厉的批评家”,尤其是在面对顶尖的口头报告论文时,它们甚至比人类还要苛刻。

最后,研究人员观察了评审员们都在“抱怨”什么。人类和 AI 在大方向上是一致的,比如“实验不够强”或“写作不清晰”。但在细节方面,它们的关注点却不同。AI 模型痴迷于缺少与其他方法(基准)的对比,而人类评审员则更担心这项研究会消耗多少计算能力和资金。

简而言之,这篇论文表明,虽然 AI 可以作为捕捉明显错误的“第二双眼睛”提供帮助,但它尚未准备好取代人类评委。它可以告诉你一篇论文是“合格”还是“不合格”,但在理解让论文脱颖而出的微妙细微差别方面仍显吃力,而且它关注的事物与人类不同。如果把 AI 的分数等同于人类的分数,那就好比信任一个机器人去评判烹饪大赛,因为它能分辨出饼干是焦了还是新鲜的,但它根本不知道什么是“美食级”的味道。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →