← 最新论文
💬 NLP

Evaluating the Impact of Reviewer Guideline Design on LLM-Based Automated Peer Review

本研究表明,当由官方会议指南而非大语言模型生成的模仿内容进行引导时,自动化同行评审系统与人类判断的一致性最高,并且允许整体评分的表现优于严格基于评分量表的做法。

原作者: Haowen Li, Yoichi Ishibashi, Masafumi Oyamada

发布于 2026-07-28
📖 1 分钟阅读☕ 轻松阅读

原作者: Haowen Li, Yoichi Ishibashi, Masafumi Oyamada

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

伟大的翻译者:当人工智能学会读懂“弦外之音”

想象一下,你正试图教一个机器人如何评判一个科学展览项目。你可以给机器人一个简单的规则:“如果项目看起来闪闪发光,就给它一颗金星。”但这太简单了;机器人可能只会寻找亮片,却忽略了真正的科学内容。这就是学术同行评审领域面临的挑战——人类专家需要花费无数小时阅读论文,以判断一个想法是天才之作还是漏洞百出。最近,科学家们开始寻求人工智能(AI)的帮助,以减轻这项繁重的工作。但棘手之处在于:你该如何告诉 AI 它应该寻找什么?是给它一份严格的清单,就像只有唯一正确答案的数学测试?还是给它一种“感觉(vibes)”,让它像资深艺术评论家一样运用自己的判断力?

这个问题正是庆应义塾大学和 NEC 公司研究人员开展的一项新研究的核心。他们想看看,向 AI 提供“评审指南”(即关于如何评价论文的指令)是否真的能帮助它做得更好。他们测试了两种主要的指令类型。第一种类型是“官方规则手册”,即主要计算机科学会议使用的正式指南。第二种类型是“模仿者指南”,研究人员要求 AI 阅读数千条过往的人类评审意见,并根据它认为人类喜欢什么,从而写出一套属于它自己的规则。他们还测试了强制 AI 使用僵化的评分系统(量表)是会让它变得更聪明,还是仅仅变得更像机器人。

论文之旅:测试 AI 的“品味”

研究人员设计了一个大规模实验,以观察哪种方法产生的评审意见能获得人类的认可。他们从一个主要会议(ICLR 2024)中提取了 1,500 篇真实的论文,并要求三种不同的 AI 模型对它们进行评分。目标很简单:AI 能否给出一个(1 到 10 分)与人类评审员平均分相匹配的分数?

首先,他们尝试让 AI 在没有任何指令的情况下对论文进行评分。正如你所预料的,AI 显得有些不知所措,给出的分数与人类相比波动很大。接着,他们向 AI 提供了来自 NeurIPS、ICLR 和 ARR 等会议的官方规则手册。结果出现了巨大的进步。AI 突然变得与人类的判断高度一致。事实证明,人类花费数十年时间不断完善、用以捕捉糟糕科学并识别优秀科学的指南,正是 AI 最完美的“辅助轮”。AI 不需要发明自己的规则,它只需要遵循那些已经行之有效的规则即可。

接下来,他们尝试了**“模仿者指南”**。他们要求 AI 阅读高质量的人类评审意见,并总结出是什么让一篇论文变得“好”或“坏”。他们希望这能捕捉到“人类的触感”。然而,这种方法的效果不如官方规则手册。AI 对人类行为的总结尝试显得有些模糊,在预测人类评分方面效果较差。这似乎表明,虽然人类擅长撰写评审意见,但并不总是擅长以一种能让另一个 AI 完美复制的方式来解释他们为什么那样写。

最后,研究人员测试了“量表(Rubric)”方法。在这种方法下,AI 被迫去勾选特定的选项(例如“是否引用了 5 篇论文?是/否”),并通过累加分数来得出最终得分。他们发现,这种僵化的、类似数学的方法反而让 AI 的表现变差了。当 AI 被允许更加灵活,并根据论文的整体感觉给出“整体性(holistic)”评分——就像人类那样——它与人类意见的匹配度反而更高。

结论:信任旧规则,而非新花招

研究结论指出,如果你想让 AI 扮演公正的同行评审员,你不应该试图重新发明轮子。引导 AI 的最佳方式是给它那些会议已经完善过的、由人类编写的官方指南。这些文档就像一张地图,向 AI 展示了哪里是糟糕科学的陷阱,哪里是优秀科学的高峰。

有趣的是,研究表明,试图强迫 AI 使用基于分数的清单来进行过于精确的评分,实际上会损害其性能。人类评分并不是通过累加分数,而是阅读整个故事并形成观点。当 AI 被允许这样做时——即观察大局并运用其“判断力”而非仅仅是计算数字时——它的表现会更好。因此,虽然 AI 在阅读科学方面正在进步,但它最好的学习方式仍然是吸收人类经验的智慧,而不仅仅是一套僵化的指令。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →