From peer review nuances to best practices
本文分析了同行评审数据中三个特定细微差别——论文版本、评分版本和输入格式——对下游任务的影响,旨在为数据提供者和使用者建立最佳实践。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
科学评审的秘密生活
想象一个世界,科学家们向评委团提交他们的宏大构想,就像参加选秀节目一样。只不过他们展示的不是歌舞,而是研究论文。这些被称为“审稿人”的评委阅读作品,撰写详细的反馈,并给出评分,以决定该作品是否应该发表。这个过程被称为同行评审(peer review),它是科学界的守门人。然而,这里有一个陷阱:评委在评审开始时读到的论文,与最终发表的版本可能看起来大不相同。同样,在作者进行反驳之前,评委给出的分数,也可能与他们在反驳之后给出的分数不同。
最近,研究人员开始使用被称为**大语言模型(LLMs)**的超级智能计算机程序来辅助这种评审工作。这些模型可以像人类一样阅读论文并撰写评审意见。但问题在于:如果我们喂给这些计算机程序错误版本的论文,或者混淆了不同时间点的分数,结果可能会产生完全误导性的结论。这就像是让一位评委根据选手的试镜录像来评价其表现,却又将这个评分与选手在舞台上改进错误后的得分进行比较。为了确保这些“计算机评委”确实学到了正确的东西,我们需要明确我们观察到的是哪一个版本的论文以及哪一个版本的分数。
论文的大发现:不要混淆你的版本!
这篇论文对于任何研究计算机如何处理科学评审的人来说,都是一次警钟。由陆胜(Lu Sheng)领导的研究团队发现,在利用数据进行研究的过程中,许多人在无意中混淆了同一个故事的不同“版本”,从而导致了混乱且有时错误的结论。他们研究了三个主要的混淆点:论文版本(草稿 vs. 最终定稿)、分数版本(作者反驳前 vs. 反驳后)以及输入格式(文本是如何喂给计算机的)。
论文版本的谜题
把一篇论文想象成一座正在施工中的房子。“初始草稿”是带有摇晃墙壁的粗糙蓝图;“定稿版本(camera-ready version)”则是刷了新漆、换了新屋顶的完工房屋。作者发现,初始得分较低的论文往往会经历最大的“整容”。事实上,论文的“实质性”部分(方法和结果)变化最大,而“框架性”部分(如引言)的变化则较小。
棘手之处在于:当他们要求计算机模型对粗糙的草稿和完工的房子进行评分时,分数看起来几乎是一样的。看起来计算机似乎并不在意这些改进!但作者进行了更深入的研究,发现了一个秘密成分:作者信息。当论文中包含作者姓名和大学名称时,计算机模型会对完工后的房子给出更高的分数,这很可能是因为它们被作者的身份所打动(即“权威效应”)。然而,当隐藏作者姓名后,计算机模型实际上会对完中后的房子给出更高的分数,因为内容本身确实变好了。这两种效应相互抵消,使得看起来好像没有任何变化。这意味着,如果你不控制作者身份,你可能会错过论文实际上已经变好的事实。
分数版本的陷阱
作者还研究了在作者有机会进行反驳(称为“rebuttal”)后发生了什么。他们发现,近**三分之一(29.7%)**的评审在反驳后改变了总分。大多数情况下,分数的变动幅度为 0.5 分。这听起来可能很小,但其实影响巨大!大约 65.6% 的这类变动发生在“决策线”附近(例如从 2.5 分变为 3.0 分),而这正是论文被接收或拒绝的分水岭。
这里存在着文本与分数混淆的危险。想象一下这样一个数据集:计算机读取的是旧的评审文本(反驳前),却被要求预测新的分数(反驳后)。作者测试了这一点,发现这种不匹配会让计算机模型看起来比实际表现要好得多。事实上,取决于你使用的是正确的分数还是混淆后的分数,表现“最好”的计算机模型也会发生变化。如果你使用了错误的分数,你可能会认为一个模型是天才,而实际上它只是在根据一个错位的拼图进行猜测。
输入格式之谜
最后,团队提出了疑问:将论文作为纯文本、结构化列表(JSON)、格式化文档(Markdown),甚至是页面的图片喂给计算机,会有区别吗?对于他们测试的大多数计算机模型来说,格式不会显著改变分数。然而,对于一个特定的超大规模模型(gpt-oss-120b)来说,格式产生了很大影响,结构化的 JSON 格式会导致更高的分数。这表明不同的计算机“阅读”不同格式的方式各异,我们不能假设它们的工作方式完全相同。
我们应该怎么做?
论文最后总结了一套防止此类混乱的“最佳实践”。对于数据分享者,他们应该保存并标记每一个论文版本和每一个分数版本,而不仅仅是最终版本。对于数据使用者,他们需要反复确认:“我使用的是草稿还是定稿?我使用的是反驳前的分数还是反驳后的分数?这是什么格式?”
通过关注这些细节,研究人员可以确保他们的计算机模型是在从正确的信息中学习。作者指出,这些“细微差别”并非仅仅是枯燥的细节,它们实际上是测试计算机模型真实智能水平的强大工具。如果一个模型能够分辨出粗糙草稿与精修定稿的区别,或者能察觉到分数的变化,这说明该模型真正理解了内容,而不仅仅是在瞎猜。所以,下次当你看到关于 AI 评审论文的研究时,请记得问一句:“他们讲的是哪个版本的的故事?”
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。