Large Language Models Threaten Double-blind Review
本文表明,大型语言模型能够通过识别标题和摘要中稳定的概念特征,有效地在双盲同行评审中对作者进行去匿名化,从而威胁到当前评审机制的完整性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,科学界就像一个巨大且繁忙的市场,研究人员带着他们最新的想法来到这里接受评判。为了保持公平,许多这样的市场使用了一条特殊的规则,叫做“双盲评审”。这就像一场关于身份的谜题游戏:评审者(审稿人)不知道谁写了论文,而作者也不知道谁在评审。其目标是确保一个想法纯粹基于其自身的价值进行评判,而不是看作者是一位来自顶尖大学的名教授,还是一个刚刚起步的学生。为了让这场游戏顺利进行,论文必须是一个完美的伪装。它应该是一个“鬼魂故事”,作者的身份被完全抹去,只留下科学本身。但如果这些“鬼魂”留下了只有超级智能机器才能看到的秘密指纹呢?这就是当今科学家们正在追问的问题,尤其是在人工智能(AI)能够比以往任何时候都更好地阅读和理解语言的时代。
这篇论文是一个侦探故事,讲述那个“鬼魂伪装”是否还能奏效。研究人员设计了一项测试,旨在观察现代人工智能模型,特别是大语言模型(LLM),是否仅通过阅读论文的标题和摘要(开篇的简短总结)就能识别出作者是谁。他们没有使用任何花哨的技巧,比如查看作者引用了谁或如何使用逗号;他们只给了 AI 最基本的文本信息。然后,他们要求 AI 从五名可能的嫌疑人中猜出作者:包括真正的作者和另外四位从事相似课题的专家。
结果对于旧有的公平规则来说有点令人毛骨悚然。当人类专家尝试玩这个猜谜游戏时,表现得很糟糕。在 100 次尝试中,人类仅能在第一次就正确猜中真实作者的情况下只有 11 次。他们大多只是在黑暗中瞎猜,将信心分散在多个嫌疑人身上。然而,当 AI 玩同样的游戏时,情况却大不相同。AI 在 100 次尝试中成功在第一次就猜中正确作者 42 次。这几乎是人类的四倍!
论文指出,AI 不仅仅是在瞎猜,它发现的是“潜在的概念签名”。可以这样理解:即使两个人都穿着同样的制服并说着同样的语言,他们可能仍有独特的拿咖啡杯或讲笑话的方式。在科学领域,研究人员有其独特的方式来构思问题或描述目标。AI 非常擅长读懂字里行间的意思,它能捕捉到标题和摘要中这些微妙的模式,从而将嫌疑人名单缩小到仅剩几个人,并持有高度的信心。
研究还检查了这种情况是否只发生在知名科学家身上。事实并非如此。无论面对的是资深研究员还是初级研究员,AI 的表现都一样出色。研究还发现,当“嫌疑人”之间的差异性较大时,AI 的表现会更好;但即便嫌疑人都是同一领域的专家,AI 的表现依然远优于人类。
然而,论文谨慎地指出,这并不是说双盲评审已经彻底崩溃,或者说 AI 总能百分之百确定地指认出作者。相反,它表明系统正变得具有“泄漏性”。AI 并不总能准确指向唯一的真实作者,但它可以极大地缩小可能性范围,使得匿名性不再像我们想象的那样安全。它将“完美的伪装”变成了“模糊的伪装”,而聪明的机器仍然可以看穿它。作者总结道,虽然 AI 不是每次都能破解谜题的魔杖,但它已经改变了游戏规则,以至于在计算机能比我们更了解我们思想的时代,我们可能需要重新思考如何保持科学评审的公平性。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。