💬 NLP
Impact of large language models on peer review opinions from a fine-grained perspective: Evidence from top conference proceedings in AI
该研究通过分析顶级 AI 会议论文,发现大语言模型的出现使同行评审报告在语言上更流畅、篇幅更长且更侧重表面清晰度,但导致了对原创性、可复现性及深度批判性推理等核心评价维度的关注减少。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
这篇论文就像是一次对学术圈“审稿人”大变身的深入调查。
想象一下,学术界的论文发表过程就像是一个巨大的美食评审团。作者们(厨师)把新菜(论文)端上来,评审团(审稿人)负责品尝,然后写下评语:这道菜是色香味俱全,还是难以下咽?最后决定这道菜能不能上菜单(被录用)。
过去,这些评审员都是靠自己的经验和味蕾(专业知识)来写评语。但最近,厨房里多了一位超级 AI 助手(大语言模型,LLM)。这篇论文就是想知道:当评审员开始用这位 AI 助手帮忙写评语时,到底发生了什么变化?
作者们没有只看表面,而是像拿着显微镜一样,从三个非常细致的角度去观察:
1. 语言风格变了:从“老练大厨”变成了“标准食谱”?
- 以前:评审员的评语可能长短不一,有的像老饕一样用词精准、句式复杂,有的可能比较随意。
- 现在(用了 AI 后):
- 字数变多了:就像 AI 是个话痨,它生成的评语通常更长、更流畅,读起来很顺滑。
- 套路变多了:AI 喜欢用一些“万能词”和固定的句式(比如“本文结构清晰”、“逻辑严密”)。这就好比以前大家是即兴发挥写评论,现在大家好像都在照着同一本“标准食谱”在写。
- 谁受影响最大?:那些对自己不太自信的评审员(觉得自己不太懂这个领域的人),用 AI 后变化最大。他们的评语突然变得很长、很专业,仿佛瞬间变成了专家。这就像是一个新手厨师突然有了 AI 写的完美菜谱,写出来的点评看起来非常“高大上”。
2. 关注点变了:从“尝味道”变成了“看摆盘”
这是论文最核心的发现,也是最有意思的地方。
- 以前:评审员会花很多精力去讨论这道菜的灵魂:食材新不新鲜(原创性)?做法能不能复制(可复现性)?有没有独特的创意?
- 现在(用了 AI 后):
- 更爱聊“摆盘”和“简介”:AI 很擅长写总结(Summary)和夸文章写得通顺(清晰度)。所以,现在的评语里,关于“这篇文章讲了什么”和“读起来很顺”的内容变多了。
- 忽略了“灵魂”:关于原创性(这道菜是不是真的创新?)和可复现性(别人能不能照着做出来?)的讨论反而变少了。
- 比喻:这就好比评审员以前会深入分析厨师的创意和食材来源,现在却花更多时间在夸“这道菜摆盘真漂亮,介绍写得真清楚”,却忘了去深究这道菜到底有没有新意。AI 帮他们把“表面文章”做得很好,但在“深度挖掘”上似乎有点偷懒。
3. 打分变了吗?AI 是“偏心眼”还是“公正秤”?
大家最担心的是:用了 AI 帮忙,评审员会不会手松,给分变高,或者乱给分?
- 研究发现:其实并没有太大变化。
- 虽然评语写得更好看了,但评审员打出的分数(1-10 分)和以前差不多。
- 那些关于“总结”或“清晰度”的评论,对分数的影响很小。
- 这说明:AI 主要帮评审员润色文字、整理思路,并没有直接替他们做“这道菜值不值钱”的核心判断。评审员还是掌握着最终的“定价权”。
总结一下这篇论文的“潜台词”:
- AI 是个好帮手,但不是全知全能的上帝:它能让评审报告写得更快、更流畅、更像样,特别是帮那些不太自信的评审员“撑场面”。
- 警惕“表面光鲜”:虽然报告看起来更漂亮了,但我们发现大家讨论“核心创新”和“深度逻辑”的内容变少了。这就像一道菜,包装越来越精美,但里面的食材是不是真的新鲜,反而被忽略了。
- 未来的方向:学术会议(如 ICLR 和 NeurIPS)正在尝试引入 AI 工具来辅助评审,这本身不是坏事。但我们需要制定规则,确保 AI 是用来辅助思考,而不是用来替代深度判断。
一句话概括:
AI 让学术评审的“文章”写得更好了,但可能让评审的“深度”变浅了。我们需要小心,别让漂亮的“包装”掩盖了内容的“空虚”。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。