← 最新论文
💬 NLP

Detecting AI-Generated Content in Academic Peer Reviews

该研究通过检测模型分析发现,2022 年后 ICLR 和 Nature Communications 等期刊的同行评审中 AI 生成内容显著增加,2025 年占比分别达到约 20% 和 12%,凸显了 AI 辅助评审在学术评估中日益增长的影响及进一步研究的必要性。

原作者: Siyuan Shen, Kai Wang

发布于 2026-03-24
📖 1 分钟阅读☕ 轻松阅读

原作者: Siyuan Shen, Kai Wang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文就像是在学术界的“安检口”装上了一台高科技的"AI 探测器”,用来检查科学家们提交的“审稿意见”(Peer Reviews)到底是不是人写的,还是由人工智能(AI)代劳的。

想象一下,学术界的论文发表过程就像是一个严格的“盲选”比赛:作者提交作品,评委(审稿人)匿名打分。以前,大家默认评委都是真人,凭自己的学识和良心在打分。但现在,随着像 ChatGPT 这样的 AI 越来越聪明,大家开始担心:评委是不是偷偷让 AI 帮忙写评语了?

这篇研究就是来回答这个问题的。

1. 他们是怎么做的?(训练“警犬”)

研究人员没有直接去问审稿人“你用了 AI 吗?”(因为没人会承认,而且审稿通常是匿名的)。相反,他们想出了一个聪明的办法:

  • 训练“警犬”:他们收集了 2021 年 的审稿意见。那时候 AI 还没那么普及,所以他们认为那时的审稿意见几乎全是真人写的。同时,他们用 AI 模仿人类写了一些假审稿意见
  • 教“警犬”认人:他们训练了一个计算机模型(就像训练一只警犬),让它学会区分“真人写的”和"AI 写的”文字风格。
  • 实战测试:训练好后,他们把这只“警犬”放到了 2022 年到 2025 年 的审稿意见里去“巡逻”,看看能不能抓出那些 AI 写的“假评语”。

2. 他们发现了什么?(从“风平浪静”到“洪水猛兽”)

结果非常惊人,就像看着一条平静的河流突然变成了瀑布:

  • 2022-2023 年(风平浪静)
    在顶级机器学习会议(ICLR)和顶级期刊(Nature Communications)上,AI 写的审稿意见几乎为零。那时候,大家似乎还在老老实实地自己写评语。
  • 2024 年(暗流涌动)
    情况开始变了。特别是在 2024 年的下半年,AI 写的评语开始悄悄冒头。
  • 2025 年(洪水爆发)
    到了 2025 年,情况彻底变了:
    • ICLR 会议 上,约 20% 的审稿意见被判定为 AI 生成(差不多每 5 条评论里就有 1 条是 AI 写的)。
    • Nature Communications 期刊 上,这个数字也达到了 12%

最有趣的是时间线:研究发现,Nature 期刊上的 AI 评语增长最快的时间段,正好是 2024 年第三季度到第四季度。这刚好对应了 OpenAI 发布更强大的 ChatGPT-4o 并免费向大众开放的时间。这说明,一旦 AI 工具变得更好用、更便宜,大家就立刻开始用了。

3. 这意味着什么?(比喻与启示)

  • 学术界的“信任危机”
    想象一下,如果你去餐厅吃饭,发现菜单上的“主厨推荐”其实全是机器打印的,你会怎么想?学术评审也是一样。如果审稿意见是 AI 写的,那么:

    • 质量存疑:AI 可能会胡编乱造,或者漏掉关键的科学错误。
    • 责任不明:如果评审错了,是审稿人的错,还是 AI 的错?
    • 透明度丧失:我们以为自己在和真人专家对话,其实可能是在和算法对话。
  • 不仅仅是“作弊”
    研究也提到,很多情况可能不是“完全由 AI 代写”,而是“人类写个大概,AI 帮忙润色”。这就像学生写作业,自己构思了大纲,但让 AI 帮忙把句子写得更漂亮。这种“人机合作”的界限很模糊,目前的检测技术很难精准识别这种“半真半假”的情况。

4. 总结

这篇论文就像给学术界敲了一记警钟:

AI 写审稿意见已经不是“未来会不会发生”的问题,而是“已经大规模发生”的事实。

从 2022 年的几乎为零,到 2025 年的五分之一,这种增长速度令人咋舌。作者呼吁,学术界需要尽快制定规则:

  • 是允许使用 AI 辅助,但必须公开声明
  • 还是完全禁止在评审中使用 AI?
  • 或者我们需要开发更厉害的“反 AI"工具来维持学术的纯洁性?

如果不加干预,未来的学术评审可能会变成一场“机器与机器的对话”,而人类真正的科学判断力可能会被淹没在算法的噪音中。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →