← 最新论文
💻 computer science

Computer-generated content and the AI/ML retraction record, 2018– 2026: a characterization study

这项针对 2018 年至 2026 年间 13,502 条 AI/ML 相关撤稿记录的特征研究表明,计算机生成内容是推断出的撤稿最大单一原因,占病例的 34.8%,且主要影响 2021 年至 2023 年间发表的论文。

原作者: Anton Sokolov

发布于 2026-06-27
📖 1 分钟阅读☕ 轻松阅读

原作者: Anton Sokolov

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下科学出版的世界就像一座巨大且繁忙的图书馆。多年来,图书管理员(编辑和同行评审员)一直在检查书籍在入库前是否真实可靠,以及作者是否亲自完成了创作。

这篇论文就像是这份图书馆在 2018 年至 2026 年间“退货堆”中的一份成绩单。具体来说,它研究的是专门针对人工智能(AI)与机器学习的部分。

以下是作者 Anton Sokolov 所发现的故事,我将其进行了通俗易懂的解释:

1. 新问题:“幽灵作家”

在 2022 年之前,如果这个板块的书籍被退回,通常是因为作者抄袭了他人的故事(剽窃)、伪造数据,或者付费给“论文工厂”(生产虚假论文的工厂)来代写。

但在 2022 年开始,发生了一些新情况。大语言模型(比如你可能正在聊天的这类 AI)变得非常擅长撰写流畅且具有科学感的文本。突然之间,图书馆开始收到大量由这些“幽灵作家”撰写的书籍。

这项研究调查了 AI 板块中被撤稿(从书架上撤下)的 13,502 篇论文。他们问道:为什么这些书会被退回?

2. 重大发现

最令人惊讶的发现是,撤回这些 AI 论文的首要原因是计算机生成内容

  • 数据统计: 在每 100 篇被撤回的 AI 论文中,大约有 35 篇是因为文本是由 AI(如聊天机器人)生成的而被撤回的。
  • 对比分析: 这高于“同行评审受损”(22%)、“剽窃”(18%)或“编辑错误”(13%)。

把它想象成一家面包店。多年来,面包被扔掉的主要原因是烤焦了或变质了。但突然之间,面包店发现,面团本身竟然是由一个不懂烘焙的机器人制作的。这成了面包被丢弃的最常见原因。

3. “精准度”过滤器(安全网)

作者非常谨慎,并没有进行模糊的计数。他建立了一个带有不同确定性等级的“安全网”:

  • 高精准度: 标题明确标有“AI”或“机器学习”的论文。(3,243 篇)。
  • 广谱网络: 仅关于“计算机科学”的论文。(13,502 篇)。

即使只观察“高精准度”组(那些确定是关于 AI 的论文),也有 41.8% 是因为 AI 生成的文本而被撤稿的。因此,这个问题不仅仅是标签标注不严谨导致的偶然现象;在这一特定领域,它是一个真实且主导性的问题。

4. 时间线:突如其来的浪潮

论文像天气预报一样追踪了年份的变化:

  • 2018–2021 年: 被抓获的 AI 生成论文非常少。
  • 2022 年: 浪潮开始了。
  • 2023 年: 浪潮达到了顶峰。这是一个“海啸”年,主要是因为一家主要出版商(Hindawi/Wiley)进行了大规模清理,一次性撤回了数千篇论文。
  • 2024–2025 年: 数字从顶峰回落,但仍比 2022 年之前高出 10 倍

大多数这些劣质论文是在 2021 年至 2023 年 间撰写并发表的。它们被发现得很快,通常在发表后一年内就被发现了。

5. 谁参与其中?

研究列出了撤稿论文最多的出版商和期刊。

  • Hindawi(一家出版商)排名第一,占到了此名单中所有撤稿论文的三分之一以上。
  • 然而,作者警告说:这并不一定是一份“耻辱名单”。 有时,一家出版商之所以有这么多撤稿,是因为他们正在积极地清理书架并抓捕劣质论文,而不是因为他们是“最差”的出版商。这就像一家设有“退货”柜台的商店:退货数量多可能意味着这家店对质量要求非常严格,而不仅仅是因为他们卖了烂货。

6. 这项研究“不是”什么

作者非常明确地说明了这份报告没有告诉我们的信息:

  • 它没有告诉我们还有多少 AI 撰写的论文仍然在书架上且尚未被发现。
  • 它并没有证明 AI 研究人员是“坏人”。
  • 它也没有说 AI 研究比其他领域(如生物学或物理学)更容易失败。我们目前还没有数据来进行此类比较。

总结

这篇论文是一项“特征描述研究”。它就像是对 AI 论文“退货堆”进行的一次快照。

核心结论很简单:AI 生成文本的时代已经进入了科学领域,而这产生的第一大迹象就是撤稿量出现大幅激增,且其文本本身是由机器撰写的。

研究结论认为,为了让科学界解决这个问题,我们需要在撤稿记录中加入清晰的、机器可读的标签,注明“此文由 AI 撰写”。如果没有这些清晰的标签,我们就无法衡量问题,也无法妥善解决它。解决问题的“基质”(基础)在于拥有关于出错情况的诚实、清晰的记录。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →