Detecting Evidence of LLM Contributions to Open Access Biomedical Literature: A Bibliometric Analysis
这项针对近 300 万篇开放获取生物医学文章的文献计量分析显示,2022 年后与大语言模型相关的术语显著增加,表明生成式人工智能工具正被快速采用,并凸显了对透明度和检测方法以维护科学诚信的紧迫需求。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
几十年来,学者们一直依赖工具来使他们的写作更加清晰,并提高研究效率。拼写检查器和语法软件长期以来一直是标准的助手,在不改变作者核心语调的情况下,平滑掉错误并建议更好的措辞。近年来,新一代此类工具已经出现,它们能够生成听起来非常像人类的完整段落。这些被称为“大语言模型”的系统经过海量书面材料的训练,可以在几乎任何主题上产生连贯、精炼的散文。虽然它们承诺能加速写作过程,但也向科学界提出了一个难题:我们如何区分一句由人类研究人员撰写的句子和一句由机器创作的句子?这种区别至关重要,因为科学文献的完整性取决于其中呈现的思想的真实性和事实的准确性。如果新研究中有相当一部分是由这些工具起草或进行深度编辑的,那么我们阅读、信任并基于这些知识进行构建的方式可能需要发生改变。
一组研究人员试图通过直接观察文字本身来回答这个问题。他们将目光投向了名为 PubMed Central 的公共数据库中庞大的开放获取医学和生物学研究论文集。这个集合包含了数百万篇文章,为全球科学家如何撰写其研究成果提供了一个巨大的窗口。该团队并未试图猜测哪些特定的论文是由机器撰写的——这项任务已被证明对人类和计算机程序来说都非常困难。相反,他们寻找的是另一种信号。他们检查了某些词汇和短语(之前的研究发现这些词汇在人工智能而非人类的使用频率更高),在 2-2022 年底这些工具向公众广泛开放后,是否在科学文献中变得更加普遍。
研究人员收集了 2019 年至 2024 年间发表的近 300 万篇文章。他们创建了一个包含 190 个特定单词和短语的列表,这些词汇在早期的研究中被标记为具有人工智能特征。这些包括形容词如“meticulous”(细致入微的)和“intricate”(复杂的),动词如“delve”(深入探究)和“underscore”(强调),以及较长的短语如“navigating the complexities of”(应对……的复杂性)或“it is important to note”(值得注意的是)。随后,他们扫描了数据集中的每一篇文章,以查看这些术语出现的频率。目标是观察这些词的使用频率是否随时间发生了变化,特别是寻找在新型 AI 工具发布后是否存在使用量的剧增。
结果显示,生物医学研究的语言发生了清晰且剧烈的转变。在 2022 年之前,这些特定术语的使用增长缓慢且稳定,符合人类写作方式的正常变化。然而,从 2023 年开始并持续到 2024 年,许多这类词汇的使用量出现了爆炸式增长。例如,“meticulously”(细致地)这个词在 2019 年整个数据库中出现的次数不到一千次,但在 2024 年出现了超过 16,000 次。“it's important to note”(值得注意的是)这一短语也经历了类似的激增,从 2019 年的仅 29 例跳升至 2024 年的近 800 例。或许最能说明问题的是那些更长、更复杂的短语。组合词“delving into the intricacies of”(深入探究……的复杂性)在 2023 年之前的文献中几乎不存在,但到 2024 年它已出现在数十篇文章中。研究人员指出,这不仅仅是孤立的单词变得流行,而是已知为 AI 写作标志的特定词组正在以越来越高的频率共同出现。
研究还观察了这些词是如何相互组合使用的。他们发现,这些与 AI 相关的术语对和词组出现在同一篇文章中的频率,在统计学上是不太可能由偶然发生的。例如,“artificial intelligence”(人工智能)和“underscore”(强调)这两个词开始比以前更频繁地出现在同一篇论文中。研究人员观察到,这些模式并非语言风格的缓慢演变(这种演变通常会历经多年才逐渐发生),而是一个与生成式 AI 工具公开发布时间完全吻历的突然拐点。虽然这项研究无法证明任何单篇文章是由机器撰写的,但这种语言转变的巨大规模表明,这些工具正被该领域的作者广泛使用。
研究作者强调,这并不意味着研究本身必然存在缺陷,也不意味着每篇使用这些词汇的文章都是虚假的。相反,研究结果指向了新的写作辅助工具正迅速且广泛地被采用,从而改变了科学交流的纹理。研究人员认为,由于这些工具有时可能会出错或产生缺乏真正理解的内容,科学界需要开发出更好的方法来识别何时正在使用它们。他们建议,与其试图禁止这些工具(它们很可能会长期存在),学者、编辑和评审员应该专注于透明度。通过承认何时以及如何使用这些工具,即使在创造知识的方法不断演进的过程中,科学记录也能保持可信。该研究结论指出,科学语言正在发生变化,识别这些新模式是理解人工智能如何重塑我们分享知识方式的第一步。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。