← 最新论文
💬 NLP

Measuring research data reuse in scholarly publications using generative artificial intelligence: Open Science Indicator development and preliminary results

PLOS 与 DataSeer 共同开发了一种基于大语言模型的新指标,该指标揭示学术出版物中的研究数据重用率为 43%,表明生成式人工智能能够大规模衡量开放科学的影响,并提示数据共享的积极效应目前被低估。

原作者: Lauren Cadwallader, Iain Hrynaszkiewicz, parth sarin, Tim Vines

发布于 2026-05-01
📖 1 分钟阅读☕ 轻松阅读

原作者: Lauren Cadwallader, Iain Hrynaszkiewicz, parth sarin, Tim Vines

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,科学研究的世界就像一个巨大而繁忙的厨房。多年来,我们一直试图弄清楚,厨师们(科学家)实际上有多少次是在使用其他厨师留在柜台上的食材(数据),而不是仅仅从自己的菜园里切下全新的蔬菜。

本文介绍的是由 PLOS(一家科学出版商)和 DataSeer(一家科技公司)共同构建的一种新型高科技“智能相机”,旨在对这座厨房进行快照,并精确统计食材共享发生的频率。

以下是他们项目的简明分解:

问题:“沉默”的复用

此前,我们尝试通过两种主要方式来统计科学家复用数据的频率:

  1. 直接询问他们:调查显示,约 50% 的科学家表示:“是的,我使用他人的数据。”
  2. 查找正式引用:我们在论文中寻找正式的“致谢”(引用)。但这种方法就像试图通过只查看佩戴姓名牌的人来统计派对上的宾客数量。它漏掉了所有那些只是在角落里闲聊的人。这种方法显示复用率非常低(约 9%–16%)。

科学家声称自己做了什么,与“姓名牌”方法所能看到的之间,存在巨大差距。

解决方案:AI“超级读者”

为了解决这一问题,团队构建了一个生成式人工智能(一种智能计算机大脑),它充当一位超级专注的读者。这种 AI 不再仅仅寻找正式引用,而是通读整篇科学论文以理解其内容。

这就像一位侦探,他不只寻找特定的指纹,而是阅读整本日记,以判断这个人是从图书馆借了书,还是买了一本新书。

他们如何训练 AI:

  • 他们向 AI 展示了数千篇科学文章,并教导它识别三件事:
    1. 作者是否创建了数据(就像种植新蔬菜)?
    2. 作者是否复用了现有数据(就像使用别人剩下的食材)?
    3. 他们为什么要这样做?(“理由”)。
  • 他们将 AI 与人类专家进行了对比测试,以确保其准确性。AI 在这项任务上表现非常出色,正确识别复用的准确率约为 85%。

发现:厨房比我们想象的更繁忙

该 AI 分析了 2024 年前三个月发表的 4,475 篇科学论文。以下是它的发现:

  • 关键数字43% 的论文复用了数据。
  • 对比:这一比例远高于旧的“正式引用”方法(该方法仅观察到约 10%),但与科学家在调查中告诉我们的数据(约 50%)更加吻合。
  • 结论:旧方法很可能低估了科学家实际上的互助与合作程度。“复用”确实正在发生,但它往往发生在论文的文字中,而没有附带正式的“致谢”说明。

有趣的模式

AI 还注意到不同地区和学科之间存在差异:

  • 按地区亚太地区的科学家最有可能复用数据(46%),而非洲地区的科学家可能性最低(31%)。作者认为,这可能与全球数据共享的方式以及关于数据所有权的担忧有关。
  • 按学科
    • 物理科学社会科学最为均衡,复用数据的频率几乎与创建新数据的频率相当。
    • 生命科学(如生物学)最有可能创建全新数据(76%),而最不可能复用现有数据(37%)。

为何这很重要

作者认为,如果我们只关注正式引用,就会错过开放科学运作的全貌。通过使用这种 AI“智能相机”,我们可以看到数据共享产生的影响比我们想象的更大。

关于局限性的重要说明:
作者谨慎地指出,这是一项“进行中的工作”。他们承认:

  • 区分使用自己的旧数据与使用他人的数据可能很棘手。
  • 他们仅查看了来自一家出版商(PLOS)的论文,因此结果在其他期刊中可能会有所不同。
  • AI 尚未完美,但相较于旧的统计方法,这是一个巨大的进步。

简而言之,这篇论文介绍了一种新工具,帮助我们认识到科学家分享和复用彼此工作的频率远高于我们之前的认知,这表明“开放科学”运动的成效比我们旧有的衡量标准所能显示的更好。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →