Who Funds Open Data Sharing? Analysis of data availability statements in biomedical publications
本研究分析了超过780,000篇生物医学文章,揭示了不同资助者和期刊在开放数据共享合规性方面的显著差异,发现总体比例为8.7%,其中主要资助者的比例上升至24%,而顶级期刊的比例则高达92.9%,同时强调基于PDF的检测方法识别出的共享声明比仅基于XML的方法多出52%。
原始论文根据 CC0 1.0(https://creativecommons.org/publicdomain/zero/1.0/)发布到公有领域。 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明
想象一下,科学的世界就像一座巨大且繁忙的图书馆,研究人员不断地在编写关于人体如何运作、疾病如何传播以及如何治愈它们的新书。长期以来,这些书的编写方式一直将“秘密配方”隐藏起来。如果一位科学家写道:“我们使用一种特殊的混合物找到了疗法,”他们通常不会告诉你这个混合物是什么,或者如何制作它。这使得其他科学家很难核查他们的工作或在此基础上进行研究。为了解决这个问题,一场被称为“开放科学”的运动开始了,它倡导一套被称为 FAIR 原则的规则。把 FAIR 想象成一个承诺:所有关于发现的数据都应该是可发现的(Findable)、可访问的(Accessible)、可互操作的(Interoperable,即易于与其他数据混合)以及可重用的(Reusable)。这个想法很简单:如果你分享了你的原始原料,每个人都可以品尝这道菜,检查配方,甚至可能发明出更好的版本。但这里有一个大问题:科学家们真的履行了他们的诺言吗?他们是真的在分享数据,还是仅仅口头上说会分享?
这篇论文就像是一个巨大的、高科技的侦探机构,其任务是找出究竟有多少科学家实际上在分享他们的数据。作者们——一群数据侦探——并没有只是要求研究人员举手示意;他们扫描了 2024 年 1 月至 2025 年 6 月期间发表的近一百万篇科学文章。他们使用了一种巧妙的两部分策略来捕捉真相。首先,他们查看了论文的数字“PDF”版本,这些版本就像你在书架上看到的最终精装书。其次,他们查看了“XML”版本,这些版本像是计算机使用的原始、未格式化的草稿。他们发现,原始草稿往往遗漏了那些隐藏在最终精装版本中的重要数据共享说明。通过使用一个聪明的计算机程序来阅读 PDF,他们能够发现其他方法所遗漏的数据共享承诺。
那么,他们发现了什么?消息有点复杂。总体而言,在他们查看的文章中,只有大约 8.7% 的文章确实有明确的陈述说:“是的,我们的数据是开放的,并已准备好供您使用。”这是一个相当低的数字,表明对于大多数科学家来说,开放数据的承诺仍然仅仅是一个承诺。然而,当你观察是谁在资助这项研究以及研究发表在哪里时,故事变得有趣得多。作者发现,分享率根据项目背后的“老板”不同而发生剧烈变化。
一些出资丰厚的资助机构,如法国研究机构或瑞士国家科学基金会,看到分享率跃升至 22%–24% 左右。更棒的是,一些特定的期刊(即发表论文的地方)正在引领潮流。专注于遗传学和脑科学的期刊,如《自然·遗传学》(Nature Genetics),显示其高达 92.9% 的文章都在分享数据。这就像一所学校,有些老师对作业要求严格,全班都能拿 A,而其他老师比较宽松,班级平均分就低得多。论文指出,当规则清晰且得到执行时,科学家确实会分享数据。但它也指出,我们不能确定是规则导致了分享;也许是那些喜欢分享的科学家本身就倾向于选择与这些特定的资助机构和期刊合作。
研究人员还发现,查看论文的“草稿”版本(XML)就像是在读一本缺了半页纸的书。他们的基于 PDF 的方法比仅使用 XML 方法多发现了约 52% 的数据共享声明。这意味着,在很长一段时间里,我们可能一直低估了实际分享的数据量,仅仅是因为我们查看的版本不对。
最后,这篇论文既没有宣布开放科学取得了全面胜利,也没有说我们完全失败了。相反,它提供了一张清晰、诚实的景观地图。它告诉我们,虽然整体的分享率离完美还很远,但在某些地方表现得极其出色。作者建立了一个公共仪表板,就像一个实时计分板,任何人都可以查看哪些资助机构和期刊做得最好。他们的工作表明,如果我们想看到更多的分享,我们需要看看那些顶尖表现群体是如何做到的,并尝试模仿他们的策略。通往一个完全开放的科学图书馆的旅程仍在进行中,但现在我们对哪些门是敞开的、哪些门仍然紧锁有了更清晰的了解。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。