Who Funds Open Data Sharing? Analysis of data availability statements in biomedical publications
本研究は、78万件以上の生物医学論文を分析することで、助成機関およびジャーナル間におけるオープンデータ共有の遵守率に著しい格差があることを明らかにし、全体の遵守率は8.7%である一方、主要な助成機関では24%、トップクラスのジャーナルでは最大92.9%にまで上昇することを見出し、さらに、PDFベースの検出手法はXMLのみの手法よりも52%多く共有に関する記述を特定することを強調している。
原論文は CC0 1.0 (https://creativecommons.org/publicdomain/zero/1.0/) のもとパブリックドメインに提供されています。 これは査読を受けていないプレプリントのAI生成解説です。医学的助言ではありません。この内容に基づいて健康上の判断をしないでください。 免責事項の全文を読む
科学の世界を、研究者たちが私たちの体がどのように機能し、病気がどのように広がり、そしてそれをどうやって治すかについて、絶えず新しい本を書き続けている、巨大で賑やかな図書館だと想像してみてください。長い間、これらの本は「秘伝の材料」を隠したまま書かれていました。もし科学者が「私たちは特別な配合を用いて治療法を見つけた」と書いても、その配合が何であるか、あるいはどうやって作るのかを教えないことがよくありました。これでは、他の科学者が彼らの研究を検証したり、その上に新たな研究を築いたりすることが困難になります。これを解決するために、「オープンサイエンス」と呼ばれる運動が始まり、FAIR原則と呼ばれる一連のルールを提唱しました。FAIRとは、発見の背後にあるすべてのデータが、Findable(見つけやすく)、Accessible(アクセス可能で)、Interoperable(他のデータと混ぜ合わせやすく)、そしてReusable(再利用可能)であるべきだという約束だと考えてください。考え方はシンプルです。もしあなたが生の材料を共有すれば、誰もがその料理を味わい、レシピを確認し、さらにはもっと優れたものを発明できるかもしれないのです。しかし、ここで大きな疑問があります。科学者たちは本当に約束を守っているのでしょうか? 彼らは本当にデータを共有しているのでしょうか、それとも単に「するつもりだ」と言っているだけなのでしょうか?
この論文は、科学者が実際にどれくらいのデータを共有しているのかを突き止めるために任務に就いた、巨大でハイテクな探偵事務所のようなものです。著者たちであるデータ捜査官のチームは、単に研究者に手を挙げてもらうだけでなく、2024年1月から2025年6月の間に発表された約100万件もの学術論文をスキャンしました。彼らは、真実を暴くための巧妙な二部構成の戦略を用いました。第一に、彼らは論文のデジタル版である「PDF」バージョン、つまり書棚に並んでいる完成された美しい本の形をしたものを調べました。第二に、彼らはコンピューターが使用する未フォーマットの草稿である「XML」バージョンを調べました。彼らは、完成した美しいバージョンには含まれている重要なデータ共有に関するメモが、生の草稿では欠落していることが多いことを発見しました。スマートなコンピュータープログラムを使ってPDFを読み取ることで、彼らは他の手法が見逃していたデータ共有の約束を特定することができたのです。
さて、彼らは何を見つけたのでしょうか? ニュースは少し複雑です。全体として、彼らが調べた論文のうち、明確に「はい、私たちのデータはオープンであり、皆様が利用できる状態にあります」という声明を含んでいたものは、わずか約8.7%でした。これはかなり低い数字であり、ほとんどの科学者にとって、オープンデータの約束はまだ単なる約束に過ぎないことを示唆しています。しかし、誰が研究に資金を提供しているのか、そしてどこに発表されているのかを見ると、物語はもっと面白くなります。著者たちは、共有の割合がプロジェクトの背後にある「ボス」によって劇的に変化することを発見しました。
フランスの研究機関やスイス国立科学財団のような大規模な資金提供団体では、共有率は約22〜24%にまで跳ね上がりました。さらに素晴らしいことに、特定のジャーナル(論文が発表される場所)がこの動きを先導しています。例えば、『Nature Genetics』のような遺伝学や脳科学に焦点を当てたジャーナルでは、最大92.9%の論文がデータを共有していることが示されました。これは、ある学校では先生が宿題に厳しくクラス全員がA判定を取る一方で、他の先生はもっと寛容でクラスの平均点はずっと低い、という状況に似ています。この論文は、ルールが明確で強制力があるとき、科学者はデータを共有することを示唆しています。しかし、そのルールが共有を「引き起こした」と断定することはできません。もしかすると、共有を好む科学者が、最初からそれらの特定の資金提供者やジャーナルを選んで活動しているだけなのかもしれません。
研究者たちはまた、論文の「草稿」バージョン(XML)を見ることは、ページの半分が欠けた本を読むようなものであることにも気づきました。彼らのPDFベースの手法は、XMLの手法単独よりも約52%多いデータ共有の声明を見つけ出しました。これは、長い間、私たちは間違ったバージョンのテキストを見ていたために、実際に共有されているデータの量を過小評価してきた可能性があることを意味します。
結局のところ、この論文はオープンサイエンスの完全な勝利を宣言しているわけでも、完全に失敗したと言っているわけでもありません。むしろ、それは景観の明確で正直な地図を提供しています。全体的な共有率はまだ完璧には程遠いものの、驚異的にうまく機能している明るいスポットが存在することを示しています。著者たちは、どの資金提供者やジャーナルが最も優れた仕事をしているかを誰でもチェックできる、ライブスコアボードのような公開ダッシュボードを構築しました。彼らの研究は、もし私たちがより多くの共有を実現したいのであれば、これらトップレベルのグループが何を行っているのかを見て、そのプレイブック(戦略)を模倣する必要があることを示唆しています。完全にオープンな科学の図書館への旅はまだ進行中ですが、今や私たちは、どのドアが開いていて、どこがまだロックされているのかを、より正確に把握できるようになりました。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。