Measuring research data reuse in scholarly publications using generative artificial intelligence: Open Science Indicator development and preliminary results
PLOS と DataSeer は、学術出版物における研究データの再利用率が 43% であることを明らかにする新たな LLM ベースの指標を開発し、生成 AI が大規模なオープンサイエンスの影響を測定できることを実証するとともに、データ共有の肯定的な効果が現在過小評価されていることを示唆している。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
科学研究の世界を、大規模で賑やかなキッチンだと想像してみてください。長年にわたり、私たちはシェフ(科学者)が、自分たちの庭から全く新しい野菜を切り分けるのではなく、他のシェフがカウンターに置いた食材(データ)を実際にどれくらいの頻度で使っているのかを突き止めようとしてきました。
この論文は、PLOS(科学出版機関)と DataSeer(テクノロジー企業)が、このキッチンの様子をスナップショットとして捉え、食材の共有がどれほど行われているかを正確に数えるために開発した、新しいハイテクな「スマートカメラ」について述べるものです。
以下に、彼らのプロジェクトをわかりやすく解説します。
課題:「沈黙する」再利用
以前、科学者がデータを再利用する頻度を数えるには、主に 2 つの方法がありました。
- 直接尋ねる:調査では、科学者の約 50% が「はい、他の人のデータを使っています」と回答しました。
- 公式な引用を探す:論文内の公式な「ありがとう」の手紙(引用)を探しました。しかし、この方法は、名札を着ている人だけを数えてパーティーのゲストを数えようとするようなものでした。隅でただ会話している人を見逃してしまうのです。この方法では、再利用は非常に低い(約 9〜16%)と示唆されていました。
科学者が「やった」と言ったことと、「名札」方式で「見えた」ことの間には、大きな隔たりがありました。
解決策:AI「スーパー読者」
この課題を解決するため、チームは 生成 AI(賢いコンピュータの脳の一形態)を構築しました。これは超注意深い読者のように機能します。この AI は、単に公式な引用を探すのではなく、科学論文の全文を読み、その物語を理解します。
まるで、特定の指紋を探すだけでなく、その人が図書館から本を借りたのか、新しい本を買ったのかを判断するために日記全体を読む探偵のようなものです。
AI のトレーニング方法:
- 彼らは AI に数千の科学論文を見せ、以下の 3 つを特定するよう教えました。
- 著者は新しいデータを作成しましたか(新しい野菜を育てたように)?
- 著者は既存のデータを再利用しましたか(他の人の残り食材を使ったように)?
- なぜそうしましたか(その「理由」)?
- 彼らは AI を人間の専門家と比較してテストし、正確性を確認しました。AI はこの分野で非常に優れており、再利用を約 85% の確率で正しく識別しました。
発見:キッチンが思っていたよりも賑やかだった
AI は 2024 年最初の 3 か月に発表された 4,475 件の科学論文を分析しました。その結果は以下の通りです。
- 大きな数字:論文の**43%**がデータを再利用していました。
- 比較:これは、以前の「公式な引用」方式(約 10% しか見ていなかった)よりもはるかに高いですが、科学者が調査で答えたこと(約 50%)とは非常に良く一致しています。
- 教訓:古い方法は、科学者が実際にはどれほど協力的で有益であるかを過小評価していた可能性が高いです。「再利用」は起こっていますが、それはしばしば論文の本文中で起こっており、公式な「ありがとう」の手紙が添えられていないのです。
興味深いパターン
AI はまた、地域や分野によるいくつかの違いに気づきました。
- 地域別:アジア太平洋地域の科学者がデータを再利用する可能性が最も高く(46%)、アフリカの科学者が最も低かった(31%)。著者らは、これがデータの世界的な共有のあり方や、データの所有権に関する懸念に関連している可能性があると示唆しています。
- 分野別:
- 自然科学と社会科学は最もバランスが取れており、新しいデータを作成する頻度とほぼ同じ頻度でデータを再利用していました。
- 生命科学(生物学など)は、全く新しいデータを作成する可能性が最も高く(76%)、既存のデータを再利用する可能性が最も低かった(37%)です。
なぜこれが重要なのか
著者らは、公式な引用だけを見ていると、オープンサイエンスがどのように機能しているかの全体像を見逃していると主張しています。この AI という「スマートカメラ」を使うことで、データ共有が私たちが思っていたよりも大きな影響を与えていることがわかります。
限界に関する重要な注意点:
著者らは慎重に、これは「進行中の作業」であると述べています。彼らは以下を認めています。
- 自分の古いデータを使うことと、他人のデータを使うことの区別をつけるのは難しい場合があります。
- 彼らは 1 つの出版機関(PLOS)の論文のみを対象としたため、結果は他のジャーナルでは異なる可能性があります。
- AI はまだ完璧ではありませんが、古い集計方法と比較すれば、大きな前進です。
要約すると、この論文は、科学者が私たちが認識していたよりもはるかに頻繁に互いの仕事を共有し、再利用していることを私たちに気づかせてくれる新しいツールを紹介しています。これは、「オープンサイエンス」運動が、私たちの古い測定基準が示すよりもうまく機能していることを示唆しています。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。