A Multi-Surface Consistency Audit of Software Citation Metadata
本論文は、複数の機械判読可能なメタデータ・サーフェスにわたる117件のオープンソース研究ソフトウェアプロジェクトを監査し、その結果、83.9%が少なくとも1つのコアフィールドにおける不一致を示しており、その主な要因はソフトウェアの説明とその関連する出版記録との間の相違にあることを明らかにしている。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
現代科学の世界において、ソフトウェアは顕微鏡や望遠鏡と同じくらい不可欠なものとなっています。それは研究者が数値を計算し、気候変動をシミュレートし、原子の挙動をモデル化するために使用するツールです。このソフトウェアは人間の労働と知的努力の産物であるため、科学界はそれが研究論文と同様に引用されるべきであるという合意に達しています。科学者が特定の発見を行うために特定のプログラムを使用した際、その作成者、使用したバージョン、そしてそのソフトウェアがどこにあるのかを明示すべきなのです。これを可能にするために、ソフトウェアプロジェクトがデジタルな「名札」を残せるシステムが構築されました。これらのタグは、プロジェクトのタイトル、著者名、バージョン番号、およびそのソフトウェアがオンライン上のどこに存在するのかを示す一意の識別子を含む、機械判読可能なファイルです。その意図は、もし研究者や司書、あるいはコンピュータプログラムがこれらのタグを見れば、それらすべてが同じ一つのソフトウェアについて同じ物語を語るようにすることです。
しかし、最近のある研究は、シンプルながらも不安をかき立てる問いを投げかけました。これらの名札は、実際に互いに一致しているのだろうか?という問いです。イリノイ大学のPengyin Shan氏率いる研究チームは、117のオープンソース・リサーチソフトウェア・プロジェクトのデジタルな自己記述を監査することに決めました。彼らは、プロジェクトが自身を記述する可能性のある7つの異なる場所を調査しました。それは、引用用の特定のファイル、アーカイブ用のデータファイル、ソフトウェアがダウンロードされる公開レジストリの記録、そしてプロジェクトのメインウェブページ上のテキストです。彼らは、ソフトウェアを単一のオブジェクトとし、これらの様々なファイルをそのオブジェクトの異なる「表面」または「面」として扱いました。もしシステムが完璧に機能していれば、すべての表面が同じことを言っているはずです。もし食い違いがあれば、誰がその仕事を行ったのか、どのバージョンが使用されたのか、そしてどこでコードを見つけることができるのかについて混乱が生じます。研究の結果、システムは決して完璧ではないことが判明しました。実際、調査されたプロジェクトの大部分が、インターネットの異なる部分に対して異なる物語を語っていました。
研究者たちは、これらのプロジェクトをチェックするための入念なプロセスを構築しました。彼らは、スーパーコンピューティングや量子コンピューティングに使用されるハイパフォーマンス・コンピューティング・ツールや、コミュニティ・ジャーナルに受理された小規模なグループのツールを含む、117のソフトウェア・ツールを集めました。各プロジェクトについて、彼らはある特定の日に7つの異なる表面のスナップショットをダウンロードしました。そして、コンピュータプログラムを使用して情報を正規化し、異なるファイル形式を、タイトル、著者、バージョン、年、ライセンス、および一意の識別子という6つの主要な事実の共通リストへと翻訳しました。彼らは、プロジェクトごとに存在するすべての表面のペアを比較し、事実が一致するかどうかを確認しました。彼らの手法の正確性を確保するため、彼らはコンピュータによる判断の大きなサンプルを手作業でチェックし、彼らのツールが99パーセント近い精度で正しかったことを確認しました。
結果は、著しい一貫性の欠如を明らかにしました。117のプロジェクトのうち、比較可能な少なくとも2つの表面を持つプロジェクトは62件だけでした。これら62件のプロジェクトのうち、52件(約84パーセント)に、少なくとも一つの主要な衝突が含まれていました。これは、ほとんどのプロジェクトにおいて、引用ファイルを読む人が、アーカイブの記録やダウンロードページを読む人と異なる情報を受け取ることになることを意味します。不一致は、著者のリストやソフトウェアのタイトルにおいて最も一般的でした。年やライセンスは通常一致していましたが、その著作物を特定するための核心的な詳細は一致しないことがよくありました。研究では、この問題は一つのタイプのソフトウェアに限られたものではないことが分かりました。それはハイパフォーマンス・コンピューティングのプロジェクト、Journal of Open Source Softwareによってレビューされたツール、そしてpyOpenSciコミュニティによって受理されたパッケージのすべてに見られました。
衝突の最も一般的な理由の一つは、ソフトウェアとそのソフトウェアについて記述した研究論文との間の特定の混同でした。多くの場合、ソフトウェアを記述するためのファイルが、実際にはそのソフトウェアに関する学術論文を記述していました。例えば、あるファイルは会議のプレゼンテーションのタイトルやジャーナル記事の著者をリストアップしている一方で、別のファイルはコード自体の名前をリストアップしているといった具合です。これは、検証された衝突の半分で発生していました。研究者たちは、これはファイルの書き方の間違いではなく、むしろ「引用されるべき対象」とは一体何であるかという、より深い混乱を反映していると指摘しています。それはコードなのか、それともコードに関する論文なのか?ファイルが論文を指そうとするとき、それらはしばしばソフトウェアを指すことをやめてしまい、メタデータが乖離してしまうのです。
もう一つの不一致の源は、PythonのPyPIやJavaScriptのnpmのような、ソフトウェアがダウンロードされる公開レジストリでした。これらのレジストリは、多くの場合、「mpi4py」のような短く技術的なパッケージ名を使用しますが、ソフトウェア自身のファイルは「MPI for Python」のような記述的なタイトルを使用します。コンピュータがこれら2つの表面を照合しようとするとき、タイトルの一致しないエラーを検出します。研究では、タイトルと著者の不一致の大部分が、これらのレジストリの記録によって引き起こされていることが分かりました。さらに、研究者たちは、自動化されたツールが情報を探す場所において、最新の情報が欠落していることが多いことも発見しました。パッケージング・ツールが読み取るファイル、例えばレジストリの記録などは、著者のORCIDのような、誰がその仕事を行ったかを追跡するために極めて重要な永続的識別子を含んでいる可能性が最も低いものでした。
研究では、「推奨される引用(preferred citation)」と呼ばれる特定の機能についても調査しました。これは、ソフトウェア・プロジェクトに対し、自分自身ではなく、通常は論文である別のオブジェクトを引用するようにユーザーに指示できる機能です。研究者たちは、この機能を使用している32プロジェクトのうち28プロジェクトにおいて、その指示に従うと、ソフトウェア自身のメタデータと矛盾する記録にたどり着くことを発見しました。これは、プロジェクトが特定の引用へとユーザーを導こうとしても、そのガイダンスが、プロジェクト自身が公開している他の情報と衝突する記録を指してしまうことを意味します。これにより、ルールに従ったユーザーが、実際に使用したソフトウェアのバージョンと一致しない論文を引用してしまうという状況が生じます。
研究者たちは、現在のソフトウェア引用のためのインフラストラクチャは不完全であると結論付けました。メタデータを宣言するためのツールは存在し、広く利用されていますが、異なる宣言同士が一致しているかどうかを確認するシステムは存在しません。この研究は、チェック可能なプロジェクトの大部分において、ソフトウェアが少なくとも一つの重要な情報において、自分自身と食い違っていることを示しました。この断片化により、クレジット(貢献の証明)は分散し、プロベナンス(由来)は不明確になり、自動化されたシステムは研究ソフトウェアの使用を確実に追跡することができません。研究者たちは、他の人々がこの監査を再現したり、時間の経過とともに改善されているかを確認したり、あるいはこれらの不一致を自動的に修正するツールを構築するためにデータを利用したりできるよう、データ、コード、およびプロジェクトのリストを公開しました。この研究は、ソフトウェアに対するデジタルのクレジット制度を完全に信頼できるようになる前に、まずソフトウェアがすべての場所において単一の、一貫した物語を語るようにしなければならないということを強調しています。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。