A Dead Link Is Not Lost Code: Separating Repository Reachability from Deposit Availability in Zenodo Software Citations
本研究は、3,837件のZenodoソフトウェア引用を分析することで、ソースコードのリポジトリがアクセス不能になった場合でも、アーカイブされたファイルの大部分はアクセス可能な状態に維持されている一方で、壊れた引用の大部分は消失したソフトウェアではなくデッドリポジトリポインタに起因していることを示し、リポジトリの可用性とデポジットの完全性との間の決定的な違いを浮き彫りにしている。
原論文は CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
現代の科学の世界において、ソフトウェアはもはや単なる道具ではなく、学術論文と同等のクレジットを受けるに値する、それ自体が一つの研究成果となっています。このクレジットを公平かつ永続的なものにするため、科学者たちは現在、コードに特別なデジタルタグを付与しています。これは、ソフトウェアの特定のバージョンを、時間を止めた状態で指し示す、一意の識別子であり、住所のような役割を果たすものです。このタグは、著者が使用したのと全く同じコードを、数年後に論文を読んでいる人が見つけられるように設計されています。このシステムは、ある約束に基づいています。それは、この住所が常にソフトウェアへと導くという約束です。しかし、この約束が成立するためには、二つのことが起こらなければなりません。第一に、住所自体が機能し、ソフトウェアが格納されているページへと導くこと。第二に、ソフトウェア自体がまだそこにあり、ダウンロードできる状態で待機していることです。もし住所が「ファイルが見つかりません」と表示されるページに繋がっていたり、あるいはページは読み込めるもののコードが消えていたりすれば、科学的記録には空白が生じてしまいます。
研究者は以前から、科学におけるウェブリンクが切れること、いわゆる「リンク切れ(リンク・ロット)」の問題を知っていました。しかし、ソフトウェアの引用は、二層構造で構築されているため、性質が異なります。永続的なタグはデジタルアーカイブを指し、そのアーカイブがさらに、GitHubのようなプラットフォーム上でホストされている元のコードのリポジトリを指しています。アーカイブは物事を安全に保つことに専念する組織によって管理されていますが、元のコードは、所有者がいつでもプロジェクトの名前変更、非公開化、または削除ができるプラットフォーム上に存在しています。これにより、たとえ元のプロジェクトが消失したとしても、永続的なタグは完璧に機能し続ける可能性があるという、独特な状況が生まれます。ある研究者が、これが具体的にどの程度の頻度で起こるのか、そしてより重要なことに、元の経路が遮断された場合にソフトウェア自体が依然として回収可能なのかどうかを測定することに着手しました。
この研究は、科学者がコードを保存するために広く利用している「Zenodo」と呼ばれる主要なデジタルアーカイブにある、数千件のソフトウェア記録に焦点を当てました。研究者は単に元のプロジェクトのページがまだオンラインであるかどうかを確認しただけではありません。彼らは、引用の連鎖における3つの異なるレベルをチェックしました。まず、元のプロジェクトのリポジトリがまだ存在するかどうかを確認しました。次に、引用の中で科学者が実際に言及している特定のコードのバージョンが、依然としてアクセス可能であるかどうかを確認しました。最後に、元の経路が切れていたケースにおいて、デジタルアーカイブに実際のファイルが保持されているかどうかを確認しました。このアプローチにより、リンクの失敗と、ソフトウェア自体の喪失を区別することができました。
結果は、時間の経過に伴う明らかな衰退のパターンを明らかにしました。ソフトウェアの記録が古くなるにつれ、リンクが切れる可能性が高まりました。元のプロジェクトのリポジトリに到達できなくなっているケースは約4.7パーセントでした。しかし、科学者が実際に引用しているコードの特定のバージョンを確認すると、問題はさらに深刻でした。このより厳格なチェックにおいて、失敗率は5.45パーセントに上昇しました。この差は重要です。なぜなら、切れた引用の約6件に1件において、元のプロジェクトは存命しているものの、研究者が引用した特定のバージョンが削除または移動されていることを意味するからです。これは極めて重要な区別です。プロジェクトのメインページのみを確認する単純なチェックでは、この失敗を見逃してしまい、ソフトウェアが利用可能であるかのように誤認させてしまうからです。
これらのリンク切れにもかかわらず、デジタルアーカイブは驚くほど効果的なセーフティネットであることが証明されました。研究者が切れたリンクを辿ってアーカイブを確認したところ、94.4パーセントのケースで、アーカイブは依然として元のファイルを配信していました。これは、元のプロジェクトへの経路が失われたとしても、ソフトウェア自体は通常そこにあり、アーカイブ内で保護されていることを意味します。アーカイブは、設計された通りの役割を果たしています。つまり、元の家がなくなったとしても、コードを安全に守り続けているのです。アーカイブの記録は存在するもののファイルが欠落していたケースは、全引用の1パーセント未満という、ごくわずかな割合でした。
また、この研究は、一見すると機能しているように見えるが、実は微妙で重要なリスクについても浮き彫りにしました。機能しているように見える引用の約6.4パーセントは、実際には「便宜上のリダイレクト」に依存していました。これは、プロジェクトの名前が変更された際に、ホスティングプラットフォームが古い名前を新しい名前へと自動的に転送する場合に起こります。これは現在は機能していますが、永続的な保証ではありません。将来、誰かが古い名前を名乗った場合、リンクは静かに切れ、あるいは無関係なコードへと繋がる可能性があります。このことは、アーカイブがソフトウェアを保持していても、その指し示し方にはより注意が必要であることを示唆しています。研究者は、科学者は元のプロジェクトのリンクではなく、永続的なアーカイブの識別子を引用すべきであること、そして引用をチェックするツールは、参照がデッドであると判定する前に、まずアーカイブを確認すべきであると結論付けました。研究ソフトウェアを保護するためのインフラは機能していますが、残されたコードを見つけ出すためには、表面的なリンクよりも深く掘り下げて見る必要があるのです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。