MajinBook: An open catalogue of digitally mediated world literature
本論文は、シャドウライブラリのメタデータとグッドリードスのデータをリンクさせて 53 万 9,000 冊を超えるデジタル媒介の英語書籍から高精度かつ機械可読なコーパスを構築するオープンカタログ「MajinBook」を導入し、従来のコーパスの偏りを是正するとともに、EU および米国の法枠組みにおける研究目的の法的許容性について論じるものである。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
以下は、MajinBook論文の説明を、概念を明確にするための比喩を用いた日常言語に翻訳したものです。
全体像:より優れた図書館マップの構築
人々がどのように本を読み、どのような物語が世界にとって重要かを研究したいと想像してください。これを行うためには、膨大な本のマップが必要です。
長らく、研究者たちはHathiTrust(大学によって建設された巨大で公式な図書館のようなもの)を用いてきました。そこには数百万冊の本がありますが、2 つの大きな問題があります。
- 鍵がかかっている: 多くの本は著作権で保護されているため、全文を読むことはできません。安全で制限された窓を通してのみ閲覧できます。
- 散らかっている: 多くの本は物理的な紙から単にスキャンされたものです。コンピュータは文字を読み間違えることがよくあります(例:'o'を'0'と混同するなど)。これにより、高度なコンピュータ分析にテキストを使用することが困難になります。
この論文の著者たちは、より優れたマップを望みました。彼らは**「シャドウライブラリ」**(Library Genesis や Z-Library のようなもの)に目を向けました。これらは、数百万冊の本が自由に共有される巨大な地下のデジタルバザールのようなものです。これらは公式の図書館よりもはるかに多くの本を持っていますが、混沌としています。「棚」は整理されておらず、ラベルは誤っているか欠落していることが多く、どの本がどれであるかを特定するのが困難です。
MajinBookは、この混沌を整理したプロジェクトです。それは、散らかった「シャドウライブラリ」のファイルを、本好きのためのソーシャルネットワークであるGoodreadsの整理されたデータと結びつけることで、539,000 冊以上の英語の本(さらにフランス語、ドイツ語、スペイン語の数百万冊を含む)の高品質で整理されたカタログを作成しました。
材料:どのように構築されたか
1. 「デジタル専用」ルール(ふるい)
シャドウライブラリには、さまざまな形式の本があります。一部はPDF(紙のページのスキャン画像)であり、一部はEPUB(クリーンなウェブページのようなネイティブデジタルファイル)です。
著者たちは、すべての PDF を捨てることを決めました。
- 比喩: スープの味を研究しようとしていると想像してください。PDF は、スープの写真を撮ってその写真の味を試そうとするようなものです。それはぼやけていて一貫性がありません。EPUB は、ボウルに入った実際のスープのようなものです。すべての材料を明確に味わうことができます。
- 結果: 「クリーン」なデジタルファイル(EPUB)のみを保持することで、彼らは非常に古い本(まだデジタル化されていなかったため)を失いましたが、はるかにクリーンで、コンピュータが読みやすく、驚くほど多様な言語を含むデータセットを獲得しました。
2. 「作品対版」の問題
本の世界には、作品(『オデュッセイア』のような物語そのもの)と版(1990 年の翻訳や 2020 年のオーディオブックのような特定のバージョン)の違いがあります。
- 問題: シャドウライブラリには『オデュッセイア』の 50 種類の異なるファイルがあるかもしれません。それらをすべて 50 冊の異なる本としてカウントすると、データが歪んでしまいます。
- 解決策: 著者たちは、Goodreadsを「骨格」または「ファイルシステム」として使用しました。Goodreads はすでに、すべての 50 種類のバージョンが同じ「作品」に属していることを知っています。彼らはこの知識を利用して、散らかったシャドウライブラリのファイルをグループ化し、それらを正しい物語と元の出版日に関連付けました。
3. マッチングゲーム(干し草の山の中の針を見つける)
散らかったシャドウライブラリのファイルを、Goodreads の正しいエントリにどのように結びつけるのでしょうか?
- 戦略: 彼らは、頻繁に変化する表紙アートやページ数ではなく、識別子(ISBN 番号など)とタイトルに注目して一致させようとしました。
- ファジーロジック: 時には、シャドウライブラリでタイトルがわずかに誤記されていることがあります(例:「Harry Pottter」)。著者たちは、「ファジーマッチング」と呼ばれるコンピュータのトリックを使用して、「あれはおそらく『Harry Potter』だ」と判断しました。
- 安全性チェック: 彼らは、人間に 200 件のランダムな一致をチェックさせることでこの方法をテストしました。コンピュータが「信頼度スコア」80 以上を与えた場合、それはほぼ常に正しいことがわかりました。彼らはカタログの精度を高く保つため、最終的なルールをその 80 ポイントの閾値に設定しました。
結果:彼らは何を見つけましたか?
- 巨大でクリーンなコレクション: 彼らは、コンピュータが分析する準備ができている539,000 冊の英語の本のリストを作成しました。
- 時間的バイアス(しかし有用なもの): 彼らは「ネイティブデジタル」ファイルのみを保持したため、1800 年代の本は少なく、2000 年代の本が多いコレクションになりました。
- 論文の見解: 著者たちは、これがすべての文学の完璧な歴史ではないと認めています。代わりに、これは21 世紀のデジタル文化の完璧な歴史です。これは、デジタル時代において現在どのような本が人気があるかを示しています。
- より多くの言語: 驚くべきことに、デジタルファイルをフィルタリングすることで、彼らは実際により多様な言語の混合を得ました。「PDF」の山は主に英語でしたが、「EPUB」の山には、フランス語、ドイツ語、スペイン語、その他多くの言語が豊富に含まれていました。
法的な「細かい注記」
この論文は、厄介な問いに答えています:シャドウライブラリを研究に使用することは合法ですか?
- 主張: 著者たちは、本を販売したり物語を配布したりしているわけではありません。彼らが公開しているのは事実のリスト(タイトル、著者、日付)だけです。
- 比喩: これは、図書館司書がカードカタログを作成するようなものです。カードカタログには物語は含まれていません。物語がどこにあり、誰が書いたかだけを伝えます。著者たちは、研究目的でこの「カードカタログ」を作成することは、米国と EU の両方で「テキストおよびデータマイニング」の法的例外に該当すると主張しています。
まとめ
MajinBookは、「シャドウライブラリ」の混沌とした、巨大でしばしば散らかった世界を、Goodreadsの社会的知恵を用いて整理するツールです。その結果、著作権の複雑な法的景観を navigate しながら、研究者がデジタル時代における文化、文学、読書習慣を研究することを助ける、超クリーンでコンピュータに優しい本のリストが生まれました。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。