← 最新の論文
🤖 AI

Counting Documents Is Not Counting Text: Unit Bias in Web-PDF Corpus Statistics

本論文は、ウェブ上のPDFコーパスの統計が、トークン単位ではなくドキュメント単位で指標を報告していることにより重大な「ユニット・バイアス」に陥っていることを明らかにしており、それによって、少数の大規模なドキュメントにテキストの大部分が含まれているという事実や、現在の切り捨てポリシーによってコーパスの全コンテンツの半分以上が失われているという事実が隠蔽されていることを示している。

原著者: Luca Foppiano

公開日 2026-08-18
📖 1 分で読めます☕ さくっと読める

原著者: Luca Foppiano

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

インターネットという広大で混沌とした図書館において、人工知能に考え方を教えるために不可欠な、新しい種類の本が登場しました。これらはマウスで閲覧するウェブページではなく、レポートや学術論文、公式な様式を共有するための標準形式であるPDFと呼ばれるデジタル文書です。長年、これらの知的なシステムを構築してきた研究者たちは、あらゆるデジタルファイルを単一の等しい単位として扱ってきました。もしデータセットに100万個のドキュメントが含まれていれば、たとえ一つのファイルが1ページのチラシであり、別のファイルが500ページの百科事典であったとしても、それらは100万個の等しい情報の断片を持っていると想定してきたのです。この仮定は、世界で最も高度なコンピュータモデルの訓練に使用されるデータのサイズや品質を測定する方法を形作ってきました。しかし、詳しく見てみると、ファイル数を数えることは言葉の数を数えるための不適切な方法であり、これら二つの単位の違いが、私たちがデータについて知っていたことのすべてを変えてしまうことが明らかになります。

Common Crawl FoundationのLuca Foppianoによる最近の研究は、研究者がこれらの膨大なテキストのコレクションを記述する標準的な方法に疑問を投げかけています。チームは、2021年のインターネットの特定の断片、すなわち約800万個のウェブPDFを含むデータセットを調査しました。このデータの元の作成者は、ドキュメントの数でそのサイズを報告していましたが、Foppianoとその同僚たちは、それらのファイルの中にある実際のテキスト量によって測定することに決めました。彼らは驚くべき不均衡を発見しました。ドキュメントは決して互換性のあるものではなかったのです。ごく一部のファイル、具体的には非常に長いファイルが、テキストの大部分を占めていました。実際、わずか3パーセント強のドキュメントが全テキストの半分を保持しており、残りの97パーセントがもう半分のテキストを分け合っていました。これは、ファイル数で見れば、そのコレクションは短いメモや様式のライブラリのように見えますが、単語数で見れば、巨大で長大な巻物に支配されたライブラリであることを意味しています。

この長さの偏りは、データがどのように処理され、その過程で何が失われるかに重大な影響を及ぼします。これらのファイルを提供したインターネットアーカイブには、ストレージ容量を節約するためのルールがあります。それは、一定のサイズを超えるファイルは切り捨てられるというものです。長い間、その制限は1メガバイトでした。研究によれば、このルールによってコレクション内のドキュメントの約4分の1が影響を受けており、これは管理可能な範囲のように聞こえます。しかし、切り捨てられたのは最も長いドキュメントであったため、それらの切り捨てられたファイルは全テキストのほぼ3分の2を含んでいました。研究者たちがこれらの中断されたファイルの欠落部分を再構築しようと試みたところ、その損傷はしばしば永続的であることが判明しました。壊れたファイルを読み取るための2つの異なる標準的なツールを使用して、彼らは、一方のツールは約11パーセントの失われた単語しか回収できず、もう一方はわずか1パーセント程度しか回収できないことを発見しました。これらの損傷したファイルの大部分において、ツールはテキストを全く抽出できず、コンピュータモデルに重大な知識の空白を残していました。

研究者たちはまた、ストレージ制限を引き上げた場合に何が起こるかについても調査しました。これは、2025年に制限が5メガバイトに引き上げられた際に起こった変化です。この調整によって切り捨てられるファイル数は減少しましたが、テキストが失われる問題は解決しませんでした。制限を引き上げたとしても、コレクション内の全単語の3割近くが依然として切り捨てられることになります。この研究は、単にサイズ制限を上げることが最も価値のあるコンテンツを救うには不十分であることを示しています。なぜなら、最大のドキュメントはあまりにも巨大であるため、5メガバイトの断片であっても、その始まりを捉えるには小さすぎる場合が多いからです。研究者たちは、これらのデータコレクションについて語る方法は誤解を招くものであると結論付けました。統計をドキュメント数のみで報告することは、少数の巨大なファイルがほとんどすべての情報を保持しているという現実を隠してしまいます。人工知能システムが何を学んでいるのかを真に理解するためには、単にファイルを数えるのではなく、言葉を数え、現在のインターネットの保存およびフィルタリングの方法が、私たちが必要とするテキストの大部分を捨て去っていることを認識しなければなりません。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →