← 最新の論文
💬 NLP

Infini-News: Efficiently Queryable Access to 1.3 Billion Processed Common Crawl News Articles

本論文は、13 億件を超える Common Crawl 記事に対してメタデータ強化と言語検出を施し、研究者が任意のテキストパターンをサブ秒単位でアーカイブ全体から効率的に検索可能にする包括的なツールキットおよびインデックス「Infini-News」を導入する。

原著者: Ruggero Marino Lazzaroni, Jana Lasser, Kirill Solovev

公開日 2026-05-19
📖 1 分で読めます☕ さくっと読める

原著者: Ruggero Marino Lazzaroni, Jana Lasser, Kirill Solovev

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

過去10年間に世界の主要な出来事について、人々がどのように語ってきたかを研究したいと想像してみてください。そのためには、膨大な数のニュース記事のライブラリが必要です。

過去には、2つの望ましくない選択肢しかありませんでした:

  1. 有料壁:商業的なニュースアーカイブ(高級図書館のようなもの)を利用する。そこにはすべてが揃っていますが、費用は莫大で、本を友人と共有することも、建物から持ち出すことも許可されていません。
  2. 生データダンプ:インターネット全体を網羅する巨大で無料の倉庫「Common Crawl」を利用する。そこにはすべてが揃っていますが、テラバイト単位の生 HTML ファイルが混沌と積み重なった状態です。1 記事を見つけるためには、自前でブルドーザーを建造し、デジタルのゴミ山を掘り起こし、読み始めることさえできるまでにデータを数ヶ月かけてクリーニングする必要があります。

Infini-News は、この問題を解決するために著者らが構築したソリューションです。これは、世界最大の無料ニュースアーカイブのための、超高性能で事前クリーニング済み、かつ瞬時に検索可能なインデックスと考えることができます。

その仕組みを、簡単な要素に分解して説明します。

1. 大掃除(「前処理済みコーパス」)

著者らは、生で散らかった倉庫(180 テラバイトのデータ)を、高度なクリーニング機械に通しました。

  • 彼らが行ったこと:広告、"今すぐ購読" のポップアップ、ナビゲーションバー、壊れたコードを除去しました。
  • 結果:2016 年 8 月から現在までの、13 億 5000 万件のクリーンなニュース記事が手に入りました。これは、整理されていないスクラップ金属の山を、整然と配置された完成車の倉庫へと変えるようなものです。もはやメカニックである必要はありません。車を運転するだけで済みます。

2. スマートなラベル(メタデータ付与)

13 億 5000 万件の記事の山は、依然として圧倒的な量です。何を見ているのかを知る必要があります。著者らは、すべての記事に 3 層の「スマートなラベル」を追加しました。

  • 言語タグ:言語を推測するだけでなく、3 人の異なる「探偵」(AI 分類器)を使って言語をラベル付けしました。1 人の探偵が確信を持てない場合、他の探偵が再確認します。これにより、英語やスペイン語から希少な方言まで、1000 以上の言語を網羅しています。
  • 発信元:各記事がどの国から来たのかを特定しようとしました。ウェブサイトのアドレス(例:ドイツの .de)、フッターにある出版社の住所、既知のニュース発信元のリストなどの手がかりを利用しました。その結果、222 カ国にわたる記事の**83%**に対して発信元を正常にタグ付けすることに成功しました。
  • 重要性:これにより、研究者はすべての記事を手動で読むことなく、「ウクライナ戦争に関するニュースがドイツとブラジルでどのように報じられたか?」といった質問を投げかけることができます。

3. マジック検索エンジン(Infini-gram インデックス)

これが最も印象的なトリックです。通常、13 億 5000 万件の記事を検索するには数時間から数日かかります。

  • 比喩:10 億冊の本がある図書館から、特定の文句を見つけることを想像してください。通常の検索エンジンでは、すべての本を開き、すべてのページを読み、単語が一致するかを確認する必要があります。これは非常に遅いです。
  • Infini-News のトリック:彼らは接尾辞配列インデックスを構築しました。これは、図書館内のすべての単語とフレーズを網羅した、魔法のような超詳細な地図のようなものです。
  • 速度:この地図を使えば、フレーズ(「気候変動」のようなものや、特定の引用など、どんな奇妙なものでも)を入力するだけで、システムは1 秒未満でそのすべての出現箇所を見つけ出します。
  • ダウンロード不要:検索するために図書館全体をダウンロードする必要はありません。地図にクエリを送信し、「本の ID」のリストを取得し、必要な特定のニュース記事のみをダウンロードすればよいのです。これにより、研究者は巨大なハードドライブを必要としなくなります。

それを使って何ができるか

論文では、研究者がこのツールを具体的にどのように活用できるかがいくつか挙げられています。

  • タイムトラベル:10 年間にわたって物語がどのように変化したかを追跡できます(縦断分析)。
  • 噂を追う:特定のニュースや偽の引用が、ある新聞から別の新聞へどのように広まったかを追跡できます(コンテンツのシンドリケーション)。
  • グローバル比較:異なる国々が同じ出来事をどのように報じたかを比較できます。
  • AI セーフティ:新しい AI チャットボットが特定のニュース記事でトレーニングされたかどうかを、完全一致を検索することで確認できます。

注意点(限界)

著者らは、このツールができないことについても率直に述べています。

  • リアルタイムではない:ニュースはアーカイブからのため、わずかな遅延があります。この瞬間に発生している速報ニュースを監視することはできません。
  • 有料壁の欠落:含まれているのは無料のニュースのみです。新聞社が記事を「有料壁」の後ろに隠した場合、Infini-News にはそれが入っていません。
  • 「ロボット」の問題:2023 年頃、多くのニュースサイトが AI クローラーのアクセスを遮断し始めました。著者らは、その後、特定のサイトからの新しい記事の減少に気づきました。そのため、ごく最近のデータについては、完全性がわずかに欠けている可能性があります。
  • 完璧ではないラベル:国と言語のラベルは非常に優れていますが(約 89% の精度)、100% 完璧ではありません。絶対的な精度が必要な場合、研究者は二重チェックを行うことが期待されます。

結論

Infini-News は、「検索優先」のツールキットです。研究者に小都市ほどの大きさのライブラリをダウンロードさせるのではなく、必要な正確なページを瞬時に見つけ、それらだけをダウンロードできるを提供します。それは、混沌としてアクセス不可能なデータの山を、世界のコミュニケーションのあり方を研究するための、クリーンで検索可能かつ無料のリソースへと変えるのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →