✨ 要約🔬 技術概要
過去10年間に世界の主要な出来事について、人々がどのように語ってきたかを研究したいと想像してみてください。そのためには、膨大な数のニュース記事のライブラリが必要です。
過去には、2つの望ましくない選択肢しかありませんでした:
有料壁 :商業的なニュースアーカイブ(高級図書館のようなもの)を利用する。そこにはすべてが揃っていますが、費用は莫大で、本を友人と共有することも、建物から持ち出すことも許可されていません。
生データダンプ :インターネット全体を網羅する巨大で無料の倉庫「Common Crawl」を利用する。そこにはすべてが揃っていますが、テラバイト単位の生 HTML ファイルが混沌と積み重なった状態です。1 記事を見つけるためには、自前でブルドーザーを建造し、デジタルのゴミ山を掘り起こし、読み始めることさえできるまでにデータを数ヶ月かけてクリーニングする必要があります。
Infini-News は、この問題を解決するために著者らが構築したソリューションです。これは、世界最大の無料ニュースアーカイブのための、超高性能で事前クリーニング済み、かつ瞬時に検索可能なインデックス と考えることができます。
その仕組みを、簡単な要素に分解して説明します。
1. 大掃除(「前処理済みコーパス」)
著者らは、生で散らかった倉庫(180 テラバイトのデータ)を、高度なクリーニング機械に通しました。
彼らが行ったこと :広告、"今すぐ購読" のポップアップ、ナビゲーションバー、壊れたコードを除去しました。
結果 :2016 年 8 月から現在までの、13 億 5000 万件のクリーンなニュース記事 が手に入りました。これは、整理されていないスクラップ金属の山を、整然と配置された完成車の倉庫へと変えるようなものです。もはやメカニックである必要はありません。車を運転するだけで済みます。
2. スマートなラベル(メタデータ付与)
13 億 5000 万件の記事の山は、依然として圧倒的な量です。何を見ているのかを知る必要があります。著者らは、すべての記事に 3 層の「スマートなラベル」を追加しました。
言語タグ :言語を推測するだけでなく、3 人の異なる「探偵」(AI 分類器)を使って言語をラベル付けしました。1 人の探偵が確信を持てない場合、他の探偵が再確認します。これにより、英語やスペイン語から希少な方言まで、1000 以上の言語を網羅しています。
発信元 :各記事がどの国から来たのかを特定しようとしました。ウェブサイトのアドレス(例:ドイツの .de)、フッターにある出版社の住所、既知のニュース発信元のリストなどの手がかりを利用しました。その結果、222 カ国にわたる記事の**83%**に対して発信元を正常にタグ付けすることに成功しました。
重要性 :これにより、研究者はすべての記事を手動で読むことなく、「ウクライナ戦争に関するニュースがドイツとブラジルでどのように報じられたか?」といった質問を投げかけることができます。
3. マジック検索エンジン(Infini-gram インデックス)
これが最も印象的なトリックです。通常、13 億 5000 万件の記事を検索するには数時間から数日かかります。
比喩 :10 億冊の本がある図書館から、特定の文句を見つけることを想像してください。通常の検索エンジンでは、すべての本を開き、すべてのページを読み、単語が一致するかを確認する必要があります。これは非常に遅いです。
Infini-News のトリック :彼らは接尾辞配列インデックス を構築しました。これは、図書館内のすべての単語とフレーズを網羅した、魔法のような超詳細な地図のようなものです。
速度 :この地図を使えば、フレーズ(「気候変動」のようなものや、特定の引用など、どんな奇妙なものでも)を入力するだけで、システムは1 秒未満 でそのすべての出現箇所を見つけ出します。
ダウンロード不要 :検索するために図書館全体をダウンロードする必要はありません。地図にクエリを送信し、「本の ID」のリストを取得し、必要な特定のニュース記事のみ をダウンロードすればよいのです。これにより、研究者は巨大なハードドライブを必要としなくなります。
それを使って何ができるか
論文では、研究者がこのツールを具体的にどのように活用できるかがいくつか挙げられています。
タイムトラベル :10 年間にわたって物語がどのように変化したかを追跡できます(縦断分析)。
噂を追う :特定のニュースや偽の引用が、ある新聞から別の新聞へどのように広まったかを追跡できます(コンテンツのシンドリケーション)。
グローバル比較 :異なる国々が同じ出来事をどのように報じたかを比較できます。
AI セーフティ :新しい AI チャットボットが特定のニュース記事でトレーニングされたかどうかを、完全一致を検索することで確認できます。
注意点(限界)
著者らは、このツールができない ことについても率直に述べています。
リアルタイムではない :ニュースはアーカイブからのため、わずかな遅延があります。この瞬間に発生している速報ニュースを監視することはできません。
有料壁の欠落 :含まれているのは無料のニュースのみです。新聞社が記事を「有料壁」の後ろに隠した場合、Infini-News にはそれが入っていません。
「ロボット」の問題 :2023 年頃、多くのニュースサイトが AI クローラーのアクセスを遮断し始めました。著者らは、その後、特定のサイトからの新しい記事の減少に気づきました。そのため、ごく最近のデータについては、完全性がわずかに欠けている可能性があります。
完璧ではないラベル :国と言語のラベルは非常に優れていますが(約 89% の精度)、100% 完璧ではありません。絶対的な精度が必要な場合、研究者は二重チェックを行うことが期待されます。
結論
Infini-News は、「検索優先」のツールキットです。研究者に小都市ほどの大きさのライブラリをダウンロードさせるのではなく、必要な正確なページを瞬時に見つけ、それらだけをダウンロードできる鍵 を提供します。それは、混沌としてアクセス不可能なデータの山を、世界のコミュニケーションのあり方を研究するための、クリーンで検索可能かつ無料のリソースへと変えるのです。
技術概要:Infini-News
問題提起
大規模なニュースコーパスは、計算社会科学(CSS)および自然言語処理(NLP)にとって不可欠な資源であり、特に国境を越えた制度的情報フロー、アジェンダ設定、フレーム効果の分析において重要である。しかし、そのようなデータへのアクセスは、重大な財政的および技術的障壁によって制約されたままとなっている。商業アーカイブ(Factiva、LexisNexis など)は、再現性やデータ再配布を制限する禁止的なコストと制限的なライセンス条項を課している。一方、Common Crawl News(CC-News)アーカイブのようなオープンな代替手段は無料であるが、別の課題を呈している:生データは数百テラバイトの HTML ファイルで構成されており、これを解析し、クリーニングし、構造化するには、莫大なエンジニアリング努力と計算リソースが必要となる。このため、専門的なインフラを欠く研究者にとって、大規模かつ縦断的かつ国境を越えたメディア研究はアクセス不可能なままとなっている。
手法
著者らは、完全なデータセットのローカル保存を必要とせずに、CC-News アーカイブ全体(2016 年 8 月から最新のスナップショットまで)を効率的に検索可能にする、検索優先型のツールキットおよびインデックス「INFINI-NEWS」を導入する。システムアーキテクチャは、以下の 3 つの主要コンポーネントで構成される。
1. データ取得と前処理
著者らは、CC-News アーカイブから 180 TB の生 WARC ファイルを処理した。
抽出: fastwarc を用いてアーカイブをストリーミングし、trafilatura でコンテンツを抽出することで、パイプラインは HTML のボイラープレート(ナビゲーション、広告)を除去し、クリーンな記事本文、タイトル、著者、公開日を分離する。trafilatura は、優れた性能(F1 0.91)と非ラテン文字の堅牢な処理能力が選定理由である。
保存: 抽出されたレコードは JSONL ファイルにシリアライズされ、生 WARC ファイルと比較してストレージ要件が約 2 桁減少する。
保存(維持): パイプラインは、コンテンツのシンジケーションや「ジャーナリズムの流用(churnalism)」を研究するための自然な頻度分布を維持するため、意図的に重複コンテンツを保持する。言語モデルのトレーニングデータを歪める可能性があるデュープリケーション除去の落とし穴を避けるためである。
2. メタデータ付与
フィルタリングおよび比較研究を支援するため、2 つのアノテーションパイプラインが適用された。
言語識別: 単一分類器アプローチの限界に対処するため、著者らは 3 つの最先端分類器を採用する。
GlotLID v3: 2,102 の言語・スクリプトラベルを網羅する fastFast ベースの分類器で、50 文字以上の記事に適用される。
lingua: 短い入力(1,000 文字未満)に最適化された n-gram 統計検出器で、75 言語をカバーする。
CommonLingua: 334 言語でトレーニングされた 235 万パラメータのバイトレベル CNN+ アテンションモデルで、すべての空でない記事に適用される。
これらのラベルは、単一の「最良」ラベルに統合されるのではなく、別々の列として提供され、研究者が特定のワークロードに適した動作点(カバレッジ対精度)を選択できるようにする。
地理的帰属: 5 つのソースの連鎖により、ドメインに原産国を割り当てる。(i) 国コードトップレベルドメイン(ccTLD)、(ii) ニュース組織の Wikidata キャッシュ、(iii) 4 つのキュレーションされた outlet リスト、(iv) 構造的 HTML 証拠(JSON-LD、フッター)、(v) コーパス言語ルール。これにより、222 カ国にわたる記事の 83.4% について国が解決された。
3. 検索可能インデックス(Infini-gram)
核心的な革新は、接尾辞配列構造(特に FM インデックス変種を使用する infini-gram-mini エンジン)に基づいた Infini-gram インデックス の構築にある。
メカニズム: 標準的な転置インデックスとは異なり、これらの構造は圧縮形式でコーパスの接尾辞を格納し、二分探索を介して任意のテキストパターンに対する完全な部分文字列検索を O ( m log n ) O(m \log n) O ( m log n ) の時間でサポートする。
機能: このエンジンはバイト上で直接動作し、トークン化、語幹抽出、または事前計算された n-gram を必要とせずに任意の部分文字列をサポートする。これにより、言語やスクリプトの境界を越えた検索が可能となる。
パフォーマンス: 検索はサブ秒で結果を返す(13.57 億記事の完全コーパスにおける中央値の遅延は 6.48 ミリ秒)。メモリマップド読み込みを使用することで、特定の検索のためにテラバイト単位のデータをダウンロードする必要がなくなる。
主要な貢献
処理済みコーパス: カスタム解析インフラを必要とせず、13.5 億件以上の記事を含む、メタデータが豊富に付与された CC-News アーカイブ全体のクリーニング済みバージョン。
多ソース付与: コーパスには、3 つの異なる分類器からの言語タグと、記事の 83.4% に対する地理的帰属が含まれており、商業アグリゲーターで通常利用可能な 30〜40 言語を超えてカバレッジを大幅に拡大している。
効率的な検索インフラ: 年間およびアーカイブ全体の Infini-gram インデックスの構築により、研究者は任意のテキストパターンをサブ秒で完全アーカイブから検索し、オンデマンドでデータセットを構築できる。
FAIR 準拠: 発行は FAIR 原則に準拠しており、永続的な DOI、バージョン管理、ドキュメントを提供する。責任ある使用を確保するため、アクセスは機関所属と研究目的によってのみ制限される。
結果と統計
規模: コーパスには、約 10 年間(2016 年 8 月〜2026 年 4 月)にわたる 1,357,027,742 記事 が含まれており、月平均 1,160 万記事である。
多様性: データセットは 133,565 の一意のホスト名 (103,052 ドメイン)と 1,172 の一意の ISO 639-3 言語コード (GlotLID 経由)をカバーしており、そのうち 166 言語は少なくとも 10,000 記事を含んでいる。
地理的カバレッジ: 帰属は、222 カ国にわたる 59,885 ドメイン (58.1%)および 11.32 億記事 (83.4%)について正常に解決された。ボリューム上位の国には、米国(22.2%)、ドイツ(5.5%)、イタリア(4.5%)が含まれる。
パフォーマンスベンチマーク:
検索遅延: 完全コーパス(117 シャード)に対する部分文字列検索は、メモリマップド I/O を使用して、中央値(p50)で 6.48 ミリ秒 、p99 で 7.73 ミリ秒 の遅延を達成する。
比較: これらの検索は、DuckDB を介して基盤となる Parquet ファイルに対して同等の SQL LIKE 検索を実行するよりも 2 桁高速である(同処理は月あたり 800〜1,050 ミリ秒を要した)。
カバレッジ検証: コーパスのボリュームは、高リソース言語において商業アグリゲーターである Factiva と同等かそれ以上である(例:英語記事 5.07 億件対 Factiva の 3.88 億件)一方、商業提供物に欠ける数百の低リソース言語もカバーしている。
意義と主張
本論文は、INFINI-NEWS が、完全なアーカイブのローカル保存を必要とせずに、効率的な検索とターゲットニュースデータセットのオンデマンド構築を可能にする、最初の FAIR 準拠ツールキットであると主張している。「検索優先」の設計を採用することで、このシステムは縦断的かつ国境を越えたメディア研究の障壁を下げ、研究者が以下を行うことを可能にする。
基盤となるファイルをダウンロードすることなくコーパスを検索する。
特定のキーワード、時間範囲、ドメイン、または言語に基づいてオンデマンドでデータセットを構築する。
ドメイン全体での文字列の逐語的な出現を追跡することで、コンテンツフロー、シンジケーション、調整された情報操作を分析する。
データ不足またはコストのために以前はアクセス不可能だったメディアシステムや言語間での比較研究を行う。
著者らは、単一国または単一言語の研究に内在するサンプリングバイアスを克服する広範で多言語かつ地理的に多様なデータを提供することで、メディア研究の外部妥当性と一般化性を確保するための重要な一歩として、このリソースを位置づけている。このツールキットは、誤情報やフレーム効果の研究から、大規模言語モデルのトレーニングデータの汚染監査、および検索拡張生成(RAG)システムの構築まで、多様な研究アプリケーションをサポートするように設計されている。
毎週最高の NLP 論文をお届け。
スタンフォード、ケンブリッジ、フランス科学アカデミーの研究者に信頼されています。
受信トレイを確認して登録を完了してください。
問題が発生しました。もう一度お試しください。
スパムなし、いつでも解除可能。
週刊ダイジェスト — 最新の研究をわかりやすく。 登録 ×