Institutional Newspapers Pipeline: Deriving billions of high quality tokens from historical newspapers
本論文は、ボストン公共図書館との協力により開発された、セグメンテーション、OCR、および高度なテキスト解析の多段階ワークフローを通じて、140万件を超える歴史的な新聞スキャンを、163億個の高品質なトークンを含む構造化されたオープンデータセットへと処理する、モジュール式かつ計算効率の高いシステムである「Institutional Newspapers Pipeline」を紹介するものである。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
新聞は、地方選挙から小麦の価格、お悔やみから新しい発明の広告に至るまで、あらゆる出来事を捉える人類の生活の日常的な記録です。何世紀もの間、これらの物語は壊れやすい紙の上に保存されてきましたが、デジタル時代において、図書館は何百万ものページをスキャンしてこれらを利用可能なものにしてきました。しかし、新聞のページの画像を、有用で検索可能なテキストに変換することは驚くほど困難なことです。ページは密集しており、乱雑で、テキストの列、装飾的な見出し、そして互いに混じり合う広告などで満たされています。クリーンな文書にはうまく機能する標準的なコンピュータプログラムは、この混沌とした状況によって混乱し、エラーだらけのテキストを生成したり、セクション全体を見落としたりすることがよくあります。これは、歴史から学びたい研究者や人工知能システムにとって、ページに書かれていることを容易に読み取ることができないという障壁を生み出しています。
ハーバード・ロースクールとボストン公共図書館の研究チームは、この問題を解決するための新しい方法を開発しました。彼らは、単一の新聞ページを最小かつ最も論理的な断片へと分解し、各断片内のテキストを高精度で読み取り、さらにコンピュータがレイアウトと内容を理解できるようにすべてを整理する、ステップ・バイ・ステップのシステムを作成しました。彼らの目標は、単にテキストをデジタル化することではなく、100万枚を超える歴史的な新聞スキャンの真の内容を明らかにする、クリーンで構造化されたデータセットを作成することでした。個々のテキストブロックや画像をそれぞれ独立したアイテムとして扱うことで、彼らは以前は効果的に使用するにはあまりにも乱雑すぎた資料から、数十億語を抽出することに成功しました。
プロセスは、新聞ページのデジタル画像を取り込み、コンピュータに人間が読者として見る方法を教えることから始まります。ページ全体を一度に読もうとするのではなく、システムはまず、単一の記事、写真、あるいは広告といった、個別のコンテンツブロックをすべて特定します。研究者たちは、数千の例を見せることで、コンピュータモデルにこれらのブロック、すなわち「クロップ(切り抜き)」を認識するように学習させました。このモデルは、端にある空白の領域や列の間の複雑な境界線を無視し、実際のコンテンツだけに集中することを学習しました。テストにおいて、このセグメンテーション・ツールは非常に効果的であることが証明され、140万ページを超える新聞の中から8,300万個以上の個別のブロックを正常に特定しました。平均して、1ページあたり約56個のパーツに分解されることで、システムは過去の複雑なレイアウトを精密に扱うことができました。
ページがこれらの扱いやすい断片に分割されると、システムはその中のテキストを読み取ります。研究者たちは、最善の結果を確保するために、2つの異なる手法を並行して走らせました。第一の手法は、画像のテキストをデジタル文字に変換するために数十年にわたり使用されてきた伝統的なツールを使用しています。第二の手法は、より新しく高度なタイプの人工知能モデルを使用しており、これは画像の文脈をより良く理解できます。この新しいモデルは、古いツールを混乱させるような、損傷したり、色褪せたり、あるいは装飾的なフォントで書かれたテキストを読み取ることに特に優れていました。多くの場合、高度なモデルは、ページの破れた部分にある欠落した文字さえも推測し、空白を埋めて完全な文章を作り出すことができました。両方の手法の出力を組み合わせることで、チームは合計163億トークンに達する膨大なテキストのコレクションを生成しました。これは、数千冊の本を満たすのに十分な量です。
テキストが抽出されると、システムは次に、各コンテンツの断片が実際には何であるかを理解するために機能します。システムは、数百万のブロックをニュース記事、広告、写真、漫画といったカテゴリーに分類します。これを正確に行うために、システムはブロックの視覚的な外観と、そこに含まれる言葉の両方を確認します。例えば、写真のように見えるがテキストが含まれていないブロックは「画像」として識別され、見出しとストーリーを持つブロックは「ニュース」として識別されます。研究者たちは、広告がこれらのブロックの中で最大の数を占めているものの、実際のニュース記事が大部分の言葉を含んでいることを発見しました。この区別は極めて重要です。なぜなら、これにより研究者が新聞の視覚的な性質が時間の経過とともにどのように変化したかを研究できるようになり、年月が経つにつれて広告がより視覚的になり、ページ上でより多くのスペースを占めるようになったことを指摘できるからです。
また、システムは人間が自然に読む順序に従ってテキストを整理します。新聞には、ある列で始まり別の列へと続く記事や、写真によって中断されるストーリーが多く存在します。研究者たちは、どのブロックが次に続き、その次がどれになるのかという経路をマッピングする方法を開発しました。これは複雑な作業ですが、彼らのアプローチは、マクロレベルで72.1%、マイクロレベルで80.8%の精度で、かなりの部分の読み順を再構築することに成功し、テキストが論理的に最初から最後まで流れるようにしました。このステップにより、バラバラの画像断片が、検索や分析が可能な一貫した物語へと変貌します。
単にテキストを読み取り整理するだけでなく、システムはすべてのブロックに対して有用な情報の層を追加します。システムは使用されている言語を特定し、大部分は英語である一方で、当時の多様な移民コミュニオティを反映して、イディッシュ語、ドイツ語、スウェーデン語、フランス語の重要な部分が存在することを明らかにしました。また、システムはテキストをスキャンして人名、地名、組織を見つけ出し、ボストンやニューヨークといった場所の名前や、議会のような機関の言及を数百万件タグ付けします。さらに、システムは各ブロックにトピックを割り当て、一部をビジネスレポート、他を政治ニュース、あるいは科学的アップデートとしてラベル付けします。この豊かなタグ付けにより、研究者は「広告の中で『ボストン』という言葉はニュース記事と比較してどの程度頻繁に言及されたか?」や「1880年代にはどのようなトピックが最も一般的だったか?」といった具体的な質問を投げかけることができます。
この全工程は、巨大で高価なスーパーコンピュータを必要とするのではなく、標準的なコンピュータ・ハードウェアで実行できるほど効率的に設計されました。研究者たちは、システムがクラッシュしたり速度が低下したりすることなく膨大な量の資料を処理できるように、各ステップを最適化しながら、データをバッチ処理しました。レンタルしたコンピュータ・パワーを実行するための総コストは、約2万5,000ドルと見積もられており、これは最も先進的で高価なモデルを使用した場合のコストのわずか一部です。この効率性により、他の図書館や機関も、自らの歴史的コレクションを解禁するための同様のツールを利用できる可能性があります。
この取り組みの結果、1795年から1930年までの100万ページを超える新聞の、テキストだけでなく構造と文脈を含む膨大なオープンデータセットが得られました。研究者たちは、ツール、モデル、そして最終的なデータを公開しており、誰もが新しい方法でこの歴史を探求できるようにしています。システムは完璧ではなく、最も困難なケースには依然として人間の監視が必要ですが、これは歴史的な新聞をアクセシブルなものにするための大きな飛躍を意味しています。混沌としたノイズの多い画像を、クリーンで構造化されたデータに変えることで、チームは過去の人々の日常生活への窓を開き、将来の研究、そして人工知能が人類の歴史から学ぶための新たな基盤を提供したのです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。