← 最新の論文
💻 computer science

Institutional Books - Visual Elements: An open-source pipeline for extracting, classifying, deduplicating, and captioning visual elements from digital book collections

本論文は、デジタル化された図書館コレクションにおける新たな研究およびAIトレーニングの機会を切り拓くために、非テキストコンテンツの検出、分類、重複排除、およびキャプション生成を自動化するように設計された、約100万冊の歴史的な書籍から抽出された2,260万個の視覚的要素からなる新しいデータセットとオープンソースのパイプラインを導入するものである。

原著者: Jimmy Mendez, Matteo Cargnelutti, David Lowry-Duda, Catherine Brobston, Salwa Ismail, Greg Leppert, Amanda Watson, Jonathan Zittrain

公開日 2026-08-20
📖 1 分で読めます☕ さくっと読める

原著者: Jimmy Mendez, Matteo Cargnelutti, David Lowry-Duda, Catherine Brobston, Salwa Ismail, Greg Leppert, Amanda Watson, Jonathan Zittrain

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

図書館は人類の歴史の膨大な貯蔵庫であるが、数十年にわたり、その蔵書をデジタル化したバージョンは物語の半分しか語ってこなかった。機関が古い書籍をスキャンして検索可能にする際、伝統的に彼らはテキストに焦点を当て、ソフトウェアを使用して言葉を読み取り、データへと変換してきた。光学文字認識として知られるこのプロセスは、研究者が数百万ページを数秒で検索することを可能にし、一つの勝利を収めた。しかし、それらの書籍に含まれる画像——挿絵、写真、彫版、装飾的な境界線などは、主に機械にとって不可視のまま残されてきた。これらの視覚的要素は、テキストだけでは捉えきれない独自の文脈やニュ Nuance(ニュアンス)を保持しているが、コンピュータが容易に理解できる形で構造化されていなかったため、大規模な研究を行うことが困難であった。人工知能システムが世界を「見て」解釈する能力を高めるにつれ、重大なギャップが生じている。すなわち、これらのシステムは主にインターネット上の現代的な画像を用いて訓練されており、歴史的な視覚文化を理解することにしばしば苦慮しているということである。このギャップを埋めるために、研究者たちは、整理され、機械が学習できる準備が整った、大規模で多様な歴史的画像のコレクションを必要としている。

ハーバード大学の研究チームは、約100万冊のデジタル化された書籍に含まれる視覚的要素を見つけ、分類し、記述するために設計された、新しいオープンソースのシステムを構築することで、この課題に取り組んだ。テクニカルレポートに詳述されている彼らの研究は、本をスキャンし、あらゆる絵を見つけ出し、それが何であるかを判断し、人間による介入なしに短い説明を書き込むことができる、非常に熟練した司書のような役割を果たすパイプラインを作り上げている。その結果、983,004巻から抽出された2,200万個以上の視覚的要素を含むデータセットが作成された。このコレクションには、科学的な図解や楽譜から、肖像画や装飾芸術に至るまで、あらゆるものが含まれており、それぞれにその種類に関する情報と、多くの場合、コンピュータによって生成されたキャプションが付与されている。このデータを公開することで、チームは人工知能モデルが歴史的な資料をより良く理解することを助け、「より良いツールがより多くのデータをもたらし、それがさらなる優れたツールへとつながる」という、私たちの共有された過去を探求するための循環を生み出すことを目指している。

プロセスは、最も基本的なタスクである「画像を見つけること」から始まる。研究者たちは、書籍のデジタルページをスキャンして、画像を含む領域を特定するシステムを開発した。コレクションがあまりに膨大であり、数億ページに及ぶため、システムは極めて効率的である必要があった。彼らは、画像のあるページとないページの数千の例を示すことで、視覚的要素を認識するように特化したコンピュータモデルを訓練した。このモデルは、テキストを無視して視覚的な部分に集中することを学び、見つけたすべての挿絵、写真、または図の周囲にボックスを描くように学習した。最終的な実行において、システムはコレクション全体を処理し、2,800万個以上の潜在的な画像を特定した。高い品質を確保するため、研究者たちは汚れやスキャンのエラーといった誤検知を除去するために厳格なフィルターを適用し、最終的に2,260万個の明確な視覚的要素を残した。

画像が見つかった後の次のステップは、それらが何であるかを理解することであった。システムは、2,260万個の画像を、一般的な挿絵および写真、楽譜、ブックプレートのような装飾的要素、そしてチャートやグラフ、そして指やクリップなどのスキャン時のアーティファクト(不純物)という5つの主要なカテゴリに分類した。研究者たちは、音楽の譜面とテキストのページの区別や、装飾的な境界線と他の種類の挿絵の区別ができるように、別のモデルを訓練した。システムは非常に高い精度を示し、大部分の画像を正確に識別できた。例えば、音楽の譜面についてはほぼ完璧な確信度で識別できたが、装飾的な境界線などの一部のカテゴリについては、他の種類の挿絵と区別することがやや難しいことが判明した。この分類プロセスは極めて重要である。なぜなら、これにより研究者が「18世紀のチャートをすべて示して」や「特定のブックプレートの全事例を見つけて」といった具体的な質問を投げかけることが可能になるからである。

分類の後、チームは重複の問題に取り組んだ。大規模なデジタル化プロジェクトでは、同じ画像が何度も登場することがよくある。それは、その画像が複数の版の書籍で使用されている場合や、スキャニングプロセスによって同じページが誤って二度取り込まれた場合である。これを整理するために、研究者たちは一致する画像を見つけるための2つの異なる手法を用いた。第一の手法は、画像のピクセルパターンを比較して正確なコピーを見つけるものであり、第二の手法は、スキャニングによる差異によって見た目がわずかに異なる可能性のある「似た画像(ニア・デュプリケート)」を見つけるために、画像のより深い意味を探るものであった。これらのアプローチを組み合わせることで、彼らは数百万の重複画像を特定し、グループ化し、最終的なデータセットが単なる画像の出現リストではなく、ユニークな視覚的コンテンツを表すようにした。このステップにより、アイテムの総数は約20パーセント削減され、よりクリーンで価値のあるコレクションとなった。

プロジェクトの最後にして最も実験的な部分は、システムに画像の記述を書かせることに取り組んだ。大規模言語モデルを使用し、研究者たちはコンピュータに対し、各画像が何を示しているかを説明する短いキャプションを生成するよう指示した。コンピュータが文脈を理解できるように、彼らは画像自体とともに、その周囲のページのテキストを読み込ませた。システムは、正確であり、推測を避けて、明確に見えるものだけを記述するように指示された。研究者たちは、これらのキャプションは実験的なものであり、注意して扱うべきであると指摘しているが、システムは約1,800万個の記述を生成することに成功した。可能な限り書籍の元の言語で書かれたこれらのキャプションは、視覚的コンテンツを検索するための新しい方法を提供し、ユーザーがファイル名やカテゴリだけでなく、その内容に基づいて画像を見つけることを可能にする。

研究者たちはまた、この大規模な取り組みの実用的な側面にも細心の注意を払い、プロセスが効率的であり、他の機関によって再現可能であることを確認した。彼らは、最大のボトルネックはコンピュータの思考能力ではなく、画像のロードと処理の準備にかかる時間であることを発見した。ワークフローを最適化することで、標準的なコンピューティングリソースを使用して、数週間でコレクション全体を処理することに成功した。チームは、訓練したモデル、および結果としてのデータセットを含むパイプライン全体をオープンソースのツールとして公開し、他の図書館や研究者がこの作業を利用し、改善することを呼びかけた。また、データに関する制限についても明確な警告を含めており、一部の画像には、それらが作成された時代を反映した歴史的な偏見や有害な表現が含まれている可能性があること、およびコンピュータ生成のキャプションは完璧ではないことを記している。

このプロジェクトは、人類の文化の視覚的な歴史を、人間と機械の両方にアクセス可能にするための重要な一歩である。膨大な非構造化コレクションである書籍の画像を、検索可能で分類され、記述されたデータセットへと変えることで、研究者たちは過去を研究するための新しい基盤を提供した。このデータセットには2,200万個以上の視覚的要素が含まれており、人工知能が歴史的文脈を理解するための訓練や、デジタル・ヒューマニティーズ研究の新しい形態を可能にするための豊かなリソースとなっている。この成果は、入念な計画と適切なツールがあれば、何百万もの古い書籍の中に隠された視覚的な宝物を日の目に見せることができ、それらが語る物語に対して新たな洞察を提供できることを証明している。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →