MonkeyOCRv2: A Visual-Text Foundation Model for Document AI
MonkeyOCRv2は、画像からテキストへの生成とピクセルレベルの再構成という二重の戦略を用いて1億1300万枚の膨大なドキュメント画像コーパスで事前学習された視覚・テキスト基盤モデルであり、ドキュメント解析タスクにおいて既存のエンコーダーを大幅に上回り、マルチモーダル大規模言語モデルに統合された際に極めて効率的かつ最先端のドキュメント解析および理解を可能にします。
原論文は CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/) のもとパブリックドメインに提供されています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
技術要約: MonkeyOCRv2
問題提起
主流の視覚的基盤モデル(CLIP、DINO、SAMなど)は、主に自然画像を用いて事前学習されており、高レベルの物体セマンティクス、グローバルな整列、およびシーンのコンテキストに焦点を当てています。これらのモデルを文書画像に適用する場合、**表現のミスマッチ(representation mismatch)**が生じます。文書画像は、高密度のテキスト、微細な文字のストローク、複雑なレイアウト、そして局所的な視覚的詳細(例:句読点、上付き文字、ストロークのバリエーション)に依存するセマンティクスを特徴としています。既存のモデルは、セマンティックな抽象化を優先するあまり、これらの微細な詳細を破棄してしまうことが多く、その結果、文書の解析、理解、および関連タスクには適していません。さらに、既存の文書指向の事前学習データセットは、規模、言語の多様性、およびアノテーションの粒度において限定的であり、中国語や英語のみをカバーしていたり、高密度な教師あり学習が欠けていたりすることが多々あります。
手法
1. データエンジン: MonkeyDoc v2
データの不足と分布のギャップに対処するため、著者らはMonkeyDoc v2を構築しました。これは、既知の中で最大規模の文書指向型視覚・テキスト事前学習コーパスです。
- 規模: 1億1,300万枚の画像。
- 多様性: 17言語(簡体字・繁体字中国語、英語、アラビア語、ドイツ語などを含む)および多様な文書タイプ(学術論文、請求書、手書きノート、古文書、数式、表)を網羅。
- 構成: 6,100万枚の実世界のサンプルと、5,200万枚の合成サンプル。
- アノテーション・パイプライン: 複数の補完的なOCRモデルを用いてクロップされた要素を転記するマルチエキスパート合意パイプラインを利用しています。モデル固有のエラーを抑制するため、ペアワイズでの合意が最も高い予測を採用します。低品質なサンプルは、レイアウト検証および大規模言語モデル(LLM)による論理的一貫性チェックを用いてフィルタリングされます。
2. 事前学習戦略: 結合生成および再構成
MonkeyOCRv2は、文書ネイティブな視覚表現を学習するために、二重の目的関数を用いた事前学習戦略を採用しています。
- 画像からテキストへの生成 (Image-to-Text Generation): 標準的な自己回帰型クロスエントロピー損失()を用いて、視覚的表現をテキスト内容と整列させます。これにより、セマンティックな理解のための高密度な教師あり学習を提供します。
- ピクセルレベルの文書再構成 (Pixel-Level Document Reconstruction): 純粋なテキストによる教師あり学習では破棄される可能性のある微細な視覚的詳細(文字のストローク、グリフの形状、レイアウト構造)を、エンコーダーに保持させるよう促します。これは、平均二乗誤差(MSE)損失()および、オプションとしてエッジおよびエッジへの距離マップを一致させる構造認識損失()を通じて実現されます。
- 結合された目的関数: 。再構成の目的関数は正則化因子として機能し、言語的なコンテキストが弱い、あるいは存在しない場合でも、エンコーダーが視覚的な証拠を保持することを保証します。
3. アーキテクチャ
モデルファミリーには、MonkeyDoc v2上でゼロから学習された3つのビジョンエンコーダーのバリアントが含まれます。
- MonkeyOCRv2-S: ViT-Small (28M パラメータ)。
- MonkeyOCRv2-B: ViT-Base (113M パラメータ)。
- MonkeyOCRv2-AS: ViTAEv2-Small (21M パラメータ)。マルチスケールの帰納バイアス(例:検出、セグメンテーション)の恩恵を受けるタスク向けに最適化されています。
主な貢献
- MonkeyOCRv2: 文書AIに特化して事前学習された視覚・テキスト基盤モデル。テキスト生成とピクセルレベルの再構成を結合することで、自然画像用エンコーダーと文書画像との間の表現のミスマッチを解決します。
- MonkeyDoc v2: 1億1,300万枚の画像、17言語、多種多様なタイプを網羅する大規模なコーパスであり、既存の文書データセットの規模と多様性を大幅に上回ります。
- 二重目的の事前学習: 画像からテキストへの生成とピクセルレベルの再構成を組み合わせることが、特に言語的コンテキストが除去または劣化した場合の堅牢性を向上させることを実証しました。
実験結果
下流タスクの性能
元のエンコーダーをMonkeyOCRv2に置き換えることで、5つの代表的な文書解析タスクにおいて一貫した改善が見られました。
- 文字認識 (Text Recognition): 困難なベンチマークにおいて、CRNNの精度を58.7%から67.3%へと向上させました。PARSeqにMonkeyOCRv2を組み合わせることで、Union14Mおよび中国語ベンチマークにおいてSOTA(最先端)の性能を達成しました。
- 数式認識 (Formula Recognition): 1億1,000万パラメータのモデル(UniMERNet-T + MonkeyOCRv2)が3億2,500万パラメータのUniMERNet-Bを上回り、強力な文書指向型エンコーダーがモデル容量の減少を補完できることを示しました。
- 文字検出 (Text Detection): ICDAR2015、ArT、Total-Text、CTW1500において一貫したF値の向上を示し、ImageNet事前学習エンコーダーおよびoCLIP(テキスト特化型エンコーダー)の両方を上回りました。
- 文書改ざん検知 (Document Tampering Detection): DocTamper-Test、DocTamper-FCD、DocTamper-SCDにおいてSOTAのF1スコアを達成し、ドメインシフトに対する強い汎化性能を示しました。
- 重なり合うテキストのセグメンテーション (Overlapping Text Segmentation): MOTデータセットにおいてmIoUを4.3%から6.3%向上させました。
文書解析および理解
- 文書解析 (MDPBench): MonkeyOCRv2-B-Parsing(総パラメータ数0.7B、ビジョンエンコーダー0.1B)は、MDPBenchで**83.3%を達成しました。これは、約11倍小さいビジョンエンコーダーを使用しているにもかかわらず、従来のオープンソースSOTA(dots.mocr、3Bパラメータ)を絶対値で2.8%**上回りました。また、OmniDocBenchにおいて、より大規模な汎用VLMであるQwen3-VL-235BやGPT-5.2をも上回りました。
- 文書理解 (Document Understanding): コントロールされた設定(凍結されたエンコーダーと同一のQwen3-1.7B LLMを組み合わせたもの)において、MonkeyOCRv2-Bは8つのベンチマーク全体で平均スコア57.2を記録し、CLIP、DINO、SAM、およびその他の文書指向型エンコーダーを大幅に上回りました。
堅牢性分析
- 言語的コンテキストへの依存性: テキストをシャッフルした制御実験により、MonkeyOCRv2は解像度の低下や言語的コンテキストの除去に対してより堅牢であることが示されました。ピクセル再構成の目的関数は、意味的に一貫したテキストとシャッフルされたテキストの間の精度差を縮小させており、これは言語的な事前知識よりも視覚的な証拠への依存度が強いことを示しています。
- ハルシネーション (Hallucination): CHAOS-Benchにおいて、MonkeyOCRv2-Parsingは摂動を与えられた単語に対するページ平均リコールで最高値を記録し、HunyuanOCR-1.5やPaddleOCR-VL-1.6と比較して、視覚的証拠に対する優れた忠実性を実証しました。
意義と主張
本論文は、文書指向の視覚的事前学習は、自然界のシーン用に構築されたエンコーダーに頼るのではなく、それ自体で文書インテリジェンスの基盤となり得ると主張しています。
- 基礎的な転換: 本研究は、汎用的な視覚モデルを文書に適応させるというパラダイムに異を唱え、文書特有の視覚統計(高密度なテキスト、微細なストローク)には専用の事前学習目的関数が必要であると論じています。
- 効率性: 文書ネイティブなコンパクトなエンコーダー(0.1B)が、視覚的表現がドメインに最適化されている場合、巨大な汎用VLM(数百億のパラメータ)よりも文書特化型タスクにおいて優れた性能を発揮することを実証しました。
- 視覚的証拠の保持: ピクセルレベルの再構成目的関数が、微細な詳細を保持するために極めて重要であり、言語的コンテキストが曖昧または欠如しているシナリオにおける堅牢性を向上させることを検証しました。
著者らは、MonkeyOCRv2とMonkeyDoc v2が、多言語OCR、文書理解、およびより広範な文書インテリジェンス・システムのための再利用可能な基盤を提供し、テキストを「第一級の視覚的モダリティ」として確立するものであると結論付けています。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。