物理的な本や手書きの手紙、あるいは複雑なレシートを手にしているところを想像してみてください。人間にとって、それは簡単に読むことができます。どの列から読み始めるべきかを知っていますし、画像を飛び越えてテキストに戻る方法も、ぐにゃぐにゃした線が単なる落書きではなく数学の数式であることを判断する方法も知っています。しかし、コンピュータにとって、そのページは単なる色の付いたピクセルの平坦なグリッドに過ぎません。コンピュータは、テーブルが格子状の構造であることや、数式が計算であることを、あるいはページ下部のテキストが次の列の上部に属していることを理解せずに、ただ形の塊として見てしまうのです。これが「ドキュメント・パース(文書解析)」の世界です。これは、ページの画像を図のように、コンピュータが実際に読み、検索し、利用できるデジタルファイルへと変える魔法のような技術です。長い間、コンピュータはこの作業を小さな個別のステップに分解して行おうとしてきました。まず線を検出し、次に言葉を読み取り、それからテーブルがどこにあるかを推測するという具合です。しかし、この「組立ライン」方式は扱いにくく、もし最初のステップでテーブルの境界を見逃すと、残りの機械は立ち往結してしまいます。この分野における大きな問いは、「人間と同じように、全体像を把握して一度に物語を書き上げるような、単一のスマートな脳を作れるか?」ということでした。
そこで登場したのが、Alibabaの研究者によって開発された新しいデジタル「読者」、OvisOCR2です。OvisOCR2を、巨大で鈍重なスーパーコンピュータではなく、機敏な0.8B(8億)パラメータの「ポケットサイズの」天才と考えてください。この問題に挑む他のモデルは、しばしば巨大で大規模なデータセンターを必要としますが、OvisOCR2は小さく高速でありながら、驚くほど強力であるように設計されています。研究者たちは、巧妙な二部構成のトレーニング戦略を用いてこのモデルを構築しました。まず、スキャンされた書類、レシート、レポートなどの現実世界の膨大なライブラリを学習させましたが、モデルが不完全な間違いからではなく完璧な例から学ぶように、回答の「クリーンアップ」を慎重に行いました。次に、「合成」トレーニング環境を作成しました。これは、完璧で既知の正解を持つ無限の文書ページを生成できるビデオゲームのようなものです。これらは、特にトリッキーなもの(乱れた手書き文字や、セルが変な形で結合されたテーブルなど)になるよう特別に設計されています。これにより、モデルは現実世界でそれらを見つける必要なしに、最も難しいパズルに練習することができたのです。
トレーニングプロセスは、厳格なスポーツキャンプのようでした。モデルはまず基礎を学び(教師あり微調整)、次に「強化学習」のフェーズへと進み、ゲームをプレイしました。モデルはページを読もうとし、テーブルや数学の数式を正しく読み取れれば高得点を得て、順序を間違えたり行を見逃したりすると低得点を得るという仕組みです。この小さな0.8Bモデルが最高のものから学べるように、研究者たちは「教師ー生徒」アプローチを採用しました。まず、これらのタスクの達人となるように、より大きな4B(40億)パラメータの「教師」モデルを訓練し、次に、その教師の最善の動きを模倣させることで、小さな「生徒」モデル(OvisOCR2)に教えていったのです。これにより、小さなモデルがそのクラスターの重みを遥かに超える実力を発揮することが可能になりました。
結果はゲームチェンジャーとなるものです。ドキュメント読解の「オリンピック」とも言える標準的なベンチマークであるOmniDocBench v1.6でテストされた際、OvisOCR2は96.58という素晴らしいスコアを記録しました。これは、この小さなエンドツーエンドのモデルが、この分野を支配してきた最大かつ最も複雑な「組立ライン」型のシステムを実際に打ち負かしたことを意味しており、非常に大きな出来事です。単に全体で勝利しただけでなく、テキストの読み取り、数学の数式の理解、そして複雑なテーブルの再構築において最高の結果を出しました。また、PureDocBenchでも75.06というスコアで最高得点を記録しました。著者らが作成した、トリッキーな手書き文字や乱れたテーブルを含むカスタムの困難なテストにおいても、OvisOCR2はトップに立ち、クリーンで完璧なページだけでなく、現実世界の混沌とした状況にも対応できることを証明しました。
しかし、研究者たちはその限界についても正直に述べています。OvisOCR2は大きな飛躍を遂げたものの、非常にぼやけた画像や損傷した画像、あるいは照明条件の悪い環境でスマートフォンで撮影された画像に対しては、一部の巨大で汎用的なAIモデルと比較して、依然として苦戦する場面があります。それはすべてを解決する魔法の杖ではありませんが、ドキュメントを完璧に読むために、必ずしも数十億ドルのコンピュータを必要としないことを証明する、非常に強力で効率的なツールです。論文は、このアプローチによって、私たちはついに、使いにくい多段階の機械から、日常のアプリですぐに使用できるエレガントな単一モデルのソリューションへと移行できることを示唆しています。これにより、デジタル世界はより身近なものになるでしょう。
技術要約: OvisOCR2
問題提起
ドキュメント・パーシング(文書解析)の目的は、視覚的に豊かなドキュメント画像を、テキストだけでなくレイアウト、読解順序、表、数式、および視覚的領域を保持したまま、構造化された機械判読可能な表現(通常はMarkdown)に変換することである。現在の手法は、大きく分けて以下の2つのカテゴリに分類される:
- パイプライン方式: タスクを個別のステージ(レイアウト解析、領域レベルの認識、および結合)に分解する。これらは現在パブリックベンチマークで高い性能を示しているが、複数のモデルを必要とするためデプロイが複雑になり、ステージ間でエラーが蓄積する(例:テーブルの境界を見逃した場合、後続の認識器では修正できない)。
- エンドツーエンド方式: 単一のモデルを使用して、一度のパスでMarkdownを生成する。これによりデプロイが簡素化され、ページレベルのコンテキストを活用できる。しかし、既存のエンドツーエンド方式は、歴史的に主要なベンチマークにおいてパイプライン方式に後れを取ってきた。
課題は、優れたパイプライン方式を上回る精度を維持しつつ、小さなデプロイメント・フットプリントを維持できる、コンパクトなエンドツーエンド・モデルを開発することである。
手法
1. データエンジン
堅牢なエンドツーエンド・パーサーを訓練するために、著者らは2つの補完的なパイプラインを組み合わせたデータエンジンを構築した:
- 実世界データパイプライン: 特化したOCRパーサー(PaddleOCR-VL-1.5またはMinerU2.5-Pro)を使用して、大規模な実世界のドキュメント画像を訓練データに変換する。プロセスには以下が含まれる:
- 構造化パーシング: パーサーのJSON出力を統一されたMarkdownスキーマに変換する。
- ルールベースの正規化: 厳格なカテゴリ検証、テキストブロックの結合、数式の正規化(LaTeX形式)、テーブル構造の検証、および視覚的領域のエンコーディング(バウンディングボックスを画像タグとして扱う)を強制する。
- 手動スポットチェック: 人間の検査官がテキストの対応関係、数式の正確性、テーブルの整列、および読解順序を検証する保守的なサブセットフィルタリング段階。低品質なサブセットは破棄される。
- 合成データパイプライン: 同一のHTMLソースからドキュメント画像とMarkdownのグラウンドトゥルース(正解)の両方を導出することで、制御可能でノイズのない訓練ターゲットを生成する。
- ハードサンプルマイニング: 失敗事例(例:複雑なテーブル、手書き領域)を特定し、再利用可能な合成パターンを作成する。
- エージェントによる多様化: エージェントが初期のHTMLテンプレートを、妥当性を維持しながら、コンテンツと構造の多様なバリエーションへと拡張する。
- グラウンドトゥルース生成: MarkdownはHTMLソースから直接シリアライズされ、完全な整合性が保証される。
- レンダリング: 現実的なタイポグラフィとレイアウトをシミュレートするために、Playwrightを使用して画像をレンダリングする。
2. 訓練レシピ
0.8Bモデル(Qwen3.5-0.8Bに基づく)の訓練プロセスは、マルチステージ・パイプラインを含む:
- 教師あり微調整 (SFT): 混合された実世界データと合成データの両方を用いて、0.8Bおよび4Bのブランチを訓練する。4Bモデルは、ティーチャー(教師)として機能させるために短期間訓練される。
- 強化学習 (RL): 4Bブランチに対し、グループ相対方策最適化(GRPO)を用いたRLを行う。
- 報酬設計: テキストの忠実度(正規化編集距離)、数式の一致(CDM)、およびテーブル構造(TEDS)を評価する多成分報酬システム。報酬は単純なトークンの模倣ではなく、検証可能な構造的正当性に基づいて計算される。
- ハードケース構築: RLデータは、モデルが時として優れた出力を生成できる「オンポリシー」のハードサンプルに焦点を当て、些細なケースや不可能なケースを回避する。
- オンポリシー蒸留 (OPD): 報酬によって整合された4Bティーチャーの振る舞いを、0.8Bスチューデント(生徒)に転移させる。
- 直接的なRL(小規模モデルにおける不安定性と高いKLダイバージェンスの原因となる)を行う代わりに、スチューデントが応答を生成し、ティーチャーがスチューデントのトップkトークンに対してトークンレベルの分布監視(逆KL)を提供する。これにより、長く構造化された出力に対する学習が安定化する。
- モデル融合: 異なる構成で訓練された複数の0.8Bモデルのバリアントを、重み付きパラメータ平均を通じて融合し、最終的なOvisOCR2を生成する。
主な貢献
- OvisOCR2 モデル: パブリックベンチマークにおいて、主要なパイプライン方式を凌駕する最先端(SOTA)の性能を達成する、コンパクトな0.8Bパラメータのエンドツーエンド・ドキュメントパーサー。
- ハイブリッド・データエンジン: フィルタリングされた実世界の注釈と、ソースに整合した合成データを組み合わせ、ロングテールなシナリオ(例:高密度な数式、複雑なテーブル)をカバーしつつ、グラウンドトゥルースの正確性を確保する新しいシステム。
- 高度な訓練戦略: SFT、多成分報酬を用いた4BブランチへのRL、および小規模モデルにおける直接的なRLの不安定性を回避しながら複雑なパーシング動作を転移させるためのオンポリシー蒸留を組み合わせたパイプライン。
結果
OvisOCR2は3つのベンチマークで評価された:
- OmniDocBench v1.6: OvisOCR2は総合スコア96.58を達成し、新たなSOTAを樹立した。これは最高のパイプライン方式(例:PaddleOCR-VL-1.6の96.33)および従来のエンドツーエンド方式を上回り、テキスト編集距離、数式CDM、およびテーブルTEDSの指標でリードした。
- PureDocBench: 本モデルは最高Avg3スコア75.06を達成し、CleanトラックとDigitalトラックの両方で第1位となった。Degraded Image(劣化画像)を含む「Real」トラックにおける堅牢性は、大規模な汎用VLMと比較して改善の余地があることが指摘された。
- インハウス・ベンチマーク: ロングテールシナリオ(手書き、複雑なテーブル)を含む1,000ページ以上のドキュメントで評価。OvisOCR2は最高の総合スコア(85.54)を達成し、すべての難易度ティアでリードした。特に、複雑なテーブルの欠落率を大幅に減少させ(パイプライン方式の13–17%に対し、7.96%)、手書きのサブセットにおいても最高の性能を達成した。
意義
本論文は、OvisOCR2が、コンパクトな0.8Bパラメータのモデルであっても、エンドツーエンドのドキュメントパーシングが従来のパイプライン方式を凌駕する可能性を示していると主張している。洗練されたデータエンジンと、SFT + RL + 蒸留というマルチステージの訓練レシピを統合することで、単一のモデルがテキスト、数式、テーブル、レイアウトといったドキュメント解析の全容を、分解されたシステムよりも効果的に処理できることを著者らは示した。この成果は、エンドツーエンドのアプローチが精度を損なうことなくデプロイの効率性を達成できることを強調しており、ドキュメントのデジタル化に必要なインフラストラクチャを簡素化できる可能性を示唆している。
毎週最高の AI 論文をお届け。
スタンフォード、ケンブリッジ、フランス科学アカデミーの研究者に信頼されています。
受信トレイを確認して登録を完了してください。
問題が発生しました。もう一度お試しください。
スパムなし、いつでも解除可能。
週刊ダイジェスト — 最新の研究をわかりやすく。登録