← 最新の論文
🤖 AI

OvisOCR2 Technical Report

OvisOCR2は、ドキュメントページのMarkdown表現を直接生成することで、ベンチマークデータセットにおいて最先端の性能を達成するために、斬新なデータエンジンと強化学習および蒸留を含むマルチステージのトレーニングレシピを活用した0.8Bのエンドツーエンド・ドキュメント解析モデルである。

原著者: Shiyin Lu, Yinglun Li, Yu Xia, Yuhui Chen, An-Yang Ji, Jun-Peng Jiang, Qing-Guo Chen, Jianshan Zhao, En Lin, Haijun Li, Cheng Qin, Zhao Xu, Weihua Luo

公開日 2026-07-16
📖 1 分で読めます☕ さくっと読める

原著者: Shiyin Lu, Yinglun Li, Yu Xia, Yuhui Chen, An-Yang Ji, Jun-Peng Jiang, Qing-Guo Chen, Jianshan Zhao, En Lin, Haijun Li, Cheng Qin, Zhao Xu, Weihua Luo

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

物理的な本や手書きの手紙、あるいは複雑なレシートを手にしているところを想像してみてください。人間にとって、それは簡単に読むことができます。どの列から読み始めるべきかを知っていますし、画像を飛び越えてテキストに戻る方法も、ぐにゃぐにゃした線が単なる落書きではなく数学の数式であることを判断する方法も知っています。しかし、コンピュータにとって、そのページは単なる色の付いたピクセルの平坦なグリッドに過ぎません。コンピュータは、テーブルが格子状の構造であることや、数式が計算であることを、あるいはページ下部のテキストが次の列の上部に属していることを理解せずに、ただ形の塊として見てしまうのです。これが「ドキュメント・パース(文書解析)」の世界です。これは、ページの画像を図のように、コンピュータが実際に読み、検索し、利用できるデジタルファイルへと変える魔法のような技術です。長い間、コンピュータはこの作業を小さな個別のステップに分解して行おうとしてきました。まず線を検出し、次に言葉を読み取り、それからテーブルがどこにあるかを推測するという具合です。しかし、この「組立ライン」方式は扱いにくく、もし最初のステップでテーブルの境界を見逃すと、残りの機械は立ち往結してしまいます。この分野における大きな問いは、「人間と同じように、全体像を把握して一度に物語を書き上げるような、単一のスマートな脳を作れるか?」ということでした。

そこで登場したのが、Alibabaの研究者によって開発された新しいデジタル「読者」、OvisOCR2です。OvisOCR2を、巨大で鈍重なスーパーコンピュータではなく、機敏な0.8B(8億)パラメータの「ポケットサイズの」天才と考えてください。この問題に挑む他のモデルは、しばしば巨大で大規模なデータセンターを必要としますが、OvisOCR2は小さく高速でありながら、驚くほど強力であるように設計されています。研究者たちは、巧妙な二部構成のトレーニング戦略を用いてこのモデルを構築しました。まず、スキャンされた書類、レシート、レポートなどの現実世界の膨大なライブラリを学習させましたが、モデルが不完全な間違いからではなく完璧な例から学ぶように、回答の「クリーンアップ」を慎重に行いました。次に、「合成」トレーニング環境を作成しました。これは、完璧で既知の正解を持つ無限の文書ページを生成できるビデオゲームのようなものです。これらは、特にトリッキーなもの(乱れた手書き文字や、セルが変な形で結合されたテーブルなど)になるよう特別に設計されています。これにより、モデルは現実世界でそれらを見つける必要なしに、最も難しいパズルに練習することができたのです。

トレーニングプロセスは、厳格なスポーツキャンプのようでした。モデルはまず基礎を学び(教師あり微調整)、次に「強化学習」のフェーズへと進み、ゲームをプレイしました。モデルはページを読もうとし、テーブルや数学の数式を正しく読み取れれば高得点を得て、順序を間違えたり行を見逃したりすると低得点を得るという仕組みです。この小さな0.8Bモデルが最高のものから学べるように、研究者たちは「教師ー生徒」アプローチを採用しました。まず、これらのタスクの達人となるように、より大きな4B(40億)パラメータの「教師」モデルを訓練し、次に、その教師の最善の動きを模倣させることで、小さな「生徒」モデル(OvisOCR2)に教えていったのです。これにより、小さなモデルがそのクラスターの重みを遥かに超える実力を発揮することが可能になりました。

結果はゲームチェンジャーとなるものです。ドキュメント読解の「オリンピック」とも言える標準的なベンチマークであるOmniDocBench v1.6でテストされた際、OvisOCR2は96.58という素晴らしいスコアを記録しました。これは、この小さなエンドツーエンドのモデルが、この分野を支配してきた最大かつ最も複雑な「組立ライン」型のシステムを実際に打ち負かしたことを意味しており、非常に大きな出来事です。単に全体で勝利しただけでなく、テキストの読み取り、数学の数式の理解、そして複雑なテーブルの再構築において最高の結果を出しました。また、PureDocBenchでも75.06というスコアで最高得点を記録しました。著者らが作成した、トリッキーな手書き文字や乱れたテーブルを含むカスタムの困難なテストにおいても、OvisOCR2はトップに立ち、クリーンで完璧なページだけでなく、現実世界の混沌とした状況にも対応できることを証明しました。

しかし、研究者たちはその限界についても正直に述べています。OvisOCR2は大きな飛躍を遂げたものの、非常にぼやけた画像や損傷した画像、あるいは照明条件の悪い環境でスマートフォンで撮影された画像に対しては、一部の巨大で汎用的なAIモデルと比較して、依然として苦戦する場面があります。それはすべてを解決する魔法の杖ではありませんが、ドキュメントを完璧に読むために、必ずしも数十億ドルのコンピュータを必要としないことを証明する、非常に強力で効率的なツールです。論文は、このアプローチによって、私たちはついに、使いにくい多段階の機械から、日常のアプリですぐに使用できるエレガントな単一モデルのソリューションへと移行できることを示唆しています。これにより、デジタル世界はより身近なものになるでしょう。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →