Unlimited OCR Works
本論文では、標準的なデコーダー・アテンションを、一定のKVキャッシュを維持するための新しいリファレンス・スライディング・ウィンドウ・アテンション(R-SWA)メカニズムに置き換えたモデルであるUnlimited OCRを紹介しており、これにより、LLMベースのOCRシステムにおいて長い出力シーケンスによって通常引き起こされるメモリおよび速度の低下を回避し、数十ページにわたる効率的なシングルパス転写を可能にしている。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
大きな問題:現在のAIにおける「メモリ過負荷」
あなたが100ページの書籍を手書きで写そうとしている場面を想像してみてください。
- 人間はどうするか: 本を見ながら、一文を書き、直前に書いた数単語をちらっと振り返って、自分が正しい流れに沿っているかを確認し、作業を続けます。最初の一ページ目から書いたすべての単語をすべて覚えておく必要はありません。ただ、「今、自分がどこにいるか」を知っていればよいのです。人間の脳は、遠い過去を自然に「フェードアウト」させつつ、直近の文脈を鮮明に保つことができます。
- 現在のAIはどうするか: 現在のAIモデルは、何も忘れることを拒む学生のようなものです。新しい単語を書くたびに、次に何を書くべきかを決めるために、ページ1から現在のページまでの本全体を読み返そうとします。
- その結果: 本が長くなればなるなるほど、学生は膨大な精神的負荷を背負うため、どんどん動作が遅くなります。最終的に、メモリ(RAM)が不足して停止し、リセットして新しいページからやり直さなければなりません。これが、現在のAIが本を一気に処理するのに苦労し、ループに陥ったロボットのように、ページごとに作業を繰り返さなければならない理由です。
解決策:「Unlimited OCR」と「スライディング・ウィンドウ」
Baiduの研究者たちは、Unlimited OCRと呼ばれる新しいモデルを提案しました。彼らは、より人間のようにコピーができるAIを作りたいと考えました。これを実現するために、彼らは**参照型スライディング・ウィンドウ・アテンション(Reference Sliding Window Attention: R-SWA)**という新しいアテンション・メカニズムを考案しました。
その仕組みを、いくつかの比喩を使って説明します。
1. 「参照用書籍」対「スライディング・ウィンドウ」
AIがデスクに座っており、手元に2つのものがあると考えてください。
- 参照用書籍(画像): これはスキャンされている文書です。AIは作業中、この本をデスクの上に開いたままにしておきます。元の画像を決して忘れることはありません。
- スライディング・ウィンドウ(直近の過去): 自分が書いた全履歴を覚える代わりに、AIは直前に生成したわずか128単語分だけの小さな「付箋」だけを保持します。新しい単語を書くたびに、付箋の一番古い単語が外れ、新しい単語が追加されます。
魔法の仕組み: AIは、参照用書籍(何をコピーすべきかを知るため)と、スライディング・ウィンドウ(自分がプロセスのどこにいるかを知るため)の両方を見ます。それ以外の履歴は無視します。これにより、1ページをコピーする場合でも100ページをコピーする場合でも、AIの「精神的負荷(メモリ使用量)」は一定に保たれます。
2. 「ディープ・スクイーズ(深い圧縮)」(高圧縮エンコーダ)
AIが書き始める前に、まず画像を見なければなりません。
- 従来の方法: 本の高解像度写真を持っている場合、それは本のすべてのピクセルを記述しようとするようなものです。膨大なスペースを占有してしまいます。
- Unlimited OCRの方法: 彼らは「ディープ・スクイーズ(DeepEncoder)」を使用しています。高解像度の写真を、重要な詳細を失うことなく、非常に効率的な小さな要約へと圧縮することを想像してください。これにより、「参照用書籍」がデスクの上で占めるスペースが非常に小さくなり、AIが作業するための十分なスペースが確保されます。
彼らは何を達成したのか?
「ディープ・スクイーズ」と「スライディング・ウィンドウ」を組み合わせることで、研究者たちは主に3つのことを成し遂げました。
- ワンショットでの長距離解析(One-Shot Long-Horizon Parsing): このモデルは、数十ページの文書を一度に処理できます。途中で停止してリセットする必要はありません。本を一冊、最初から最後まで連続した流れで読み切ることができます。
- 一定のスピード: AIは全履歴を記憶しようとしないため、文書が長くなっても速度が低下しません。1ページ目であっても50ページ目であっても、同じスピードで書き進めます。
- より高い精度: 驚くべきことに、関連する直近の文脈と元の画像だけに集中することで、AIは以前の最高モデルよりも実際にミスが少なくなりました。自分自身の長い履歴によって混乱することがなかったのです。
「現実世界」でのテスト
研究者たちは、OmniDocBenchというベンチマークを用いてテストを行いました。
- 結果: Unlimited OCRは、そのベースとなったモデル(DeepSeek OCR)を含む、ほぼすべてのモデルよりも高いスコアを記録しました。
- 長文テスト: 40ページ以上の本を入力したところ、モデルは高い精度を維持し続け、本の中盤で「迷子」にならないことが証明されました。
これは将来にとって何を意味するのか?
この論文は、これが単に本を読むためのものではないことを示唆しています。 「スライディング・ウィンドウ」のロジックは非常に効率的であるため、以下のような、長時間聞き取ったり翻訳したりしても疲れたり遅くなったりすることなく、長時間継続する必要がある他のタスクにも応用できます。
- ASR(自動音声認識): システムが遅くなることなく、数時間の音声を聞き取る。
- 翻訳: 長い文書を一度のパスで翻訳する。
まとめ
Unlimited OCRを、長いタスクによって圧倒されてしまう「写真記憶を持つAI」から、何が必要で(元の画像と直前の数単語)、何を安全に忘れてもよいか(それ以外)を正確に理解している「スマートなコピー機」へとアップグレードしたものだと考えてください。これにより、AIはより速く働き、より少ないメモリを使用し、これまではAIが一度に処理することを不可能にしていた巨大な文書を扱うことができるようになりました。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。