← 最新の論文
💻 computer science

MME-VideoOCR: Evaluating OCR-Based Capabilities of Multimodal LLMs in Video Scenarios

本論文は、マルチモーダル大規模言語モデルにおける光学文字認識(OCR)能力を評価するために、44のビデオシナリオにわたる25のタスクを特徴とする包括的なベンチマークであるMME-VideoOCRを紹介し、現在の最先端モデルが、最高性能のシステムであってもわずか73.7%の精度しか達成できていないことから、全体的なビデオ理解、時空間推論、およびフレーム間の統合において苦戦していることを明らかにしている。

原著者: Yang Shi, Huanqian Wang, Wulin Xie, Huanyao Zhang, Lijie Zhao, Yi-Fan Zhang, Xinfeng Li, Chaoyou Fu, Zhuoer Wen, Wenting Liu, Zhuoran Zhang, Xinlong Chen, Bohan Zeng, Sihan Yang, Yushuo Guan, Zhang Zh
公開日 2026-08-18
📖 1 分で読めます☕ さくっと読める

原著者: Yang Shi, Huanqian Wang, Wulin Xie, Huanyao Zhang, Lijie Zhao, Yi-Fan Zhang, Xinfeng Li, Chaoyou Fu, Zhuoer Wen, Wenting Liu, Zhuoran Zhang, Xinlong Chen, Bohan Zeng, Sihan Yang, Yushuo Guan, Zhang Zhang, Liang Wang, Haoxuan Li, Zhouchen Lin, Yuanxing Zhang, Pengfei Wan, Haotian Wang, Wenjing Yang

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

現代のコンピュータが発する静かな唸りの中で、新しい種類の知性が「見る」ことを学んでいる。マルチモーダル大規模言語モデルとして知られるこれらのシステムは、単に言葉を処理するだけでなく、画像や動画も処理し、それらを一つの理解のストリームへと融合させるように設計されている。これらは静止画からテキストを読み取ることに著しく習熟しており、道路標識や文書の写真を生のデジタル文字へと高い精度で変換することができる。この能力は、機械が世界をナビゲートし、指示を読み取り、情報を整理するための扉を開いた。しかし、現実の世界が静止していることは滅多にない。世界は動き、変化し、移り変わる。これらと同じ知的なシステムに対して、動いているビデオからテキストを読み取るよう求められたとき、そのタスクははるかに困難なものとなる。車が猛スピードで通り過ぎる際に文字がぼやけたり、ほんの一瞬だけ現れたり、あるいは時間の経過とともに断片的に散らばったりすることがあるからだ。動きの中にあるテキストを理解するには、単に「見る」こと以上のことが求められる。それは、一連の出来事を通じて記憶し、結びつけ、推論することを要求するのである。

研究チームは、これらの高度なシステムが動画というダイナミックな世界において、テキストをどの程度扱えるかを詳細に調査した。彼らは、機械が動くテキストに対して苦戦する特有の方法で挑戦を与えるために設計された、包括的なビデオクリップのコレクションである「MME-VideoOCR」という新しいテスト場を構築した。このベンチマークは、単にコンピュータに単語を読ませるのではない。レーシングカーに書かれた特定の数字を見つけ出したり、車両が車線変更する際のナンバープレートを追跡したり、あるいは数秒間にわたって断片化され、散らばっている文章を組み立てたりすることをコンピュータに求めるのである。研究者たちは、運転、料理、ニュース視聴、講義への出席といった44の異なる現実世界のシナリオを網羅する、短いクリップから長いシーケンスに至るまで、1,464本のビデオを集めた。各ビデオに対して、正確性と公平性を確保するために人間の専門家によって検証された、入念に作成された2,000個の質問と回答を作成した。

最も進んだ18のビデオ読解モデルをテストにかけたところ、その結果は、現在の能力と現実世界の要求との間に大きな隔たりがあることを明らかにした。Gemini-2.5 Proとして知られる強力なモデルである最高性能のシステムでさえ、正解率はわずか73.7パーセントにとどまった。これは高いスコアに見えるかもしれないが、研究者たちは、モデルがビデオ全体を注視し、時間を通じて情報を結びつける必要があるタスクにおいて、劇的に失敗することを発見した。例えば、動く物体の軌跡によって形成された文字を認識したり、異なるフレームにランダムな順序で現れる文字から単語を再構成したりする場合、トップモデルのスコアはほぼゼロであった。彼らは単一のフレーム内で明確に見える標識を読むことはできたが、情報が分散している場合には、しばしば文脈を見失ってしまうのである。

また、この研究は、これらの機械の思考プロセスにおける特異な癖をも浮き彫りにした。ぼやけていたり綴りが間違っていたりするテキストに直面した際、モデルは画面上に実際に表示されている内容を無視し、代わりに一般的な言語パターンに基づいて、そのテキストが「こうあるべきだ」という内容を推測してしまうことが頻繁にあった。もしビデオ内の標識が、文字が欠けた状態で明らかに「OFF COURS」と書かれていたとしても、モデルは視覚的な証拠よりも、単語が通常どのように綴られるかという内部知識を優先し、自信を持って「OFF COURSE」であると報告することがよくあった。このように、実際にそこにあるものよりも、期待されるものに依存してしまう傾向は、これらのシステムが依然として書き言葉の学習に強く影響されており、時には視覚的な正確さを犠牲にしていることを示唆している。

さらに、研究者たちはビデオ入力の品質が極めて重要であることを発見した。低解像度の画像や、ビデオから抽出したフレーム数が少ないものを与えると、パフォーマンスは急激に低下した。機械は、物語を組み立てるために高精細な明瞭さと、十分な数の時間的瞬間を必要としていた。この発見は、単にモデルを大きくしたり賢くしたりするだけでは不十分であることを強調している。その世界の見え方は、鮮明かつ連続的でなければならない。本研究は、人工知能が静止画の読解において大きな進歩を遂げた一方で、流動的で断片的であり、しばしば混沌とした「動きの中のテキスト」を完全に理解する能力はいまだ欠如していると結論づけている。今後の進むべき道は、単に優れたアルゴリズムを得ることではなく、より深い視覚的記憶の統合と、習慣に基づいた推測への抵抗力を得ることである。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →