← 最新の論文
🤖 AI

Accuracy Without Grounding: Diagnosing Visual Dependency Dissociation in Video LLM Benchmarks

本論文は、ビデオ大規模言語モデルにおける高いベンチマーク精度は真の視覚的理解ではなく言語的事前知識に起因していることが多いことを示すためにVisual Dependency Gap(VDG)を導入し、時間的順序が性能への寄与は最小限である一方で、フレームの多様性が利得の大部分を駆動していることを明らかにする。

原著者: Jae Joong Lee

公開日 2026-07-16
📖 1 分で読めます☕ さくっと読める

原著者: Jae Joong Lee

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは、ロボットに世界を理解させる方法を教えようとしているところだと想像してください。あなたはロボットにカメラと脳を与え、それが見ているものについて質問を投げかけます。長い間、科学者たちは、ロボットにテストを与えることで、そのロボットがどれほど「賢い」かを測定してきました。テストとは、ビデオを見せ、質問をし、正解にたどり着けるかどうかを確認するというものです。もしロボットが高いスコアを出せば、それはロボットが本当にビデオを「見て」、理解しているのだと私たちは想定します。しかし、ここに落とし穴があります。ロボットが正解したからといって、必ずしも画像を見たとは限らないのです。まるで、黒板を見ることなく、「火曜日はいつも『猫』について聞かれる」という先生の癖を知っていて、ただ「猫」と答える学生のように、質問に含まれる言葉に基づいて推測しただけかもしれません。この論文は、「ビデオ大規模言語モデル(Video Large Language Models)」という、テキストを読み、ビデオを視聴できる超スマートなコンピュータたちの、混沌として混乱した世界に深く切り込み、恐ろしい問いを投げかけます。これらのロボットは、本当に映画を「見ている」のでしょうか、それとも単にテキストを使って答えを推測するのが非常に上手いだけなのでしょうか?

研究者たちは、小さなものから巨大な脳を持つ巨大なものまで、20種類のビデオ視聴ロボットに対して、ちょっとしたトリックを仕掛けることにしました。彼らはMVBenchと呼ばれる標準的なテスト(数百のビデオに関する質問が含まれています)を取り上げ、すべての質問に対してテストを2回ずつ実行しました。1回目は、ロボットに実際のビデオを見せました。2回目は、ロボットに全く同じ質問を見せましたが、ビデオの部分は真っ黒な画面に置き換えられました。もしロボットが本当に「見ている」のであれば、ビデオが消えたときにスコアはゼロ近くまで下がるはずです。もしビデオが真っ黒な状態でも正解を出し続けているとしたら、それはロボットが全く見ておらず、言語のテクニックを使って推測していることを意味します。

結果は衝撃的なものでした。チームは、多くの質問において、ロボットがビデオを見ているのか、それとも真っ暗な虚無を見つめているのかに関わらず、ほぼ同じパフォーマンスを発揮していることを発見しました。彼らは「視覚依存ギャップ(Visual Dependency Gap: VDG)」と呼ばれる新しい測定方法を導入しました。これは基本的には、ビデオがある場合とない場合でのロボットの性能の差です。彼らは、ある種の質問、例えば「車の色は何色ですか?」(属性知覚)については、ロボットが正解を得るために本当にビデオを必要としていることを発見しました。しかし、他の種類の質問、例えば「次に何が起こりますか?」(時間的推論)については、画面が真っ黒であってもロボットは正解を出していました。これは、テストの質問が、ロボットに時間や順序を理解させているのではなく、単に質問の言い回しから答えを推測させているだけであることを意味しています。

研究者たちはまた、なぜロボットがこれらの答えを出せるのかを探ろうとしました。彼らはビデオを異なるパーツに分解しました:単一のフレーム、順番を入れ替えた一連のフレーム、そして時間が順方向に進む完全なビデオです。彼らは、ロボットがイベントの順序には全く関心を持っていないことを発見しました。ビデオが順方向に再生されていても、逆方向に再生されていても、あるいは画像のバラバラな寄せ集めであっても、ロボットのスコアは同じでした。唯一、役に立ったのは「異なる画像を見ること(フレームの多様性)」であり、正しい順序で見ることではありませんでした。実際、最新の最も高度なモデルの中には、ビデオの入力がむしろ混乱を招き、ビデオを完全に無視してテキストから推測した場合よりも、パフォーマンスがわずかに低下してしまうものさえありました。

最も興味深い発見の一つは、これらのロボットが圧縮をどのように扱うかについてでした。通常、ビデオファイルを小さくするために圧縮すると、品質は低下します。研究者たちは、もしロボットが真に「見ている」のであれば、ぼやけた圧縮されたビデオによって失敗するはずだと予想しました。しかし、ビデオが激しく圧縮されても、ロボットのスコアは平坦で安定していました。チームは、これがロボットが非常に堅牢であるからではなく、質問があまりにもテキストから推測しやすいので、ロボットが視覚的な詳細を全く必要としなかったのだと結論づけました。「堅牢性」とは、質の悪いテスト問題が生み出した錯覚だったのです。

最後に、彼らはこれらのロボットが大きくなり、賢くなるにつれてどのように変化するかを調査しました。彼らは、モデルが大きくなるにつれて一般的にビデオの使用能力は向上するものの、非常に新しいモデルの中には、視覚情報への依存がむしろ低下しているものがあることを発見しました。あるモデル(Qwen3-VL)は、ビデオフレームを効果的に使う方法を忘れてしまったようで、全体的なテストスコアは良好であるにもかかわらず、ほとんどテキストからの推測に頼っていました。論文はこう締めくくっています。私たちはもはや、リーダーボードのスコアをそのまま信じることはできません。高いスコアは、ロボットが優れた観察者であることを意味するのではなく、単に優れた「推測者」であることを意味しているのかもしれません。ロボットが本当に見ているかどうかを知るには、画面が真っ黒になったときに失敗するかどうかを確認する必要があります。もし失敗しないのであれば、そもそも見ていなかったのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →