What Does a Temporal Benchmark Score Measure? Decomposing Channel Use in Video VLM Evaluation
本論文は、ラベルフリーの「リバーサル・ドロップ(反転ドロップ)」指標を導入して時間的ビデオVLMベンチマークのスコアを分解し、モデルが視覚的内容ではなく位置エンコーディングに依存していることが多いこと、および集計スコアが、位置優位型アーキテクチャと視覚シーケンス優位型アーキテクタの間にある明確で互換性のない失敗モードを覆い隠していることを明らかにしている。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
ビデオ探偵の大混乱:なぜ同じスコアを持つ2つのモデルが実は異なるのか
あなたが、ビデオの謎を解くのがどちらの方が得意かを知るために、2人の探偵、Molmo2とQwen3-VLをテストしている場面を想像してみてください。あなたは一連の短いクリップを与え、「猫は犬が吠える前と後、どちらで跳びましたか?」といった質問を投げかけます。両方の探偵が高いスコア、例えば0.96(または96%の精度)を出したとします。あなたはこう思うかもしれません。「素晴らしい!彼らはどちらも時間を完璧に理解している。」
しかし、この論文は、あなたのテストが実は「罠」であることを指摘しています。それは、探偵に「事件を解決しましたか?」と聞くだけで、その「方法」を聞いていないようなものです。この論文は、両方の探偵が正しい答えを出したとしても、そこに至るための方法が全く異なり、かつ正反対であったことを明らかにしています。一方は、目に見えるものを無視する「タイムトラベラー」であり、もう一方は、自分の目を信じる「リアリスト」なのです。
1つのスコアに隠された2つの質問
著者らは、標準的なビデオテストのスコアは、実際には2つの異なる質問が混ざり合った「カクテル」であると言っています。
- タスクの質問: その質問は、実際にビデオを順番通りに観る必要があるのか?(例:「ボールは跳ねましたか?」は1フレームでも分かりますが、「ボールは跳ねた後で転がりましたか?」はシーケンスが必要です。)
- チャネルの質問: モデルが順番を必要とする場合、その情報はどこから得ているのか? モデルはピクセル(画面上の実際の動き)を読んでいるのか、それとも、コンピュータにどのフレームが#1、#2、#3であるかを教える不可視のラベルである位置番号を読んで「ズル」をしているのか?
ほとんどのテストは、最初の質問しかチェックしません。フレームをシャッフルしてスコアが下がるかどうかを見ます。もしスコアが下がれば、「よし、モデルは順番を必要としている」と判断します。しかし、モデルのどの部分が重労働(メインの処理)を行っているのかまではチェックしません。
マジックトリック:「リバーサル・ドロップ(逆転による低下)」
モデルが実際にどのように機能しているかを突き止めるために、著者らはリバーサル・ドロップと呼ばれるマジックトリックを行いました。
風船が膨らんでいるビデオを想像してください。
- ピクセル: 視覚的なフレームでは、風船が大きくなっています。
- 位置ラベル(RoPE): これらは各フレームに付着した「フレーム1」「フレーム2」「フレーム3」という不可視のタグです。
著者らは、ビデオのピクセルを反転させ(風船が大きくなってから小さくなるのではなく、大きかった状態から縮んでいくように見せる)、しかし位置ラベルは順方向のまま(コンピュータには依然としてフレーム1、フレーム2、フレーム3を見ていると思わせる)にしました。
これで、ピクセルは「収縮している」と言っていますが、ラベルは「膨張している」と言っています。2つのチャネルが互いに戦っている状態です。
- Molmo2(位置優位型の探偵): ピクセルとラベルが衝突したとき、Molmo2はピクセルを無視します。ラベルを見て、「フレーム1、2、3」を確認し、風船が膨らんでいるかのように答えます。たとえ動画が逆再生であっても、ラベルがそう指示しているため、「膨らんでいる!」と答えるのです。
- 結果: その精度はほとんど変わりませんでした。ビデオが逆転していることを気にしていませんでした。ラベルである位置インデックスを読んでいたのです。
- Qwen3-VL(視覚シーケンス優位型の探偵): ピクセルとラベルが衝突したとき、Qwen3-VLはラベルを無視します。ピクセルを見て、風船が縮んでいるのを確認し、「収縮している!」と答えます。
- 結果: その精度は崩壊(コラップス)しました。逆転したビデオに騙されたため、間違った答えを出したのです。このモデルは視覚的な順序を読んでいました。
数字は嘘をつかない
論文はこの「ドロップ(低下)」を測定することで、その違いを証明しました。
- TVBenchというベンチマークにおいて、ビデオを反転させ、ラベルを順方向に保ったとき:
- Molmo2の低下はほとんどありませんでした(約**+0.00から+0.08**ポイント)。全く問題ありませんでした。
- Qwen3-VLは大幅に低下しました(+0.24から+0.55ポイントの間)。クラッシュしたのです。
- TempCompassにおいて、「ペア・グラウンドトゥルース(正解のペア)」テスト(順方向と逆方向の両方のビデオに対して答えが分かっているテスト)を使用したとき:
- Molmo2は、逆転したビデオを見ている場合でも、順方向のイベントに対して0.965というスコアで回答しました。
- Qwen3-VLは、通常時の0.944から、逆転時には0.576へと低下しました。
これは、2つのモデルが通常のテストでは全く同じ高いスコアを持っていても、一方は「地図(ラベル)」に頼っており、もう一方は「地形(ピクセル)」に頼っているということを証明しています。もし地図を偽物に差し替えれば、最初のモデルは失敗しますが、二番目のモデルはまだ大丈夫かもしれません。
この論文が否定したもの
著者らは、これが単なるグリッチやテストの奇妙なアーティファクトではないことを確認するために、非常に慎重に検証を行いました。
- 単なる「混乱」ではない: 彼らはアクティベーション・パッチング(一方のモデルの脳細胞を、もう一方のモデルの「正しい」脳細胞と入れ替えるような手法)を用いて、この違いが本物であることを証明しました。
- Molmo2の最初のレイヤーの「脳」を修正すると、完璧に回復しました。
- Qwen3-VLの最初のレイヤーの「脳」を修正しても、依然として少し失敗しました。完全に回復させるには、レイヤー0、1、および2(DeepStackという機能が追加の視覚データを注入する場所)まで修正する必要がありました。
- これは、この違いがモデルの構築方法における深く内部的な特性であり、表面的なトリックではないことを証明しています。
- 単なる「タイムスタンプ」ではない: 彼らは、モデルが画面上に書かれた時間(例:「00:01」「00:02」)を読んでいるだけではないかを確認しました。その結果、タイムスタンプが役立つことはあるものの、モデルはタイムスタンプを取り除いた状態でも、依然として位置ラベルやピクセルに大きく依存していることが分かりました。
- 単なる「単一フレームでのズル」ではない: 両方のモデルがこれらの問題を解くために、実際に複数のフレームを必要としていることを示しました(ビデオ全体を見た場合、1フレームの場合よりも**+0.20**のブーストがあります)。したがって、単に1枚の絵から推測しているのではなく、実際にシーケンスを処理していますが、その方法は異なります。
大きな教訓
この論文は、単一の「テンポラル・スコア(時間的スコア)」は誤解を招くものであると結論づけています。それは、2台の車が同じ最高速度を持っていると言いながら、一方はガソリンで走り、もう一方は電気で走っているようなものです。もしガソリンスタンドのない道にドライブに行けば、電気自動車は失敗しますが、最高速度のテストでは同じだったはずです。
- Molmo2は位置優位型です。見たものよりも、不可視のラベル(RoPE)を信頼します。
- Qwen3-VLは視覚シーケンス優位型です。ラベルよりも、見たもの(ピクセル)を信頼します。
著者らは、将来のテストは単に一つの数字を出すだけでなく、**「リバーサル・ドロップ」**を報告すべきであると提案しています。これにより、モデルが「地図」を読んでいるのか、それとも「地形」を読んでいるのかを知ることができます。これは、モデルがどのように失敗するかを理解するのに役立ちます。もし、実際のビデオの内容に注意を払うモデルが必要なら、ラベルを読んでいるだけのモデルを選んではいけません。もし厳格なスケジュールに従う必要があるなら、ラベル読みのモデルを好むかもしれません。しかし、最終的なスコアを見るだけでは、その違いを見分けることはできないのです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。