Do Video-LLMs Actually Watch? Diagnosing Character-Tracking Failures in Long-Form Video
本論文は、現在のVideo-LLMが長尺動画において特定の登場人物を真に追跡することには大きく失敗しており、代わりに浅いジェンダーの手がかりに依存し、同性の個人間を区別できていないことを明らかにしており、このことがベンチマークのスコアが彼らの実際の時間的推論能力およびアイデンティティ追跡能力を過大評価させる原因となっている。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
想像してみてください。あなたは、70億〜80億パラメータを持つ超スマートなロボット探偵を雇い、『ビッグバン・セオリー』のエピソード全編を見守らせることにしました。あなたのミッションはシンプルです。「シェルドンの服装が変わる順番を正確に教えて」というものです。
あなたは、ロボットが鷹のような鋭い目つきでシェルドンの顔を捉え、あらゆるシーンを通じて彼を追跡し、服装の変化を完璧な精度で記録してくれると期待するでしょう。しかし、ここにひねりがあります。ロボットは実際にはシェルドンを見ているわけではありません。 それは単に、非常に怠惰なショートカットに基づいて推測しているだけなのです。
「シェルドン」の入れ替え劇
何が起きているのかを解明するため、研究者たちは巧妙なトリックを使いました。全く同じビデオと全く同じ選択肢を用意した上で、質問内の名前だけを入れ替えたのです。
- 元の質問: 「シェルドンの服装が変わる順番は?」
- 入れ替え後: 「レナードの服装が変わる順番は?」(同じビデオ、同じ回答)
もしロボットが本当にキャラクターを追跡しているなら、「待てよ、レナードはシェルドンとは違う服を着ているぞ!」と気づき、別の答えを選ぶはずです。しかし、なんとロボットは気にしませんでした。
同性の入れ替え(シェルドンをレナードに変えるなど)において、ロボットが答えを変えたケースは**約7%から17%**でした。これはサイコロを振って当てるよりもわずかにマシな程度です。ロボットは名前を無視して、ただ自分が好む答えを選んでいたのです。
「性別」のグリッチ
では、もし人物を見ているのではないとしたら、一体何を見ているのでしょうか? 研究者たちは、ロボットが非常に粗く、ぼやけたフィルターを使用していることを発見しました。それが**「性別」**です。
男性キャラクターを女性キャラクター(シェルドンからペニーなど)に入れ替えると、ロボットは答えを変える確率が大幅に高まりました(20%から43%)。ロボットは、「あ、質問が『男』から『女』に変わったから、服も変わっているはずだ!」と考えているようでした。
しかし、一人の男性を別の男性に入れ替えた場合、ロボットは完全に迷走していました。ロボットはシェルドンとハワードを区別することに関して、猫と犬を区別するよりもさらに無力でした。ロボットは「男性」と「女性」は見えていましたが、「シェルドン」は見えていなかったのです。
「魔法の箱」の錯覚
論文では、ロボットが学習データから番組を暗記して(事前に台本を読んでいるかのように)ズルをしていないかも検証されました。研究者は、ビデオを一切見せず、質問のテキストと番組のタイトルだけをロボットに提示しました。その結果、ロボットのスコアはほぼランダムな確率(約18〜20%)でした。つまり、台本を使ってズルをしていたのではなく、単に視覚的な部分が下手だったのです。
また、より多くのフレーム(ビデオの「スナップショット」)を与えることで、単に見る量が増えれば改善するのかも試されました。16フレームではなく32フレームを与えると、服装全般を捉える能力はわずかに向上しましたが、特定のキャラクターを追跡する能力は依然として向上しませんでした。 それは、盲目の人に性能の良い眼鏡を渡すようなものです。服は見えるようになりましたが、誰がそれを着ているのかは依然として分からないままなのです。
選択肢の罠
ここで最も驚くべきことがあります。標準的なテストにおいて、ロボットは**37〜38%**の正解率を出していました。これは一見、素晴らしい成果に見えます! しかし、そのスコアは蜃気楼でした。
研究者が、リストから選ぶのではなく、自分の言葉で答えを書かせる形式(記述式/Open-Ended)にしたところ、スコアは18〜25ポイントも急落しました。
- 選択式スコア: 約38%
- 記述式スコア: 約13〜19%
なぜこれほど落ち込んだのでしょうか? それは、選択式のテストがロボットに5つの選択肢という「魔法の箱」を与えていたからです。たとえロボットが単に推測していたり、自分が好む答え(「E」や「A」など)を選んでいたとしても、1回につき5回に1回の確率で正解してしまうのです。自力で答えを生成しなければならない状況になると、セーフティネットがなくなり、完全に失敗しました。実際、オープンソースのロボットによる151個の記述式回答のうち、完全に正解したものはゼロでした。
結論
論文は次のように結論づけています。これらのVideo-LLMは、実際にキャラクターを追跡しているわけではありません。彼らは名前とビデオの間のつながりを「幻覚(ハルシネーション)」として作り出しているのです。彼らは「人がシャツを着ていること」を察知するのは得意ですが、「どの人が?」と聞かれると全く太刀打ちできません。
研究者たちは、現在のベンチマークにおける高いスコアは誤解を招くものであると示唆しています。それらはモデルが物語を実際に理解している度合いではなく、性別の手がかりや、運の良い選択式の推測に基づいた能力を測定しているに過ぎないからです。モデルが「名前の入れ替えテスト」と「記述式テスト」の両方をパスできるようになるまで、そのモデルがビデオを本当に「見ている」と言うことはできません。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。