← 最新の論文
💻 computer science

Video Active Perception: Effective Inference-Time Long-Form Video Understanding with Vision-Language Models

本論文は、能動的知覚理論と軽量なテキスト条件付き動画生成モデルを活用して重要フレームを動的に選択する学習不要な手法「Video Active Perception(VAP)」を導入し、追加の学習を必要とせずに長編動画の質問応答における大規模視覚言語モデルの効率性と推論能力を大幅に向上させるものである。

原著者: Martin Q. Ma, Willis Guo, Aditya Agrawal, Ankit Gupta, Paul Pu Liang, Ruslan Salakhutdinov, Louis-Philippe Morency

公開日 2026-05-05
📖 1 分で読めます☕ さくっと読める

原著者: Martin Q. Ma, Willis Guo, Aditya Agrawal, Ankit Gupta, Paul Pu Liang, Ruslan Salakhutdinov, Louis-Philippe Morency

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたが 30 分間のセキュリティカメラ映像を見て、ある謎を解こうとしていると想像してください。あなたの目標は、「その人は財布を盗んだか?」のような特定の質問に答えることです。

従来の方法:網羅的な視聴
現在、最も賢い AI「探偵」(ビジョン・ランゲージモデルと呼ばれる)は、この問題を解決するために、一定のリズムでフレームごとに映像全体を視聴しようとします。まるで、何も起きていない瞬間さえ含めて、テープのすべての秒数を監視する警備員を雇うようなものです。

  • 問題点: これは信じられないほど遅く、高価です。まるで、500 ページの書籍からたった 1 つの特定の文を見つけるために、すべての単語を読み通すようなものです。しばしば、AI は歩く人々や静止した背景といった退屈な部分に圧倒され、疲れすぎたり動画が長すぎたりするために、決定的な瞬間を見逃してしまいます。

新しいアイデア:ビデオ・アクティブ・パーセプション(VAP)
カーネギーメロン大学と MIT の研究者たちは、ビデオ・アクティブ・パーセプション(VAP) というより賢い戦略を考案しました。彼らは AI に「もっと」見ることを教えたのではなく、「違う方法」で見ることを教えたのです。

VAP を、期待の結晶球を持った探偵だと考えてください。

  1. 結晶球(「事前知識」):
    映像全体を見る前に、AI は「結晶球」(軽量な動画生成モデル)を用いて、最初の数フレームと質問に基づき、次に何が「起こるべきか」を推測します。

    • 比喩: あなたがテニスラケットとボールを持った人を見ると想像してください。あなたの「結晶球」は、その人がおそらくボールを打つ、走る、またはサーブをすると予測します。それは何が「期待されるか」の精神的な映画を作成します。
  2. 「驚き」検出器:
    次に、AI は「実際の」映像を観察します。そして、実際の映像と「結晶球」による予測を常に比較します。

    • もしその人がただ立って何もしなければ、実際の映像は予測と一致します。AI は「退屈だ、これを保存する必要はない」と考えます。
    • しかし、その人が突然窓に向かってボールを投げた場合(結晶球が予測していなかったこと)、AI は「驚き!」という信号を受けます。
    • 魔法: AI は、「この瞬間は私の予想とは異なる!これは質問に答えるために必要な重要な情報だ」と気づきます。
  3. 選択:
    映像全体を保存する代わりに、AI は現実が予測から逸脱した特定のフレームのみを抽出します。退屈な部分はスキップし、「驚き」や「情報価値のある」瞬間に完全に集中します。

これが画期的な理由
この論文は、この方法が以下の 2 つの理由でゲームチェンジャーであると主張しています。

  • はるかに高速(効率性): 「驚き」のあるフレームのみを見ることで、AI は標準的な方法よりも5.6 倍少ないフレームを使用して質問に答えることができます。まるで、500 ページすべてを読む代わりに、本の中で最も重要な 10 ページだけを読んで謎を解くようなものです。
  • より賢い(有効性): 実際に重要な瞬間(「驚き」)に焦点を当てるため、特に因果関係やタイミングの理解を必要とする難しい質問に対して、より正確に回答します。

結果
研究者たちは、この「驚き検出器」をいくつかのビデオクイズ(EgoSchema や NExT-QA など)でテストしました。その結果、VAP は以下の点で優れていることがわかりました。

  • 従来の方法で動画を視聴するトップ AI モデル(GPT-4o や Gemini など)よりも高いスコアを記録しました。
  • 計算能力のほんの一部でこれを実現しました。
  • 新しいデータで再学習する必要なく機能しました。「思考」段階で巧妙なトリックを使用するだけです。

要約すると
ビデオ・アクティブ・パーセプションは、映画全体を盲目的に視聴する代わりに、AI に何が「起こるべきか」を想像させ、その後、脚本を破る映像の部分にのみ注意を払うようにします。これにより、AI はより速く、安価になり、驚くほどビデオの謎を解くのが上手になります。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →