複雑な謎を解こうとしていると想像してください。例えば、映画の一場面で何が起こったのかを突き止めるような場合です。現在のほとんどのAI「探偵」(ビジョン・ランゲージモデルと呼ばれる)は、映画の冒頭で数枚の静止画のみを与えられ、その静止画だけに基づいて謎の全体を解くよう求められます。これらは、映画の表紙アートと脚本の最初の2ページだけを見て、物語の筋書きを推測しようとする人物のようです。彼らは、その後の展開で起こるすべてのアクション、対話、そして決定的な細部を見逃してしまいます。
ACT2SEEは、これらのAI探偵に能動的視覚知覚というスーパーパワーを与える新しいフレームワークです。初期の静止画に縛り付けられるのではなく、ACT2SEEはAIに「待てよ、まだ手がかりが足りないぞ」と気づかせ、より多くの情報を能動的に収集するよう教えます。
その仕組みを簡単なステップに分解して説明します。
1. 「問いかけと行動」のアプローチ
従来の方法では、AIは初期に目にしたものに基づいて推測するだけでした。ACT2SEEでは、AIは思考プロセスを一時停止し、「この特定の瞬間を見る必要がある」とか、「もし~だったらどうなるかを想像する必要がある」と言うように訓練されます。
- 検索(タイムトラベラー): AIが動画内で実際に起こったが、初期の静止画には含まれていなかった特定の瞬間を見る必要がある場合、「検索ツール」を使って動画の中に飛び込み、必要な正確なフレームを取り出します。これは、読んでいる本から特定のページを司書に取ってきてもらうようなものです。
- 生成(昼下りの夢想家): 時には、「もし太陽が沈む前に電車が駅に止まっていたらどうなる?」のように、実際に起こらなかったことに関する質問が出ることがあります。このシーンは動画には存在しないため、AIは「生成ツール」を使って、その仮説的なシナリオの新しい画像を作成します。これは、想像の中だけに存在するシーンを画家がスケッチするようなものです。
2. 訓練キャンプ(教師あり微調整)
彼らはAIにこれをどのように教えたのでしょうか?単に「もっと頑張れ」と指示しただけではありません。非常に賢い「最先端」のAI(Gemini 2.5 Pro)を用いて、特別な訓練キャンプを構築しました。
- 演習: この賢いAIに動画パズルの解決を求めました。AIがさらに視覚的な手がかりが必要だと気づくたびに、「[X] の画像を取ってきて」とか「[Y] の画像を描いて」というメモを書くよう指示されました。
- 品質チェック: どのような回答もそのまま受け入れたわけではありません。AIの推論ステップを、人間が書いた「ゴールドスタンダード」の回答と比較しました。AIの推論が散漫であったり、人間の論理と一致しなかったりする場合、それは破棄されました。AIが正しい視覚的証拠を適切に求めた、高品質な「探偵活動」のみを保持しました。
- 結果: 彼らは、これらの高品質な「探偵ログ」の膨大なデータセット(約3,300例)を作成しました。そのうち約半数のケースで、AIは事件を解決するために新しい画像を取り出したり、描いたりする必要がありました。その後、このデータセットを用いて、より小さく効率的なAIモデル(Qwen3-VL-8B)を訓練しました。
3. 「創発的」な魔法
最もエキサイティングな部分は、訓練されたAIがこれまで見たことのない新しいパズルでテストされたときに何が起こるかです。それは単に硬直したスクリプトに従うわけではありません。AIは、より多くの画像を求めるときを自発的に決定します。
- もし質問が事実的な詳細に関するもの(例:「車の色は何だったか?」)であれば、動画から正確なフレームを検索すべきだと理解します。
- もし質問が「もし~だったら」というシナリオ(例:「もし車が赤かったらどうなるか?」)であれば、その可能性を視覚化するために新しい画像を生成すべきだと理解します。
この「画像で考える」能力と、動的に証拠を集める能力こそが、著者たちが創発的機能と呼ぶものです。まるでAIが突然、「これだけでは解決できない。もっと詳しく見るか、残りを想像する必要がある」と言うことを学んだかのようです。
4. 結果
複雑な論理パズルを含む動画推論ベンチマーク(厳しいテスト)でテストされた際、ACT2SEEは、多くのより大規模で強力なモデルよりも優れたパフォーマンスを発揮しました。
- 自らの2倍のサイズのモデルを打ち破りました。
- 動画フレームを推論に追加しようとしたが、AIにそれらを能動的に決定して使用することを教えることができなかった他の手法を上回りました。
- 「反事実的」な質問(「もし~だったら」というシナリオ)を、他の誰よりもはるかにうまく処理しました。これは、仮説的画像を生成する能力が深い推論にとって決定的に重要であることを証明しています。
まとめ
ACT2SEEを、単に数枚の写真を見つめる受動的な観察者から、証拠を掘り下げるべき時や、想像力を働かせて隙間を埋めるべき時を知る能動的な捜査官へとAIをアップグレードしたものと考えてください。思考プロセスの最中に、必要な視覚情報を能動的に要求したり作成したりすることをAIに教えることで、以前は不可能だったレベルの理解をもって複雑な動画パズルを解決します。
技術的概要:ACT2SEE – ビデオ推論のための創発的能動的視覚知覚
問題定義
現在のビデオ推論を行うビジョン・ランゲージモデル(VLM)は、通常、静的な初期フレームまたは固定されたフレーム毎秒(fps)サンプリングに依存しています。この静的入力パラダイムは、推論プロセスが進化するにつれて、本質的な動的情報を取り込むモデルの能力を制限します。最近の手法は、追加のフレーム情報(例えば、事前に決定されたキーフレームや視覚ツール呼び出し)を用いて思考連鎖(CoT)推論を強化しようと試みていますが、2 つの主要な限界に直面しています:
- CoT の質の最適化不足:既存の手法は、厳密な人間の検証なしに自動化された VLM 生成の正解からフレーム拡張型 CoT を導出することが多く、ノイズの多い一貫性のない推論痕跡につながっています。
- 仮説的シナリオの統合 inability:現在の手法は、反事実的または仮説的な質問(例:「時間的順序が入れ替わったらどうなるか?」)に対処するために、CoT 内で新しい視覚フレームを生成できません。既存の視覚的証拠の検索に限定されており、元のビデオに存在しないシナリオを「想像」することを妨げています。
手法
著者らは、VLM に能動的視覚知覚を付与するために設計されたフレームワーク**Act-to-See(ACT2SEE)**を導入します。この能力により、モデルは推論プロセス中に、既存のフレームを取得するか仮説的なフレームを生成するかを問わず、いつ、どのように新しい視覚情報を収集するかを動的に決定できるようになります。
1. 教師あり微調整(SFT)によるデータセット構築
ACT2SEE の核心は、インタリーブされたビデオ・テキスト CoTを特徴とする高品質な SFT データセットです。構築パイプラインは以下の通りです:
- 最先端モデルによるプロンプト作成:最先端の VLM(Gemini 2.5 Pro)にビデオ推論を実行するようにプロンプトします。重要なのは、モデルが既存の視覚情報が不十分と判断するたびに、特定のクエリと共に専門的なツール呼び出しトークン(
<retrieve> または <generate>)を出力するよう指示されている点です。
- ツール実行:
- 取得:TFVTG(トレーニングフリーのビデオ時間的グラウンディング)を使用して、クエリに一致する関連フレームを見つけるために、より高いサンプリングレート(3 fps)で全ビデオを検索します。
- 生成:Stable Diffusion 3.5 Large を使用して、取得したフレームを条件として視覚的一貫性を確保しつつ、クエリに基づいて新しいフレームを合成します。
- 2 ラウンド完了:プロセスは 2 ラウンドに分割されます。ラウンド 1 では、モデルがツール呼び出しまで推論を生成します。ツールが実行され、新しいフレームが挿入されます。ラウンド 2 では、モデルが新しい視覚的証拠を使用して推論痕跡を完了します。
- 品質管理:高品質なトレーニングデータを確保するために、生成された CoT は、MINERVA、CausalVQA、Social Genome などのベンチマークからの人間が注釈した正解 CoT に対してフィルタリングされます。テキスト埋め込み類似度(BGE M3)が人間による正解に対して 80% を超える場合のみ、痕跡が保持されます。誤った答えにつながる CoT は再生成されます。
2. 学習と推論
- 学習:ベースモデル(Qwen3-VL-8B-Thinking)を構築されたインタリーブデータセットを使用して微調整します。損失関数は、実際の取得/生成された画像トークンを除く、テキスト推論とツール呼び出しクエリを含む、全体のロールアウト全体でトークンレベルの損失を計算します。
- 推論:学習済みモデルは、同じアルゴリズムフローに従います。応答を生成し、
<retrieve> または <generate> トークンが検出された場合、対応するオフラインツールが実行され、新しいフレームがコンテキストに注入され、モデルは最終的な答えを生成するために推論を続けます。
主要な貢献
- 創発的能動的知覚:ACT2SEE は、VLM が推論時にテキスト CoT 内でビデオフレームを能動的にインタリーブすることを可能にし、欠落している事実的証拠の検索や反事実的シナリオの合成を動的に行えるようにします。
- 高品質なインタリーブデータセット:著者らは、47.67% が取得または生成されたフレームを含む 3,373 の推論痕跡のデータセットをキュレーションしました。このデータセットは、以前の自動化された CoT 生成におけるノイズの問題に対処し、推論の質を確保するために、人間の注釈に対して厳密にフィルタリングされています。
- 二重機能(取得+生成):取得または静的キーフレームのみに焦点を当てた先行研究とは異なり、ACT2SEE は、推論ループ内で既存のビデオコンテンツの取得と仮説的視覚証拠の生成的合成の両方を統合しています。
実験結果
ACT2SEE は、5 つの多様なビデオ推論ベンチマーク(Video-MME、VideoEspresso、EgoNormia、VCR-Bench、ViTIB)で評価されました。
- 性能向上:ACT2SEE は、VideoEspresso と ViTIB において新しい最先端の結果を確立しました。これは、同等または大規模なオープンソースモデル(例:InternVL2.5-8B、Video-LLaMA3-7B、Qwen3-VL-8B-Thinking)を上回り、より少ないフレームを使用しているにもかかわらず、VideoEspresso においてクローズドソースの GPT-4o さえも凌駕しています。
- SOTA CoT 手法との比較:このモデルは、Chain-of-Shot、FrameMind、ReWatch-R1 などの他のビデオ・テキストインタリーブ型 CoT 手法を上回ります。
- アブレーション研究:
- データソース:VLM 生成の CoT ではなく、人間が注釈した正解を使用してフィルタリングすることで、性能が大幅に向上します。
- ツール使用:取得と生成の両方を組み合わせることは、どちらか一方のツールを単独で使用する場合よりも良い結果をもたらします。
- プロンプトにおける正解:初期プロンプトフェーズから正解 CoT を除外すると、ツール呼び出しの割合が増加し、下流の性能が向上します。
- 効率性:ACT2SEE は、入力フレーム数を半分にした場合でも、ベースラインと比較してより高い精度をより低い遅延と少ない FLOPs で達成し、パレート支配を示しています。
意義と主張
本論文は、ACT2SEE が複雑なビデオ推論のための VLM に能動的視覚知覚を可能にする重要な進歩であると主張しています。モデルが視覚的証拠の検索または合成のタイミングを能動的に決定できるようにすることで、このフレームワークは静的入力と最適化されていない推論痕跡の限界を克服します。
著者らは、創発的機能を強調しています:推論時に、モデルは曖昧さを解消したり反事実的な質問に答えたりするために、フレームの取得または生成を自発的に決定します。これは明示的にプログラムされた行動ではなく、SFT プロセスを通じて学習された行動です。このアプローチは、静的知覚と複雑な現実世界のシナリオに必要な微妙な時空間ダイナミクスとの間のギャップを埋め、ビデオ推論をより因果的に根ざした動的な理解へと移行させます。この研究は、これらの能力を解き放つために、自動化されたデータ合成に依存するのではなく、高品質で人間が検証したインタリーブデータが不可欠であることを示唆しています。
毎週最高の computer science 論文をお届け。
スタンフォード、ケンブリッジ、フランス科学アカデミーの研究者に信頼されています。
受信トレイを確認して登録を完了してください。
問題が発生しました。もう一度お試しください。
スパムなし、いつでも解除可能。
週刊ダイジェスト — 最新の研究をわかりやすく。登録