← 最新の論文
💻 computer science

Act2See: Emergent Active Visual Perception for Video Reasoning

本論文は、Vision-Language モデルが Chain-of-Thought プロセス内で動的なフレームの検索と合成を能動的に交互に行うことを可能にすることで動画推論を強化する新たなフレームワーク「Act2See」を導入し、それによって複数のベンチマークで最先端の性能を達成することを示す。

原著者: Martin Q. Ma, Yuxiao Qu, Aditya Agrawal, Willis Guo, Paul Pu Liang, Ruslan Salakhutdinov, Louis-Philippe Morency

公開日 2026-05-05
📖 1 分で読めます☕ さくっと読める

原著者: Martin Q. Ma, Yuxiao Qu, Aditya Agrawal, Willis Guo, Paul Pu Liang, Ruslan Salakhutdinov, Louis-Philippe Morency

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

複雑な謎を解こうとしていると想像してください。例えば、映画の一場面で何が起こったのかを突き止めるような場合です。現在のほとんどのAI「探偵」(ビジョン・ランゲージモデルと呼ばれる)は、映画の冒頭で数枚の静止画のみを与えられ、その静止画だけに基づいて謎の全体を解くよう求められます。これらは、映画の表紙アートと脚本の最初の2ページだけを見て、物語の筋書きを推測しようとする人物のようです。彼らは、その後の展開で起こるすべてのアクション、対話、そして決定的な細部を見逃してしまいます。

ACT2SEEは、これらのAI探偵に能動的視覚知覚というスーパーパワーを与える新しいフレームワークです。初期の静止画に縛り付けられるのではなく、ACT2SEEはAIに「待てよ、まだ手がかりが足りないぞ」と気づかせ、より多くの情報を能動的に収集するよう教えます。

その仕組みを簡単なステップに分解して説明します。

1. 「問いかけと行動」のアプローチ

従来の方法では、AIは初期に目にしたものに基づいて推測するだけでした。ACT2SEEでは、AIは思考プロセスを一時停止し、「この特定の瞬間を見る必要がある」とか、「もし~だったらどうなるかを想像する必要がある」と言うように訓練されます。

  • 検索(タイムトラベラー): AIが動画内で実際に起こったが、初期の静止画には含まれていなかった特定の瞬間を見る必要がある場合、「検索ツール」を使って動画の中に飛び込み、必要な正確なフレームを取り出します。これは、読んでいる本から特定のページを司書に取ってきてもらうようなものです。
  • 生成(昼下りの夢想家): 時には、「もし太陽が沈む前に電車が駅に止まっていたらどうなる?」のように、実際に起こらなかったことに関する質問が出ることがあります。このシーンは動画には存在しないため、AIは「生成ツール」を使って、その仮説的なシナリオの新しい画像を作成します。これは、想像の中だけに存在するシーンを画家がスケッチするようなものです。

2. 訓練キャンプ(教師あり微調整)

彼らはAIにこれをどのように教えたのでしょうか?単に「もっと頑張れ」と指示しただけではありません。非常に賢い「最先端」のAI(Gemini 2.5 Pro)を用いて、特別な訓練キャンプを構築しました。

  • 演習: この賢いAIに動画パズルの解決を求めました。AIがさらに視覚的な手がかりが必要だと気づくたびに、「[X] の画像を取ってきて」とか「[Y] の画像を描いて」というメモを書くよう指示されました。
  • 品質チェック: どのような回答もそのまま受け入れたわけではありません。AIの推論ステップを、人間が書いた「ゴールドスタンダード」の回答と比較しました。AIの推論が散漫であったり、人間の論理と一致しなかったりする場合、それは破棄されました。AIが正しい視覚的証拠を適切に求めた、高品質な「探偵活動」のみを保持しました。
  • 結果: 彼らは、これらの高品質な「探偵ログ」の膨大なデータセット(約3,300例)を作成しました。そのうち約半数のケースで、AIは事件を解決するために新しい画像を取り出したり、描いたりする必要がありました。その後、このデータセットを用いて、より小さく効率的なAIモデル(Qwen3-VL-8B)を訓練しました。

3. 「創発的」な魔法

最もエキサイティングな部分は、訓練されたAIがこれまで見たことのない新しいパズルでテストされたときに何が起こるかです。それは単に硬直したスクリプトに従うわけではありません。AIは、より多くの画像を求めるときを自発的に決定します。

  • もし質問が事実的な詳細に関するもの(例:「車の色は何だったか?」)であれば、動画から正確なフレームを検索すべきだと理解します。
  • もし質問が「もし~だったら」というシナリオ(例:「もし車が赤かったらどうなるか?」)であれば、その可能性を視覚化するために新しい画像を生成すべきだと理解します。

この「画像で考える」能力と、動的に証拠を集める能力こそが、著者たちが創発的機能と呼ぶものです。まるでAIが突然、「これだけでは解決できない。もっと詳しく見るか、残りを想像する必要がある」と言うことを学んだかのようです。

4. 結果

複雑な論理パズルを含む動画推論ベンチマーク(厳しいテスト)でテストされた際、ACT2SEEは、多くのより大規模で強力なモデルよりも優れたパフォーマンスを発揮しました。

  • 自らの2倍のサイズのモデルを打ち破りました。
  • 動画フレームを推論に追加しようとしたが、AIにそれらを能動的に決定して使用することを教えることができなかった他の手法を上回りました。
  • 「反事実的」な質問(「もし~だったら」というシナリオ)を、他の誰よりもはるかにうまく処理しました。これは、仮説的画像を生成する能力が深い推論にとって決定的に重要であることを証明しています。

まとめ

ACT2SEEを、単に数枚の写真を見つめる受動的な観察者から、証拠を掘り下げるべき時や、想像力を働かせて隙間を埋めるべき時を知る能動的な捜査官へとAIをアップグレードしたものと考えてください。思考プロセスの最中に、必要な視覚情報を能動的に要求したり作成したりすることをAIに教えることで、以前は不可能だったレベルの理解をもって複雑な動画パズルを解決します。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →