MAVEN: A Multi-stage Agentic Annotation Pipeline for Video Reasoning Tasks
MAVEN は、階層的な洗練とドメイン適応を通じて Chain-of-Thought 痕跡を伴う高品質で構造化された動画推論データを自動的に生成する多段階のエージェント型パイプラインであり、これにより複雑な事象推論ベンチマークにおける微調整済み視覚言語モデルの性能を大幅に向上させる。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
ロボットに複雑な映画のシーン、例えば交通事故や倉庫内での喧嘩を理解させる方法を想像してみてください。単に生動画をロボットに見せて「何が起きた?」と尋ねるだけでは、ロボットは混乱したり、細部を見逃したり、事実を捏造したり(幻覚)する可能性があります。
この論文は、これらのロボットのために超組織的な「脚本家」かつ「教師」として機能するように設計されたスマートシステム「MAVEN」を紹介しています。MAVEN は単にロボットに動画を与えるのではなく、まず動画を構造化された物語に分解し、その物語を用いて訓練用の質問を作成します。
以下に、簡単な比喩を用いて MAVEN の仕組みを説明します。
1. 3 段階の「ズームイン」プロセス
多くのシステムは、休暇の簡単な要約を述べる観光客のように、動画全体を一度に説明しようとします。そのため、小さくも重要な詳細を見落としがちです。MAVEN はこれとは異なり、3 段階の「ズーム」アプローチを使用します。
- 第 1 段階:広角ショット(グローバルコンテキスト) まず、シーン全体を見渡します。雨は降っているか?昼か夜か?通りの様子はどのようか?これが舞台設定となります。
- 第 2 段階:タイムライン(密なイベント) 次に、主要なイベントのタイムラインを作成し、物事がいつ始まり、いつ終わったかを正確に記録します。
- 第 3 段階:クローズアップ(微細な詳細) 最後に、小さな短いクリップにズームインして、人が周囲をうかがうような微妙な動きや、小さな物体が拾われるような細部を捉えます。
2. 「マスター設計図」(MSTED)
ここが最も重要な部分です。MAVEN は、いきなり質問を生成するのではなく、上記の 3 つの説明をすべて統合し、**「マスター設計図」**と呼ばれる単一の完璧な設計図、MSTEDを作成します。
これは、証人を尋問する前に探偵が完全な事件ファイルを作成するようなものです。
- なぜ重要か: ロボットが動画から直接答えを推測しようとすると、事実を捏造する可能性があります。しかし、ロボットがまず「マスター設計図」を読むことを強制されれば、そこに明示的に書かれていることに基づいてのみ回答できます。設計図が使用を許可された唯一の真実の源であるため、事実を捏造することはできません。
3. 「スマート編集者」(エージェント駆動型適応)
通常、新しいトピック(例えば、交通カメラから倉庫のセキュリティへ切り替えるなど)をロボットに教えたい場合、ロボットへの指示をすべて手動で書き直す必要があります。これには多くの人的時間がかかります。
MAVEN には、組み込み型の**「スマート編集者」**(AI エージェント)があります。
- 仕組み: 編集者に新しい世界の説明(例:「これは高い棚とフォークリフトがある倉庫です」)と、いくつかの例題を与えるだけです。
- 魔法: 編集者は自動的に上記の 3 段階のすべての指示を書き換えます。「ああ、倉庫では、車が赤信号を無視するだけでなく、シャツの下に隠れたものを探す必要がある」と判断します。これは、人間がコードに触れることなく行われます。
4. 「品質管理ループ」
人間が回答を確認して誤りを発見した場合、MAVEN は単に「おっと」と言うだけではありません。自らの失敗を調査する探偵のように行動します。
- 問いかけます:「動画の説明で詳細を見落としたのか、それとも適切な質問ができなかったのか?」
- 説明が悪ければ、説明のプロンプトを修正します。
- 構造に問題があった場合(例:動画のチャンクが短すぎてイベントを半分に切断してしまったなど)、構造的な問題を修正するためにパイプラインに新しいステップを追加します。
彼らが達成したこと
チームは MAVEN を使用して、街路カメラと車のダッシュカムからの5,300 本以上の交通動画にラベル付けを行いました。その後、このデータを用いてCosmos-Reason2と呼ばれるロボットモデルを訓練しました。
- 結果: 訓練されたロボットは推論において驚くほど優れていました。非公開のテストでは、Gemini 2.5 ProやGemini 3.1 Flashといったトップクラスのモデルを凌駕しました。
- 驚き: 街路カメラ(CCTV)の動画のみで訓練されたにもかかわらず、ダッシュカムテストにおいても大規模モデルと同等のパフォーマンスを発揮しました。これは、ロボットが単に車の外見を記憶したのではなく、イベントについてどのように推論するかを学んだことを示唆しています。
- 汎用性: 「スマート編集者」に指示の適応を任せるだけで、倉庫の動画やトンネル内の喧嘩などの公共安全映像でもシステムが機能することを示しました。これにより、人間の再設計なしに異なる世界に対応できることが証明されました。
要約: MAVEN は、無秩序な動画を完璧で構造化された物語に変換し、その物語を用いてロボットに論理的思考を教え、新しい環境に自動的に適応できる自己修正型の編集者を備えたシステムです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。