友人に映画を説明しようとしているが、使える単語数に制限がある状況を想像してください。
従来の方法:「グリッド」アプローチ
現在、ほとんどの AI モデルは、画面の小さな正方形(ピクセル)の巨大なグリッドを監視員が見ているように動画を視聴しています。動画が再生されるたびに、AI はすべてのフレームのすべての単一の正方形に対してメモを書き留めなければなりません。
- 問題点: 動画が長い場合、またはカメラが静止した壁を単にパンしている場合、AI は空の空間や同じ壁について何千回も何千回もメモを書き留めます。何も起こらない 1 分間の動画に対して「壁、壁、壁、壁」と書き続けるようなものです。これは膨大なコンピュータメモリとエネルギーを浪費します。
- 欠陥: AI が「退屈な」メモを削除しようとしても、カメラが動くと混乱することがよくあります。なぜなら、それは実際の物体ではなく、まだ単に正方形を見ているだけだからです。
新しい方法:「一つの軌跡、一つのトークン」
この論文(TrajViT)の研究者たちは、映画を見るより賢い方法を見つけ出しました。正方形のグリッドを見るのではなく、彼らは「動きの物語」を見ています。
彼らは動画を、シーン内を移動するキャラクター(物体)の集合として扱います。
- 比喩: サッカーの試合を想像してください。
- 従来の AI: 各フレームで、すべての草の葉、すべての土の粒、そして空のすべての部分を数えます。カメラがパンすると、草を再度数えます。
- TrajViT: 「わかった、サッカーボールが左から右へ動き、選手がそれを追いかけて走っている」と言います。そして、ボールの全経路に対して単一のメモを、選手の経路に対しても単一のメモを作成します。
- 結果: 1 分間の動画に対して何千ものメモが必要だった代わりに、AI は物体の旅程ごとに必要なメモを数十個に減らすことができます。
どのように実現したか(「探偵」パイプライン)
これを機能させるために、彼らは 3 段階のプロセスを構築しました。
- 始まりの発見: 動画のスキャンを行い、新しいものが現れる「重要な瞬間」(フレームにボールが入ってくるなど)を見つけます。
- 痕跡の追跡: 一時的に隠れたりカメラが揺れたりしても、それらの物体が移動するにつれて追跡するシステムを使用します。
- 旅程の要約: 物体の全経路(その「軌跡」)を取り、その物体がどのように見え、どこへ行ったかを AI に伝える単一の賢い「トークン」(デジタル要約)に圧縮します。
なぜこれが重要なのか
この論文は、この新しい方法が主に 2 つの理由でゲームチェンジャーであると主張しています。
- はるかに速く、軽量である: ピクセルを数えるのではなく、動き全体を要約しているため、従来の方法よりもメモ(トークン)を 10 分の 1しか使用しません。これにより、コンピュータははるかに少ないエネルギーとメモリを使用します。
- 実際に賢い: 少ないメモを使用しているにもかかわらず、AI は動画をよりよく理解します。テストでは、以下の点で優れていました。
- テキストの説明に基づいて動画を見つけること(例:「犬がボールを追いかける動画を探せ」)。
- 動画で何が起こったかについての質問に答えること。
- 長い動画であっても、動作を認識すること。
「VideoLLM」テスト
研究者たちはまた、この新しいシステムを「動画大規模言語モデル」(動画について会話できる AI)に接続しました。
- 結果: 新しいシステムを使用した AI は、トレーニングが4 倍速くなり、標準システムと比較して実行に必要な計算能力が18 倍少なくて済みました。それにもかかわらず、動画に関する質問により正確に答えました。
要約すると
従来の方法は、すべてのページのすべての文字を数えることで本を理解しようとするようなものです。新しい方法(TrajViT)は、文章を読み、プロットを理解します。それは空の空間を無視し、キャラクターと彼らの旅程に焦点を当てるため、動画で実際に何が起こっているかを理解する際に、はるかに速く、安価で、正確になります。
技術的概要:1 つの軌跡、1 つのトークン
問題定義
固定された時空間パッチ(例:ViT3D)への分割に依存する既存の動画トークン化手法は、顕著なスケーラビリティの課題に直面している。動画の長さが増加するにつれてトークン数が線形に増加し、メモリボトルネックや計算効率の低下を招く。さらに、このパッチベースのパラダイムはシーンの複雑さを無視しており、同じ長さの静的なシーンと動的な動作シーンは、同一数のトークンを生成する。既存のトークン削減戦略(パッチのドロップやマージなど)は、モデル性能を劣化させたり、カメラ運動が存在する際に時間的整合性を維持できたりしないことが多い。加えて、これらの手法は、3D 畳み込みや時空間パッチマッピングへのアーキテクチャ依存性により、画像データをシームレスに統合することに苦慮している。
手法:グラウンデッド動画トークン化
著者らは、グラウンデッド動画トークン化と呼ばれる新しいパラダイムに基づく動画エンコーダTrajViTを提案する。固定されたパッチの代わりに、TrajViT はパンオプティックなサブオブジェクト軌跡を中心にトークンを編成する。このアプローチは、知覚の原則(Spelke の核心的認知原則および共通運命のゲシュタルト原則)と整合しており、物体の部品を時間的に持続する一貫した実体として扱う。
システムは 2 つの主要なコンポーネントで構成される:
パンオプティックサブオブジェクト軌跡抽出パイプライン:
- キーフレーム検出: 新しい物体が現れる可能性のあるキーフレームを検出することで、動画をクリップに分割する。これは、並列化可能なアルゴリズムを用いて連続するフレーム間の色ヒストグラムと輝度強度を比較することで達成される。
- セグメンテーションとトラッキング: 各クリップ内で、パイプラインは軽量セグメンターであるDirectSAMを用いてキーフレーム内のすべての物体をセグメント化する。その後、トラッカーであるSAM2を用いて、これらのマスクをクリップ内の後続のフレームに伝播させる。
- マージ: 複数のクリップにまたがる物体を処理するために、システムは 1 つのクリップの最終フレームと次のクリップの最初のフレームの間で追加のトラッキングステップを実行する。高い交差率(IoU)を持つセグメントはマージされ、動画全体を通じて物体の同一性を維持する。
- 出力: このプロセスは、各軌跡が時間を通じて異なる物体またはサブオブジェクトを表す一連の軌跡を生成する。
軌跡エンコーダ:
- 外観符号化: 各軌跡について、モデルは軽量畳み込みネットワーク(ResNet-18)から階層的な視覚特徴を抽出する。各フレームのセグメンテーションマスク内で特徴を集約するためにマスクプーリングを適用する。
- 時間的位置符号化: 各フレームにおける軌跡のバウンディングボックス座標を、正弦波埋め込みを用いて高次元ベクトルにマッピングする。
- 集約: 外観と時間的位置の両方のシーケンス(長さが可変)は、Perceiver Resamplerによって処理される。このモジュールは、単一の学習可能なクエリを用いてフレームレベル特徴のシーケンスに注意を向け、それらを単一の固定サイズ埋め込みへと圧縮する。
- 最終トークン: 軌跡トークンは、外観と時間的位置の埋め込みを合計することで形成される。これらのトークンは、標準的なトランスフォーマーエンコーダへの入力として機能する。
主要な貢献
- 新しいトークン化パラダイム: 本論文は、「グラウンデッド動画トークン化」を導入する。ここでは、トークン数は動画の長さやフレーム数ではなく、異なる物体軌跡の数と相関する。これは本質的にシーンの複雑さを反映する。
- TrajViT アーキテクチャ: パンオプティックなサブオブジェクト軌跡を抽出し、それらを意味的に意味のある固定サイズトークンに変換する新規エンコーダであり、基盤となるトランスフォーマーアーキテクチャを変更することなく実現される。
- シームレスな画像・動画統合: 画像と動画に対して別々の事前学習パイプラインを必要とする時空間パッチ手法とは異なり、TrajViT は長さ 1 の軌跡として画像セグメントを扱うため、単一ステージで画像データと動画データの共同学習を可能にする。
- 効率性: この手法は、時間的整合性を維持し、照明変化、遮蔽、カメラ運動に対する頑健性を保ちながら、トークン数を大幅に削減する(例:Panda データセットで 10 倍の削減)。
実験結果
TrajViT は、標準的な ViT3D および最先端のトークンマージベースライン(ToMe、AutoMerge、RLT など)に対して、複数のベンチマークで評価された:
- 動画・テキスト検索: ActivityNet、VATEX、MSR-VTT、Charades などのデータセットにおいて、TrajViT は ViT3D を大幅に上回る性能を示した(平均でトップ 5 リコールが 6% 向上など)が、使用トークン数は10 分の 1であった。
- 動作分類: TrajViT は Kinetics-400 および UFC-101 で優れた性能を達成した。Something-Something V2(SSV2)では、トークンマージ手法を上回ったが、ViT3D よりもわずかに劣った。著者らはこれを、モデルが単純な自己中心視点のシーンにおける複雑な動作を過剰に圧縮したことに起因すると説明している。
- 微細なタスク: TrajViT は、空間時間的動作検出(AVAv2)および時間的クリップ検索において大幅な改善を示した。これは、時間を通じての物体軌跡の一貫性に起因する。
- VideoLLM パフォーマンス: VideoLLM(Llama-3 使用)の動画エンコーダとして統合された場合、TrajViT-LLM は 6 つの VideoQA ベンチマークで平均**5.24%**の精度向上を ViT3D-LLM に対して達成した。これは、トレーニング時間が 4 倍高速であり、推論 FLOPs が 18 倍少ない状態で実現された。
- スケーリング: TrajViT は、入力フレーム数の増加(長動画まで)および大規模な事前学習データセット(200 万から 800 万動画)に対して、優れたスケーリング挙動を示した。また、ViT3D に比べて画像データ(DataComp-50M)の追加による恩恵をより多く受けた。
意義と主張
著者らは、TrajViT が精度を犠牲にすることなく効率性を追求し、多様な動画分析タスクにおいて一貫して ViT3D を上回る最初の効率的なエンコーダであると主張する。トークンを物体軌跡にグラウンディングすることで、この手法はパッチベースのトークン化の根本的な非効率性を解決し、長動画理解のための堅牢でスケーラブルな解決策を提供する。本論文は、このアプローチがモデルにシーンの長さではなく、シーンの意味的複雑さに焦点を当てさせることを強調しており、物体中心のタスクや長編動画分析において特に効果的であると述べている。また、著者らは軌跡生成パイプラインがいくつかのオーバーヘッドをもたらすものの、64 フレームを超える動画においてはシステム全体としてより効率的であると指摘している。
毎週最高の AI 論文をお届け。
スタンフォード、ケンブリッジ、フランス科学アカデミーの研究者に信頼されています。
受信トレイを確認して登録を完了してください。
問題が発生しました。もう一度お試しください。
スパムなし、いつでも解除可能。
週刊ダイジェスト — 最新の研究をわかりやすく。登録