← 最新の論文
💻 computer science

SSM Meets Video Diffusion Models: Efficient Long-Term Video Generation with Structured State Spaces

本論文は、アテンション機構の二次的な計算量の制限を克服するために、双方向構造状態空間モデル(SSM)を効率的な時間的特徴抽出器としてビデオ拡散モデルに統合することを提案し、メモリ消費量を大幅に削減しながら高品質な長期ビデオ生成を可能にするものである。

原著者: Yuta Oshima, Shohei Taniguchi, Masahiro Suzuki, Yutaka Matsuo

公開日 2026-06-30
📖 1 分で読めます☕ さくっと読める

原著者: Yuta Oshima, Shohei Taniguchi, Masahiro Suzuki, Yutaka Matsuo

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

大きな問題:ビデオAIにおける「交通渋滞」

あなたがロボットに、フレームごとに映画を描く方法を教えようとしていると想像してください。映画を滑らかで論理的なものにするためには、ロボットは前のフレームで何が起きたかを記憶し、次に何が起こるかを予測する必要があります。

現在のAIモデル(拡散モデルと呼ばれます)はこれを得意としていますが、長い動画を作る際に大きなボトルネックに直面します。彼らは**アテンション(Attention)**と呼ばれる仕組みを使用しています。アテンションを、必要な本を見つけるために図書館にあるすべての本を読まなければならない「司書」だと考えてください。

  • 短い動画(16フレーム): 図書館は小さいです。司書は素早く本を見つけます。
  • 長い動画(256フレーム): 図書館は膨大です。司書は接続点を見つけるために、あらゆる本とあらゆる他の本を照らし合わせなければなりません。作業量は単に2倍になるのではなく、4倍になります。これはコンピュータのメモリと処理能力に「交通渋滞」を引き起こし、長い動画を生成することを非常に高価で遅いものにします。

解決策:「状態空間」のエクスプレス・レーン

この論文の著者たちは、AIの「記憶」の部分を扱う新しい方法を提案しています。それは、司書を状態空間モデル(SSM)、具体的にはMambaと呼ばれるタイプに置き換えることです。

SSMを、司書の代わりに高速列車だと考えてみください。

  • 毎回すべての履歴を読み直す代わりに、列車は自分がどこを通ってきたかの「要約」を運んでいます。
  • 次の駅(次のビデオフレーム)に移動する際、新しい駅に基づいて要約を更新するだけです。
  • 結果: 列車が16マイル進むときも256マイル進むときも、かかる時間と燃料(計算コスト)は、予測可能な直線的な形で増加します。司書の方法のようにコストが爆発することはありません。

彼らが実際にやったこと

研究者たちはビデオ生成器を構築し、その「アテンション」エンジンをこの新しい「SSM」エンジンに交換しました。彼らは3つの異なるビデオデータセットでテストを行いました。

  1. MineRL Navigate: マインクラフトのような世界をナビゲートするロボット。
  2. GQN-Mazes: 3D迷路を解くロボット。
  3. CARLA-Town01: 自動運転車のシミュレーション。

彼らは、短いクリップ(16フレーム)から長いシーケンス(256フレーム)までのビデオをテストしました。

主な知見

1. 長尺ビデオの勝者
短い動画(16フレーム)を生成する場合、新しいSSM手法と従来のAttention手法は互角でした。しかし、**長い動画(256フレーム)**を生成しようとすると、SSM手法が大幅にリードしました。

  • 比喩: これは、短いドライブウェイで自転車とスポーツカーを比較しているようなものです(どちらも問題ありません)。しかし、200マイルのハイウェイでは、スポーツカー(SSM)の方が速く目的地に到達し、ガソリンも節約できますが、自転車(Attention)は疲れ果てて速度が落ちてしまいます。
  • 証拠: SSMモデルは、Attentionモデルよりも少ないメモリ少ない時間を使用して、より高品質なビデオ(FVDと呼ばれるスコアで測定)を生成しました。

2. 秘訣:双方向の交通量とスマートなフィルタリング
研究者たちは、単にエンジンを入れ替えるだけでは不十分であり、最高の結果を得るためには2つの特定の方向にチューニングする必要があることを見出しました。

  • 双方向性(Two-Way Traffic): 標準的なSSMは前方のみ(過去から未来へ)を見ます。研究者たちは、モデルに両方向(過去と未来の両方)を見せました。
    • 比喩: 車を運転している場面を想像してください。フロントガラス越しに前だけを見ていたら、横から車が飛び出してくることに気づかないかもしれません。バックミラー(未来のコンテキスト)も見ることで、AIはシーン全体をより良く理解できます。
  • 選択的スキャン(Selective Scans / スマートなフィルタリング): モデルは、退屈で繰り返しの多いフレームを無視し、重要な変化に集中することを学習しました。
    • 比喩: 小説を読んでいる場面を想像してください。もし10ページにわたって同じ空っぽの廊下が描写されていたら、あなたは読み飛ばします。しかし、キャラクターが部屋に入ってきたら、注意深く読みます。SSMはこれを自動的に行い、「記憶」を重要な瞬間のために新鮮に保ちます。

まとめ

この論文は、長い動画を作成するためには、従来のAttention手法よりも状態空間モデル(SSM)を使用する方が賢明で効率的であることを証明しています。これにより、コンピュータは非常に高価なハードウェアを必要とせずに、より長く滑らかな動画を生成できるようになり、実質的にビデオAIを制限してきたメモリの限界を回避するための「チートコード」を研究者に提供しています。

注:この論文は、技術的なアーキテクチャと特定のデータセットにおけるパフォーマンスに厳密に焦点を当てています。これらのモデルが現在、医療診断、リアルタイムセキュリティ、または商業的な映画制作に即座に使用できると主張しているのではなく、長期間のビデオ生成という特定のタスクにおいて優れたアーキテクチャの選択肢であることを示しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →