← 最新の論文
💻 computer science

Flex-Forcing: Towards a Unified Autoregressive and Bidirectional Video Diffusion Model

Flex-Forcingは、柔軟なチャンキングメカニズムを採用することで、グローバルな一貫性のための双方向推論と効率性のための自己回帰生成を組み合わせた統一ビデオ拡散フレームワークであり、それによって、硬直的なベースライン手法と比較して、優れたビデオ品質、長尺ビデオの安定性、およびより高速な推論を実現しています。

原著者: Xinyin Ma, Julius Berner, Chao Liu, Arash Vahdat, Weili Nie, Xinchao Wang

公開日 2026-07-07
📖 1 分で読めます☕ さくっと読める

原著者: Xinyin Ma, Julius Berner, Chao Liu, Arash Vahdat, Weili Nie, Xinchao Wang

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは、30秒間の映画のシーンを描こうとしている画家だと想像してください。あなたには主に2つの方法がありますが、どちらにも欠点があります。

  1. 「後ろから前へ」の画家(双方向型): このアーティストは、キャンバス全体を一度に眺めます。始まり、中間、そして終わりを同時に把握しています。これにより、ストーリーに一貫性が生まれ、照明が一定になり、キャラクターが突然服を着替えたりすることはありません。しかし、非常に時間がかかります。新しい筆を動かすたびに、キャンバス全体を再評価しなければならないからです。
  2. 「一筆ずつ」の画家(自己回帰型): このアーティストは、左から右へと、フレームごとに描いていきます。すでに描いた部分だけを見ます。これは非常に高速でストリーミングにも適していますが、「未来」が見えないため、最初のフレームでは左に歩いていたキャラクターが、最後のフレームでは誤って右に歩いている、といったことが起こり得ます。ストーリーが「漂流」し、一貫性が失われてしまうのです。

Flex-Forcingは、これら両方の良いとこ取りをした新しい「スーパー画家」です。スピードか品質かの二択を強いることはありません。代わりに、状況に応じてこれら2つのスタイルを切り替えられるスマートで柔軟な定規を提供します。

以下に、簡単な比喩を用いてその仕組みを説明します。

1. 柔軟な定規(フレキシブル・チャンキング)

長い本を読んでいるところを想像してください。

  • 従来の方法: 本を一度にすべて読む(遅いが、全編のプロットを把握できる)か、あるいは一単語ずつ読む(早いが、プロットを忘れてしまう可能性がある)かのどちらかです。
  • Flex-Forcingの方法: 「チャンク(塊)」に分けるための定規を使います。
    • プロセスの初期段階(高ノイズ時): ビデオがまだぼやけたアイデアの塊であるとき、Flex-Forcingは大きなチャンクを使用します。ビデオの大きなセクションを一度に眺めることで、大きな絵(カメラの動きやメインシーンなど)を計画します。これにより、ストーリーに強固な構造が生まれます。
    • プロセスの後半段階(低ノイズ時): ビデオが鮮明で詳細になってくると、小さなチャンクに切り替えます。一つひとつの細かいディテール(揺れるロウソクの炎や、特定の表情など)に集中します。これは高速で効率的です。

つまり、このモデルは、どの程度の詳細さが必要かに応じて、「先を見通す」べきか「前へ進む」べきかを判断できる「賢い」仕組みを持っているのです。

2. ノイズ翻訳機(K-Projection)

ここには厄介な問題があります。モデルが「過去」(すでに描いた部分)を見るとき、その部分は非常にクリアで鮮明です。しかし、「未来」(まだ描いていない部分)を見ると、そこはまだぼやけたノイズ混じりの推測に過ぎません。

もし、クリアな写真とぼやけたスケッチを無理に比較しようとすると、それらは一致せず、アーティストは混乱してしまいます。

  • 解決策: Flex-Forcingは、特別な「翻訳機」(K-Projectionと呼ばれます)を使用します。過去と未来を比較する前に、クリアな過去の部分にあえて少しの「ぼかし」を加え、未来の部分のノイズレベルに合わせます。
  • 結果: これにより、モデルは過去と未来を並べて見ても混乱することなく、高速に生成しながらも、ビデオ全体をスムーズに計画できるようになります。

3. 「どこでも編集できる」超能力

このモデルは生成中であってもビデオ全体の構造を理解しているため、通常の高速ペインターにはできないことができます。それは、**「中間を編集しても、終わりを台無しにしない」**という能力です。

  • 通常の高速ペインター: もしあなたが物語の途中で「キャラクターのシャツを変えて」と頼んだら、彼らは最初の計画を見失ってしまうため、最後のフレームでキャラクターの顔まで変えてしまうかもしれません。
  • Flex-Forcing: 「真ん中のシャツを変えて」と言えば、モデルはそれを実行できます。なぜなら、頭の中に「大きな絵」の計画を保持し続けているからです。そのため、動画の終わりは最初と完璧に一致したままになります。本の中の章を書き直すことなく、章を入れ替えるように、どの部分でも自由に編集できるのです。

なぜこれが重要なのか(論文による説明)

論文によれば、Flex-Forcingは以下の2つの重要な点で、現在の最高手法(「Self-Forcing」など)を凌駕しています。

  1. より高い品質: ビデオの一貫性が向上します。キャラクターが奇妙に変形したり、動きがガタついたりすることがありません。
  2. より高いスピード: 高品質な「すべてを見る」モデルよりも、はるかに速くビデオを生成できます。

要するに、Flex-Forcingは、ルートを計画するためのGPSと、高速で走るためのスポーツカーを兼ね備えたビデオ生成器のようなものです。「目的地を知ること」と「速く走ること」のどちらかを選ぶ必要はなく、その両方を同時に実現しているのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →