あなたが、キャラクターと会話でき、現実的に動き、周囲の世界が物理法則に従う、終わらない映画を作ろうとしていると想像してください。これが「ワールドモデル」の目標です。しかし、これらの映画を作るのは非常に困難です。なぜなら、コンピューターは数秒後に混乱したり、メモリが満杯になったり、キャラクターが怪物に変形し始めたりするからです。
この論文は、これらの問題をブロック拡散と呼ばれる巧妙なトリックを使って解決するために設計された、新しい「映画制作エンジン」Inferixを紹介します。
それがどのように機能するかを、簡単なアナロジーで説明します。
1. 古い方法と新しい方法
Inferix を理解するには、コンピューターが以前に動画をどのように作成していたかを見る必要があります。
- 「自己回帰的」な方法(遅い書き手): 一語ずつ物語を書く作家を想像してください。「The」を書き、次に「cat」を書き、次に「sat」を書きます。彼らはどんな長さの本でも書けますが、次の言葉を書く前にそれぞれの言葉を待つ必要があります。それは遅く、もし彼らが早い段階で間違いを犯せば、物語全体がおかしくなってしまいます。
- 「拡散」の方法(画家): 静的なノイズでいっぱいのキャンバスから始めて、ゆっくりとそれを消去して絵を現出させる画家を想像してください。彼らは一度に絵全体を描くことができます(非常に速い)が、描けるのは固定サイズのキャンバスだけです。長い映画を描こうとすると、スペースが足りなくなり、物語が崩壊してしまいます。
- 「ブロック拡散」の方法(編集者のチーム): Inferix はこの新しい方法を使用します。映画に取り組む編集者のチームを想像してください。彼らは一語ずつ書いたり、映画全体を一度に描いたりしません。代わりに、**チャンク(ブロック)**で作業します。
- 彼らは画家の技術(拡散)を使用して、5 秒間のシーン(ブロック)を生成します。
- 重要なのは、前のシーンで何が起こったかの「メモ帳(KV キャッシュ)」を保持することです。
- 次の 5 秒間のブロックを開始する際、彼らはキャラクターと背景が一貫していることを確認するためにメモ帳を読み取ります。
- これにより、高品質で高速な無限長の映画を作成することが可能になります。
2. Inferix が実際にすること
Inferix は、この「編集者のチーム」を効率的に機能させる専門ツールです。Inferix 以前は、これらのモデルを実行しようとするのは、レンガでいっぱいのバックパックを背負ってマラソンを走るようなものでした。Inferix はそのレンガを取り除きます。
- メモリマネージャー(KV キャッシュ): 映画が長くなるにつれて、「メモ帳」は巨大になります。Inferix は、コンピューターが棚のスペース不足に陥らないようにこれらのメモ帳を整理する、超効率的な司書のようなものです。どのページを保持し、どのページを片付けるべきかを正確に知っているため、コンピューターがクラッシュすることなく映画を数分間続けることができます。
- 並列チーム(分散コンピューティング): 1 台のコンピューターがすべての作業を行おうとするのではなく、Inferix は映画制作の仕事を複数のコンピューター(GPU)に分割して、それらが協力して作業するようにします。まるで 100 人の編集者が異なるシーンに同時に取り組んでから、それらを完璧に縫い合わせるようなものです。
- ストリーミング機能: Inferix は、映画が完成するまで結果を表示するのを待つだけではありません。作成中の動画をストリーミングできます。まるでカメラがリアルタイムで未来を撮影している生放送のニュースのように、シーンが生成されている間にスクリプト(プロンプト)を変更することが可能です。
3. 「InterVBench」テスト
コンピューター生成の映画が実際に良いかどうか、どのようにしてわかりますか?10 分間の動画を見ただけでは、メインキャラクターの顔がゆっくりと変化したり、背景が揺れ始めたりすることに気づかないかもしれません。
チームはInterVBenchと呼ばれる新しいテストを作成しました。
- アナロジー: 絵画を見るだけでなく、10 分間の映画を見て、元の計画から「雰囲気」がどの程度ずれているかを正確に測定する審査員を想像してください。
- 指標: 彼らは**ビデオドリフト誤差(VDE)**と呼ばれるスコアを発明しました。これは、「キャラクターの顔は同じままだったか?」「背景は安定していたか?」「動きは滑らかだったか?」といったものを測定します。
- データ: 彼らは、数秒ごとに詳細な説明が付いた、1,000 の現実世界の長編動画(ダンス、動物、自然)のライブラリを構築し、テストのための「ゴールドスタンダード」として使用しました。
4. これがなぜ重要なのか(論文によると)
この論文は、Inferix は単に高速な動画生成器ではなく、「ワールドシミュレーション」の基盤であると述べています。
- それは単にきれいな絵を作ることを超えて、インタラクティブで物理的に現実的な世界を創造することへと進歩します。
- それは長編生成(数秒ではなく数分間の動画を作る)という具体的な問題を解決します。
- それは研究者が技術的なボトルネックに陥ることなく、これらの複雑なシステムを構築するための必要なツール(プロファイリング、ストリーミング、メモリ管理)を提供します。
要約すると: Inferix は、コンピューターが短く静的なクリップを作るのをやめ、管理可能なチャンクに分割し、プロのようにメモリを管理することで、長く、インタラクティブで、一貫性のある「未来の映画」を生成し始めることを可能にするエンジンです。
提供された論文に基づき、世界シミュレーション向けに設計された次世代推論エンジン「Inferix」の詳細な技術的概要を以下に示します。
1. 問題定義
長尺で物理的に現実的かつ双方向的なビデオを生成可能な**World Models(世界モデル)**の登場は、既存のフレームワークでは適切に対処できない重大な推論のボトルネックに直面しています:
- 現在のパラダイムの限界:
- 標準的なビデオ拡散モデル(DiT): KV キャッシュなしの双方向アテンションを使用します。並列化は可能ですが、長系列には非効率的であり、固定長に制限され、時間の経過とともに「ドリフト」したり文脈を忘却したりする傾向があります。
- 自己回帰(AR)モデル: 可変長と KV キャッシュをサポートしますが、逐次デコード(非並列化)に苦しむほか、拡散モデルと比較して一般的に生成品質が低いという欠点があります。
- 「ブロック拡散」のギャップ: 自己回帰と拡散を融合させた半自己回帰的な**ブロック拡散(Block-Diffusion)**パラダイムは、ブロック単位でビデオを生成し、ブロック内で KV キャッシュと並列化を実現することで解決策を提供します。しかし、このパラダイムを大規模に効率的にサポートするための専用インフラが不足しています。
- リソース制約: 大規模モデル(例:140 億パラメータ)で分単位のビデオを生成すると、巨大な KV キャッシュの蓄積によるGPU メモリへの前例のない圧力と、計算時間(例:単一の H20 GPU で 5 秒のビデオを生成するのに数時間かかる)という課題が生じます。
- 評価の欠如: 分単位のビデオ生成の時間的整合性と品質を評価するために設計された、標準化された細粒度のベンチマークが存在しません。
2. 手法:Inferix フレームワーク
Inferix は、ブロック拡散デコードパラダイムを最適化するために構築された専用推論エンジンです。そのアーキテクチャは、いくつかの中核コンポーネントを統合しています:
A. 中核デコードパラダイム
Inferix は、**半自己回帰(ブロック拡散)**デコードを活用します:
- ブロック生成: モデルは、反復的なノイズ除去を通じて、ノイズからクリーンなビデオブロックを生成します。
- KV キャッシング: 標準的な拡散モデルとは異なり、Inferix は以前に生成されたブロックからの文脈を含むグローバル KV キャッシュを維持します。
- 反復ループ: ブロックが生成された後、その KV 情報がキャッシュを更新し、次のブロックの文脈を提供します。これにより、整合性を保ちドリフトを防ぎながら任意の長さの生成が可能になります。
B. システム最適化技術
計算およびメモリ要件に対処するため、Inferix は以下の手法を採用しています:
- 高度な並列化:
- Ulysses 型シーケンス並列化: 独立したアテンションヘッドを GPU 間で分割し、メモリフットプリントを削減します。
- リングアテンション: 極端に長いシーケンスをスケーラブルに処理するため、リングトポロジ上でアテンション演算を分散します。
- インテリジェントな KV キャッシュ管理:
- ブロック単位メモリ管理をサポートする統一インターフェースを提供します。
- スライディングウィンドウアクセスと選択的グローバル文脈取得をサポートします。
- GPU 使用率を最適化するため、Latent Store(マルチ-latent アテンション用)とメインメモリへのオフロードを統合します。
- 加速と量子化:
- 低ビット計算のためにDAX 量子化を利用します。
- 疎なアテンションと冗長性の削減をサポートし、ノイズ除去ステップを加速します。
- 動的インタラクション:
- 継続的プロンプトサポート: 新しいビデオセグメントへのプロンプト切り替え時にクロスアテンションキャッシュをクリアすることで、動的な物語制御を可能にします。
- ビデオストリーミング: RTMP および WebRTC プロトコルを介したリアルタイムストリーミングをサポートします。
C. InterVBench(評価ベンチマーク)
長尺ビデオの評価基準の欠如に対処するため、チームはInterVBenchを構築しました:
- データセット: DanceTrack、GOT-10k などの多様なソースからの、50 秒以上の高解像度・分単位のビデオ 1,000 本。GPT-4o によって生成されたキャプションが 2〜3 秒ごとに注釈付けられています。
- 指標:
- ビデオドリフト誤差(VDE): 時間経過に伴う相対的な品質劣化を測定するために MAPE に着想を得た統一指標。
- VDE サブ指標: 明瞭度、運動、美観、背景、および被写体の整合性。
- 統合: 被写体/背景の整合性、運動の滑らかさなどの標準的な VBench 指標と VDE を組み合わせ、包括的な評価を実現します。
3. 主要な貢献
- 次世代推論エンジン: LLM 型の効率性(KV キャッシング)とビデオ拡散の品質の間のギャップを埋める、ブロック拡散世界モデル向けの最初の専用エンジン。
- スケーラブルなアーキテクチャ: 長系列ビデオ生成に特化した適応型並列化(Ulysses/リングアテンション)と柔軟な KV 管理(オフロード、圧縮)の実装。
- InterVBench: 厳密な人間によるループ検証と、分単位のビデオ生成を評価するための新たな「ドリフト誤差」指標を備えた、大規模な新しいベンチマーク。
- インタラクティブ機能: リアルタイムビデオストリーミング、動的プロンプト切り替え、および組み込みのパフォーマンスプロファイリング(5% 未満のオーバーヘッド)の機能。
- オープンエコシステム: 多様なモデル(MAGI-1、CausVid、Self Forcing)をサポートし、研究者が独自のブロック拡散モデルを統合するための統一インターフェースを提供します。
4. 結果とパフォーマンス
- 効率性: このエンジンは、長尺ビデオ生成の計算上の障壁を大幅に低減します。例えば、単一の H20 GPU で 140 億パラメータモデルを用いて 5 秒のビデオを生成するのに従来約 6,800 秒かかっていた問題を、分散推論と量子化の実現によって解決します。
- 整合性: KV キャッシングの再導入により、長編拡散モデルで一般的にみられる「ドリフトと忘却」の問題を軽減し、時間経過に伴う安定したアイデンティティとシーンの整合性を保証します。
- 柔軟性: 固定長の拡散モデルでは達成できない可変長生成と動的な物語制御を成功裏にサポートします。
5. 意義
Inferix は、世界モデルのインフラにおけるパラダイムシフトを表しています:
- LLM 中心のビジョンを超えて: 視覚的世界シミュレーションのための専用インフラを確立することで、現在の LLM 中心のビジョンモデルを超え、推論と物理的理解における創発的な能力を解き放ちます。
- 没入型シミュレーションの実現: 長編生成のメモリおよび計算のボトルネックを解決することで、エージェント型 AI、具身型 AI、およびゲーミングの応用において、高品質で双方向的かつ物理的に妥当な世界シミュレーションをアクセス可能にします。
- 標準化: InterVBench の導入は、コミュニティに次世代の長尺ビデオモデルを厳密に評価・比較するための必要なツールを提供し、研究の進展を加速します。
要約すると、Inferix は単なる最適化ツールではなく、ブロック拡散パラダイムを拡張するために設計された基盤プラットフォームであり、短いビデオクリップから没入感のある長尺の世界シミュレーションへの移行を可能にします。
毎週最高の AI 論文をお届け。
スタンフォード、ケンブリッジ、フランス科学アカデミーの研究者に信頼されています。
受信トレイを確認して登録を完了してください。
問題が発生しました。もう一度お試しください。
スパムなし、いつでも解除可能。
週刊ダイジェスト — 最新の研究をわかりやすく。登録