← 最新の論文
🤖 AI

ForgeWM: Progressive Causal Training for Few-Step Action-Conditioned Video World Models

ForgeWMは、双方向ビデオ生成器を、因果的一貫性蒸留やリプレイ時の精緻化を伴うデュアルパス・デプロイメント・プロトコルなどの技術を通じて、離散的および連続的なゲーム制御をビデオ生成に正確に整合させ、品質と制御精度において最先端の性能を達成する効率的で低遅延な数ステップのワールドモデルへと変貌させる、漸進的な学習フレームワークを導入します。

原著者: Xinye Li, Lingshuai Lin, Lei Wang, Liuzhou Zhang, Jialin Cui, Qingshan Li, Guanchu Wang, Qingbin Liu, Xi Chen, Jiang Bian, Wai Lam

公開日 2026-08-17
📖 1 分で読めます☕ さくっと読める

原著者: Xinye Li, Lingshuai Lin, Lei Wang, Liuzhou Zhang, Jialin Cui, Qingshan Li, Guanchu Wang, Qingbin Liu, Xi Chen, Jiang Bian, Wai Lam

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたのコンピュータが単に映画を観るだけでなく、あなたが押したボタンに基づいて次に何が起こるかを正確に予測し、その中にあるゲームを実際にプレイする世界を想像してみてください。これは、現実をシミュレートしようとする人工知能の一分野である「ビデオ・ワールドモデル」の領域です。これは、図書館にあるすべての本を読み終え、次の章を瞬時に想像できる超スマートなストーリーテラーのようなものです。通常、これらのストーリーテラーは、長く詳細な物語を書くことには長けていますが、動作が遅いです。もしリアルタイムでビデオゲームをプレイしたいのであれば、次の文章を即座にささやくことができるストーリーテラーが必要です。さもなければ、ゲームは停止したりラグが発生したりしてしまいます。課題は、これらのモデルを高速化すると、しばしば不器用になってしまうことです。彼らは、あなたが直前に伝えたことを忘れてしまったり、キャラクターの方向を見失ったりすることがあります。この論文は、AIに対して、ビデオの見た目を鮮明でリアルに保ちながら、いかにして電光石火の速さと、あなたの操作に対する完璧な従順さを両立させるかという、非常に難しい問題に取り組んでいます。

ここで、ForgeWMという新しいフレームワークが登場します。これは、異なる時間の中で同じ美味しい料理を作るために、一連の副シェフを訓練するマスターシェフのような役割を果たします。研究者たちは、あらゆる方向(時間の前後方向)にビデオを生成できる、強力で動きの遅いAIモデルからスタートしました。彼らの目標は、これを「数ステップ」のモデル、つまり長い時間をかけた遅いプロセスではなく、わずか1、2、または4回の素早いステップで、ビデオの次の数秒間を生成できるモデルへと変えることでした。彼らは、単にモデルを高速化するだけではうまくいかないことを発見しました。なぜなら、AIが未来を予測しようとする際に、自分自身のミスによって混乱してしまうからです。

これを解決するために、チームは4段階のトレーニング・レシピを開発しました。まず、モデルにゲームの世界の基礎を教えました。次に、完璧でクリーンな例のみを使用して(まるで生徒が先生の完璧な筆跡を書き写すように)、時間の経過とともに前進する方法を強制的に学習させました。次に、モデルに自律的に練習させましたが、そこにはミスを即座に修正するセーフティネットを用意しました。最後に、モデルをシミュレーションされたゲームの中で自由に走らせ、ゲームが実際にどのように進行するかという現実の分布に一致するように学習させました。その結果、「1ステップ・モデル」:即座の低レイテンシな反応のためのモデル、「2ステップ・モデル」:速度と品質のバランスのためのモデル、そして「4ステップ・モデル」:より高い忠実度のためのモデルという、専門化された「生徒」たちが誕生しました。

この論文は、これらのモデルが驚くほどうまく機能することを示しています。マインクラフトを用いたテストでは、1ステップ・モデルは72.10 FPS(フレーム毎秒)でビデオを生成でき、これはスムーズなリアルタイムのゲームプレイに十分な速さであり、なおかつキーボードやマウスのコマンドを高い精度で理解していました。4ステップ・モデルはさらに優れた視覚的品質を生み出し、意図した動きや操作との一致において他のトップシステムを上回りました。興味深いことに、研究者たちは、より高い品質を得るために必ずしもモデルを再学習させる必要はないことを発見しました。彼らは「リプレイタイム・リファインメント(再生時間精緻化)」というテクニックを導入しました。もし、高速な1ステップのゲームプレイ・セッションを記録した場合、その保存されたビデオを後で「再ノイズ化」し、同じモデルに対して、通った経路を変えることなく、ビデオをクリーンアップして細部を追加するよう指示することができます。この精緻化されたビデオは、あたかも4ステップのプロセスを経てゼロから生成されたかのような品質になり、かつ、あなたが体験したのと全く同じ視点とシーンのレイアウトを維持していました。

チームはまた、このトレーニング手法がマインクラフト専用ではないことも示しました。彼らは同じレシピを、ゲームパッドで操作されるファーストパーソン・シューティング(FPS)ゲームに適用し、ForgeWM-CrossFPSと呼ばれるモデルを作成しました。これは、『Halo Infinite』や『Modern Warfare』のようなゲームのビデオ生成に成功しました。論文では、これらのモデルが非常に長い期間(例えば22秒経過した後にブロックの構造が失われるなど)において、依然としていくらかの劣化を示すことが指摘されていますが、結果は、ForgeWMが、制御可能かつ高速なビデオ・ワールドモデルを構築するための強力で柔軟な方法を提供することを示唆しています。著者たちは、即座の反応と高品質なビジュアルの必要性を切り離すことで、私たちはその両方の最高の結果を得ることができると考えています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →