← 最新の論文
🤖 AI

ReWorld: An Interactive World Model with Long-Horizon Memory

ReWorldは、混合アテンションメカニズムを用いて学習時にこれらの能力を分離することで、短期的な制御と長期的な記憶の間の構造的緊張を解消し、ポーズ・インデックス化されたランドマーク検索システムを介して推論時にそれらを統合するインタラクティブな世界モデルであり、多様な視覚ドメインにおいて優れたアクションの忠実度、ビデオ品質、および数分間にわたる時間的一貫性を実現している。

原著者: Zhifei Chen, Luozhou Wang, Guibao Shen, Dongyu Yan, Shuai Yang, Tianshuo Xu, Yihua Du, Wei Wang, Tianyi Gui, Lianghua Huang, Yingcong Chen

公開日 2026-08-25
📖 1 分で読めます☕ さくっと読める

原著者: Zhifei Chen, Luozhou Wang, Guibao Shen, Dongyu Yan, Shuai Yang, Tianshuo Xu, Yihua Du, Wei Wang, Tianyi Gui, Lianghua Huang, Yingcong Chen

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

ビデオを観察し、まるでそのシーンの中に生きているかのように、次のフレームで何が起こるかをフレームごとに予測できるコンピュータを想像してみてください。これは、「ワールドモデル」と呼ばれる、エージェントが移動し行動できる環境をシミュレートするために設計された一種の人工知能が約束するものです。これらのシステムが真に生命を感じさせるものとなるためには、3つの困難なことを同時に達成しなければなりません。すなわち、ユーザーのコマンドに対して即座に反応すること、ユーザーがその場所を離れて戻ってきたときに、その場所がどのような見た目であったかを正確に記憶していること、そしてメモリ不足に陥ることなくリアルタイムで新しいビデオを生成し続けることです。課題は、これらの目標がしばしば互いに衝突することでした。素早く反応するためには、システムは直近の過去だけに集中する必要がありますが、遠く離れた場所を記憶するためには、膨大な履歴を保持しておく必要があります。もしシステムが同じ単純なアプローチで両方を行おうとすれば、通常はどちらか一方で失敗します。過去を忘れるか、あるいは現在に対してつまずくかのどちらかです。

研究者たちは現在、コンピュータに2つの異なる方法で同時に思考することを教えることで、この緊張関係を解決する「ReWorld」と呼ばれるシステムを構築しました。香港とアリババの機関と協力したチームは、ユーザーのカメラの動きに従い、フォトリアルな世界やゲームのような世界の高品質なビデオをストリーミングでき、カメラが遠くへ移動して戻ってきた後でも、数分前の特定のシーンを想起できるモデルを作成しました。鍵となる発見は、システムが短期間の反応と長期的な記憶の間で選択する必要はないということです。代わりに、学習プロセス中にこれらのタスクを分離し、実際に動作させているときはそれらを注意深く管理するのです。

ReWorldの成功の核心は、その注意(アテンション)の整理方法にあります。多くの人工知能モデルでは、システムは次に何を生成するかを決定するために、これまでに見たすべての情報を見渡します。ReWorldはこの仕事を異なる部分へと分割します。ある部分は、ボタンの入力によって即座に正確なカメラの動きがもたらされるように、おそらく直近の数秒間といった、ごく最近の過去のみを見るように訓練されています。他の部分は、ビデオ全体の履歴を見るように訓練されており、これにより、システムがずっと前に見た特定の岩の造形や建物が、今見ているものと同じであることを認識できるようになります。決定的なのは、研究者がこれらの役割をシステムの固定された部分に割り当てなかったことです。代わりに、役割をランダムに入れ替えながら訓練することで、あらゆる部分が即時の反応と遠い記憶の両方を処理する方法を学習するようにしました。これにより、システムが特定の過去の見方に依存してしまうことを防いでいます。これは、現実の世界では、システムがその全履歴を永遠にメモリに保持し続けることはできないため、非常に重要です。

システムが稼働する際、一度に保持できる情報量には厳しい制限が課されます。これを処理するために、ReWorldは巧妙なファイリングシステムを使用しています。ビデオが再生されるにつれ、システムは最も新しいフレームを含む、常に更新される小さなウィンドウを保持します。古いフレームがこのウィンドウから外れるとき、それらは単に削除されるわけではありません。代わりに、システムはカメラがその場所を保存するに値するほど十分に移動したかどうかをチェックします。もし移動していれば、システムはそのシーンの高品質な「ランドマーク(目印)」を保存します。これらのランドマークは、別の限定されたバンク(貯蔵庫)に保存されます。カメラが向きを変えて以前訪れた場所へと向かうとき、システムはこのバンクを検索して、現在のビューに一致するランドマークを見つけ出し、それをアクティブなメモリへと呼び戻します。これにより、システムは、その間に起こったすべてのフレームを保持する必要なく、1分前のシーンを記憶することができるのです。

これを実現するために、研究者は非常に特定の種類のデータを用いてモデルを教えなければなりませんでした。彼らは実世界のビデオ、ビデオゲーム、およびコンピュータ生成された環境の映像を組み合わせましたが、そこで通常とは異なることを行いました。それは、「前進するためのキーを押す」といった単一のコマンドが、あらゆる種類の映像において、カメラを全く同じ物理的距離だけ移動させるようにしたことです。これにより、動きの統一された言語が作成されました。また、彼らは、モデルからビデオ履歴の一部をあえて隠すという特別な訓練テクニックも使用しました。これにより、モデルはメモリが不完全な状態でも、シーンを再構成する方法を学ぶよう強制されました。これは、モデルが連続的なデータの流れではなく、いくつかの主要なランドマークに頼らざるを得なくなったときに混乱しないよう、モデルを準備させるためのものでした。

このアプローチの結果は驚くべきものです。カメラが離れてから元の地点に戻るテストにおいて、ReWorldは、カメラが1分以上移動した後であっても、元のビューを驚くほどの正確さで再生することができました。単純なスライディングウィンドウ(直近のフレームのみを表示する仕組み)に依存している他のシステムは、そのウィンドウから対象が外れると、出発点を記憶できずに失敗しました。ReWorldはまた、コマンドに従う能力においても優れていることを証明し、カメラはコースから外れることなく、意図した通りに正確に移動しました。システムは704×1280ピクセルの解像度でビデオを生成でき、インタラクティブに感じられるほど高速であり、かつ、フォトリアルな風景から様式化されたゲームの世界まで、異なるスタイルにわたってその品質を維持します。

研究者たちは、彼らの手法が、制御と記憶という異なるニーズを尊重しているからこそ機能することを見出しました。短期間のコマンドと長期的な想起を別々に扱うようシステムを訓練し、その後、必要に応じて古い記憶を呼び戻すスマートな検索システムを使用することで、応答性と一貫性の両方を備えたワールドモデルを作り上げました。システムは、過去を記憶するために巨大で全知全能な存在である必要はありません。ただ、必要なときに適切な過去の断片を見つける方法を知っていればよいのです。このアプローチにより、モデルは標準的なコンピュータハードウェア上で動作しながら、これまでインタラクティブなビデオ生成では不可能であった継続性を維持することができます。この研究は、インタラクティブなAIの未来が、単にモデルを大きくすることではなく、学習した情報をどのように整理し、アクセスするかをより賢くすることにあることを示唆しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →