← 最新の論文
💻 computer science

World-in-World: World Models in a Closed-Loop World

本論文は、クローズドループのエンボディード設定における生成的なワールドモデルをベンチマークするための初のオープンプラットフォームである「World-in-World」を導入し、タスクの成功には視覚的な品質単体よりも、制御可能性、行動・観測のスケーリング、および推論時の計算量がより重要であることを明らかにしている。

原著者: Jiahan Zhang, Muqing Jiang, Nanru Dai, Taiming Lu, Arda Uzunoglu, Shunchi Zhang, Yana Wei, Jiahao Wang, Vishal M. Patel, Paul Pu Liang, Daniel Khashabi, Cheng Peng, Rama Chellappa, Tianmin Shu, Alan Y
公開日 2026-08-18
📖 1 分で読めます☕ さくっと読める

原著者: Jiahan Zhang, Muqing Jiang, Nanru Dai, Taiming Lu, Arda Uzunoglu, Shunchi Zhang, Yana Wei, Jiahao Wang, Vishal M. Patel, Paul Pu Liang, Daniel Khashabi, Cheng Peng, Rama Chellappa, Tianmin Shu, Alan Yuille, Yilun Du, Jieneng Chen

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

想像してみてください。あるロボットが、特定の物体を見つけるために、散らかった部屋をナビゲートしようとしています。成功するためには、単に目の前の瞬間に見えるものに反応するだけでは不十分です。一歩前へ進んだら、左に曲がったら、あるいは手を伸ばしたら、何が起こるかを予測しなければなりません。ロボットには、世界のメンタルモデル、つまり実際に起こる前に未来をシミュレートする方法が必要です。長年、科学者たちは動いているシーンの驚くほどリアルなビデオを生成できる人工知能システムを構築してきました。これらのシステムはしばしば「ワールドモデル」と呼ばれ、車が通りを走行する様子や、カップがテーブルから落下する様子を、実写映像に見えるほどの視覚的な忠実度で作成することができます。しかし、ある決定的な問いが未解決のまま残されていました。それは、「この視覚的な美しさは、実際にロボットがより良い意思決定を行う助けとなるのか?」という問いです。これまで、この分野は、生成されたビデオがいかに見た目が美しいかのみを判断するベンチマークによって支配されており、それらのビデオが現実のタスクを遂行しようとするロボットにとって有用であるかどうかは無視されてきました。

研究チームは、「World-in-World」と呼ばれる新しいアプローチを導入しました。これは、視覚的な完璧さから実用的な有用性へと焦点を移すものです。「このビデオはどれほど良く見えるか?」と問う代わりに、彼らは「このビデオはエージェントの成功を助けるか?」と問います。研究者たちは、人工エージェントが4つの異なる物理的タスクを実行しなければならない、クローズドループのテストプラットフォームを構築しました。そのタスクとは、積極的に周囲を見渡して隠れた物体を見つけること、1枚の参照画像に基づいて特定の場所へ移動すること、3D環境を探索した後に質問に答えること、そしてロボットアームを制御して物体を動かすことです。このセットアップにおいて、ワールドモデルはシミュレーターとして機能します。ロボットは物理的な行動を実行する前に、モデルを使用していくつかの可能な未来を想像します。そして、これらの想像されたシナリオを評価することで、成功に至る可能性が最も高い経路を選択し、実効的に、行動する前に先を考えて動くのです。

この新しい評価法の結果は、視覚的な質とタスクのパフォーマンスとの間の、驚くべき乖離を明らかにしました。研究者たちは、信じられないほど高精細で審美的なクリップを生成するモデルを含む、最先端のビデオ生成器を幅広くテストしました。彼らは、高い視覚的品質だけでは、ロボットがタスクに成功することを保証しないことを発見しました。モデルは部屋の美しいビデオを生成するかもしれませんが、もしそのビデオ内の物理法則がわずかに異なっていたり、ロボットがシミュレーション内でのカメラの動きを正確に制御できなかったりする場合、ロボットは誤った判断を下してしまいます。実際、この研究は、制御性(特定の低レベルなアクションによってシミュレーションを操る能力)が、純粋な画像の美しさよりもはるかに重要であることを示しました。「前へ2歩進む」というコマンドに対して信頼性を持って反応するモデルは、見事だが制御不能なビデオを生成するモデルよりも価値があります。

さらに、チームは、単により強力な事前学習済みビデオ生成器を使用することが、ロボットの性能を向上させる最善の方法ではないことも発見しました。代わりに、標準的なビデオ生成器を取り上げ、ロボットの環境や動作に特化した比較的少量のデータで微調整(ファインチューニング)を行うことで、より優れた結果が得られることが分かりました。「ポストトレーニング」として知られるこのプロセスは、モデルの予測を、ロボットが住む物理的な世界の特定のルールに適合させます。データはまた、明確なスケーリング則を示しました。微調整中にモデルが見るアクションと観察の例が増えれば増えるほど、ロボットの成功を助ける能力は向上します。加えて、システムに計算時間をより多く与えること(意思決定の前に、より多くの潜在的な未来をシミュレートさせること)も、成功率を大幅に向上させました。

本研究は、ワールドモデルがロボット工学やエンボディドAI(身体性AI)において真に有用であるためには、欠点のない映像を作り出す能力ではなく、意思決定をサポートする能力によって判断されなければならないと結論付けています。現在のモデルは、物体の精密な摩擦や接触といった、ロボット操作の複雑な物理現象には依然として苦戦していますが、この新しいフレームワークは明確な進むべき道を示しています。視覚的な美しさよりも制御性を優先し、ポストトレーニングを通じてモデルを特定のタスクに適応させることで、研究者は単に現実世界のように見えるだけでなく、現実世界とどのように相互作用すべきかを実際に理解できるシステムを構築できるのです。画像を判定することから計画をテストすることへのこの転換は、物理的な世界を確実にナビゲートし、操作できるインテリジェントなエージェントを生み出すための重要な一歩となります。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →