WorldDiT: A Unified Diffusion Architecture for World and Action Modeling
WorldDiTは、連続的なアクションの生成と将来の視覚フレームの予測を同時に行う統合された拡散トランスフォーマーアーキテクチャを導入し、大規模な学習済み視覚言語モデルに依存することなく、複数のロボット操作ベンチマークにおいて最先端の性能を達成しています。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
ロボットが単に硬直した指示リストに従うのではなく、次に何が起こるかを実際に「夢見る」世界を想像してみてください。これは、機械に私たちの混沌とした現実世界での動き方を教えようとする試みである、ロボット学習の最前線です。長い間、最大のブレイクスルーは特定のレシピから生まれてきました。それは、言語や画像についてあらゆることを既に知っている巨大な学習済み「脳」(超スマートな百科事典のようなもの)を取り出し、そこにロボットの腕を取り付けるというものです。これは機能しますが、まるで子犬にフェッチ(取ってこい)を教えるために、まず教授になるよう訓練するようなものであり、重く、コストがかかり、ロボットがタスクを学んでいるのか、それとも単に教授のノートをコピーしているだけなのかを判断するのが困難です。科学者たちが投げかけている大きな問いは、「巨大な事前ロード済みの百科事典を必要とせずに、より小さく、より軽く、動き方と未来の予測を同時に学ぶことができるロボットの脳を構築できるか?」ということです。
ここで、Bagel Labsの研究者によって設計された新しいロボットの脳、WorldDiTが登場します。WorldDiTを、教科書をコピーする学生としてではなく、自分の未来の映画を見ながら絵を描くことを学ぶ若い芸術家として考えてみてください。画像とテキストを説明できる巨大な事前学習済み「視覚言語モデル(VLM)」(巨大なAI)に何をすべきか指示させる代わりに、WorldDiTは2つのことを同時に行う単一の統合されたエンジンを使用します。第一に、ロボットの腕の次の動きを決定します。第二に、数秒後のカメラに何が見えるかを予測しようとします。それは、単に次の手を計画するだけでなく、プランが理にかなっているかを確認するために、3手先までの盤面を視覚化するチェスプレイヤーのようなものです。
研究者たちは、ロボットがブロックを積み上げたり物体を動かしたりするタスクを行うLIBEROと呼ばれるシミュレーション環境で、このシステムを訓練しました。その結果、WorldDiTは(他のトップレベルの手法で使用される数十億ものパラメータと比較して)驚くほど小さく(4億パラメータ未満)、未来のカメラ映像とロボットの動作を驚異的な精度で予測できることがわかりました。実際、テストにおいて、ロボットは4つの異なる種類のチャレンジ全体で約95%のタスクに成功しました。最もエキサイティングな部分は、多くの成功したロボットが使用する重厚な事前学習済みの「バックボーン」なしでこれを実現したことです。優れたロボットになるために巨大な事前ロード済みの脳は必要ではなく、動いている間に未来を見ることを学ぶ脳が必要なのだということを、これは証明しました。
「夢見る」ロボット
では、WorldDiTは実際にどのように機能するのでしょうか?あなたがジャグリングの練習をしているところを想像してみてください。今日のほとんどのロボットは、ジャグリングの達人の何千ものビデオを暗記し、それを正確に模倣しようとしている学生のようなものです。WorldDiTは異なります。それは、目隠しをされているものの、水晶玉を持っているジャグリングの学生のようなものです。
仕組みはこうです:WorldDiTが動きを計画するたびに、カメラに将来どのように見えるかを「夢見る」ことも試みます。それは、ロボットの現在の状態、与えられた指示(例:「赤いブロックを拾え」)、そして過去数秒間のビデオを見ます。そして、同時に2つの質問を自分自身に投げかけます。
- 「ロボットは次に何をすべきか?」
- 「もしそうしたら、一瞬後の映像はどうなるか?」
研究者たちはこれを**拡散トランスフォーマー(diffusion transformer)**と呼んでいます。これがSFの専門用語のように聞こえるなら、「デノイジング(ノイズ除去)」プロセスだと考えてください。画像が静止ノイズで覆われている様子を想像してください。WorldDiDは、ロボットの次の動きと未来の映像に関する完全にランダムでノイズの多い推測からスタートします。そして、ステップバイステップでそのノイズを取り除き、推測を洗練させて、目標への明確でスムーズな経路を見つけ出します。これは、ロボットの動作と未来の画像の両方に対して行われます。
魔法が起きるのは、これら2つのタスクが互いに助け合うからです。未来の画像を予測しようとすることで、ロボットは世界の物理法則を理解することを強制されます。もし、ブロックを押す計画を立てたとしても、その「夢」の中でブロックが宙に浮いていたら、計画が間違っていることがわかります。夢が現実と一致するまで、行動を調整しなければなりません。これにより、次に何が起こるかを予測しようとすることで、ロボットが世界のルールを学ぶというフィードバックループが生まれます。
結果:小さな脳、大きな成功
研究者たちは、4つの異なるシミュレーション・スイート(空間、物体、目標、長期といった、異なる障害物コースのようなもの)でWorldDiTをテストしました。そして、24の有名なロボット学習手法と比較しました。
ここでの驚きは、WorldDiTが極めて小さいことです。その脳(ニューロン)は約3億9,900万パラメータしかありません。他のトップパフォーマンスを出すロボットの多くは、10億あるいは100億のパラメータを持つモデルを使用しています。通常、脳が大きいほど性能は向上します。しかし、WorldDiTはそのルールを打ち破りました。
これらのシミュレーションにおいて、WorldDiTは4つのコース全体で平均94.9%の成功率を達成しました。
- 空間(Spatial): 成功率 98.0%
- 物体(Object): 成功率 97.0%
- 目標(Goal): 成功率 92.8%
- 長期(Long): 成功率 91.8%
これらの結果をグラフにプロットすると、WorldDiTは「パレート・フロンティア(Pareto frontier)」に位置しています。平たく言えば、これは、それがその部屋で最も効率的なロボットであることを意味します。もし、WorldDiTと同じくらい賢いが、より小さな脳を使うロボットが欲しいとしても、見つけることはできません。また、WorldDiTと同じくらい小さな脳を持ちながら、より賢いロボットを見つけることもできません。94.9%を超える性能を出した他のすべてのロボットは、大幅に大きく、重いものでした。
なぜこれが重要なのか
論文では、優れたロボット制御を得るために、巨大な事前学習済み視覚言語モデル(VLA)を使用しなければならないという考えに対し、明確に反論しています。しばらくの間、この分野では「世界を理解するためには巨大な脳が必要だ」と考えられてきました。WorldDiTは、「必ずしもそうではない」と言っています。
研究者たちは、行動生成(動くこと)と世界モデリング(未来を予測すること)を結合させることで、単一の統合されたアーキテクチャが非常に効果的にロボットを制御することを学びました。彼らは単に提案しただけでなく、これを数千回のシミュレーション・エピソードで測定しました。ロボットは単に「運が良かった」わけではありません。一貫して、より大規模なモデルを上回る性能を示したのです。
しかし、注意点もあります。これらの結果はシミュレーション(ロボットが住むコンピュータゲーム)によるものです。論文では、性能は強力であるものの、これは将来の研究のためのベースラインであると述べています。この「夢見る」ロボットが、実際の重力や滑りやすい床がある、現実の散らかったキッチンで完璧に機能するかどうかはまだ分かっていません。しかし、シミュレーションの結果は、私たちが将来、より小さく、より安価で、より効率的なロボットを作れる可能性があることを強く示唆しています。つまり、過去を暗記するのではなく、未来を想像することで学ぶロボットです。
結局のところ、WorldDiTは、スマートなロボットの秘訣は、単に膨大な知識のライブラリを持つことではなく、今この瞬間のより良い決断を下すために、心の中で未来を再生できる脳を持つことにあると示唆しています。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。