DriftWorld: Fast World Modeling through Drifting
DriftWorldは、ドリフト生成モデルを活用して将来のフレームを単一のフォワードパスで生成する新しいアクション条件付きワールドモデルを導入し、拡散ベースのベースラインよりも17倍高速な推論を実現しながら、ロボットのプランニングとポリシー評価において最先端の性能を維持しています。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
ロボットに、ブロックを積み上げたり引き出しを開けたりといった難しいタスクを教えようとしているところを想像してみてください。あなたは、ロボットが現実の世界で何百万回も物に衝突させるようなことはしたくないはずです。それは時間がかかり、危険で、コストもかかるからです。代わりに、ロボットに「空想」をさせたいと考えています。ロボットの世界では、この空想は「世界モデル(world model)」と呼ばれています。これはデジタルな水晶玉のようなもので、「もし腕をこのように動かしたら、世界は次にどう見えるだろうか?」と想像させてくれるものです。もしロボットが、実際に動く前にその動きの結果を想像できれば、最善の動きを選び、ミスを避けることができます。
長い間、これらのデジタルな水晶玉は、まるで「ゆっくりとした、思慮深い芸術家」のようでした。彼らは未来の緻密な絵を描くことには非常に長けていますが、一筆ごとに時間がかかってしまいます。1秒間の未来のビデオを生成するために、何度も何度も画像を洗練させながら、数十もの小さなステップを踏む必要があるかもしれません。これは問題です。なぜなら、ロボットは瞬きをする間に決断を下す必要があるからです。もしロボットが、何をすべきかを想像するためだけに3秒も費やしていたら、落ちてくるコップを受け止めるにはすでに手遅れなのです。研究者たちが問いかけている大きな疑問は、「未来を想像するのに十分なほど精巧でありながら、現実のロボットの鼓動に追いつくほど速い世界モデルを作れるか?」ということです。
ここで、新しい論文が、ゲームのルールを変える巧妙な解決策である「DriftWorld」を紹介しています。以前のモデル(「拡散(diffusion)」と呼ばれる手法に依存しているもの)が用いていた、ステップ・バイ・ステップの遅い絵画プロセスではなく、DriftWorldは「ドリフティング(drifting)」モデルと呼ばれるものを使用します。このように考えてみてください。もし拡散モデルが、彫刻家が石の塊を少しずつ削り取って像を露わにしていくプロセスだとしたら、ドリフティング・モデルはサーファーのようなものです。それは、トレーニング中に水の「流れ(current)」や「漂流(drift)」を学習します。一度水の流れる方向を知ってしまえば、出発点から目的地まで、一度の滑らかな動きで滑っていくことができるのです。
著者たちは、DriftWorldを「行動条件付き(action-conditioned)」の世界モデルとして構築しました。これは、ロボットの計画された動きが指示となり、それによって生じる未来のビデオフレームを即座に生成することを意味します。彼らは、テーブル上の物体を動かすタスク(「Push-T」タスクなど)や複雑なキッチンでの家事を含む、いくつかの現実世界およびシミュレーション上のロボットタスクでこれをテストしました。その結果は驚くべきものです。DriftWorldは、シングル・フォワード・パスで未来のビデオフレームを生成することができ、毎秒30フレーム以上の速度に達します。これは、既存の最高の拡散ベースの世界モデルよりも、平均して17倍高速です。
しかし、スピードだけが重要なわけではありません。空想は正確でなければなりません。研究者たちは、DriftWorldがただ速いだけでなく、鮮明に見えていることも発見しました。テストにおいて、それが生成したビデオは、既存の遅いモデルと同等、あるいはそれ以上の品質スコアを示し、非常にシャープでリアルでした。非常に高速であるため、ロボットはかつて数個の未来を想像するのにかかっていた時間で、何百もの異なるシナリオを想像することができます。研究者が、行動する前に「考える」ためにDriftWorldを使用させたところ、ロボットのタスク成功率は向上しました。例えば、Push-Tタスクにおいて、DriftWorldを使って動きを計画した際の成功率(IoUスコア)は、0.635から0.781へと跳ね上がりました。
また、この論文は、DriftWorldがロボットのポリシーをオフラインでテストするための素晴らしいツールであることを示しました。例えば、10種類の異なるロボット戦略があり、それらをすべて実際のラボで実行することなく、どれが最善かを知りたいとしましょう。DriftWorldはシミュレーターとして機能し、各戦略の結果を通り抜け、それらをランク付けすることができます。研究者は、DriftWorldがこれらの戦略に与えたスコアが、現実の結果と最大で0.9916(Robomimic Liftタスクにおけるピアソン相関係数)の相関関係にあることを発見しました。これは、デジタルの空想が現実とほぼ完璧に一致していたことを意味します。
しかし、著者たちは、これがすべてを解決する魔法の杖ではないことにも注意を払っています。このモデルは、特に複雑なシーンにおいて画像を鮮明に保つために、事前学習済みの「特徴抽出器(具体的にはDINOv2/v3)」に依存しています。また、正しいドリフトを学習するために、多くの「ネガティブな例(悪い推測)」を同時に生成する必要があるため、トレーニング中に多くのコンピューターメモリを必要とします。この論文は、ドリフティングがロボットの世界モデリングにとって強力な基盤であることを証明していますが、将来の研究では、モデルをより長く、より一貫したものにするために、これらのメモリ制約に取り組む必要があることを示唆しています。
要するに、DriftWorldは、私たちは「遅くて完璧な想像力」と「速くてぼやけた想像力」のどちらか一方を選ばなければならないのではない、ということを示唆しています。デノイズ(ノイズ除去)の代わりに「ドリフト」を学習することで、ロボットはついに、現実世界で計画し行動するために必要な、高速で高品質な空想を手に入れることができるのです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。