DreamDojo: A Generalist Robot World Model from Large-Scale Human Videos
DreamDojoは、44,000時間の第一人称視点の人間によるビデオで学習された基盤ワールドモデルであり、連続的な潜在アクションを通じて多様な器用な相互作用を学習することで、オープンワールドかつ接触の多い環境における汎用ロボットのための、リアルタイムのシミュレーション、精密なアクション制御、および効果的な方策計画を可能にします。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
ロボットに、料理、掃除、修理、おもちゃで遊ぶことなど、人間ができるあらゆることを教えたいと考えていると想像してみてください。問題は、ロボットは高価であり、壊れやすく、また、あらゆるスキルを教えるためのロボットの映像が十分に足りないことです。
DreamDojoは、この問題を解決するロボットのための新しい「脳」です。これは、ロボットのビデオから学ぶのではなく、人間のビデオから学ぶことで解決します。これは、ロボット自身にすべてのタスクを行わせるのではなく、YouTubeやTikTokにある、人々が日常的なタスクを行っている何百万時間もの動画を見て学習するロボットのようなものです。
その仕組みを、シンプルな概念に分解して説明します:
1. 巨大なライブラリ(データ)
通常、ロボットのトレーニングデータは、「赤いブロックを拾う方法」についての数冊の本しかない小さな図書館のようなものです。DreamDojoのライブラリは、44,000時間の人間のビデオを含む、巨大で無限のライブラリです。
- 規模: それは、一冊のノートとアメリカ議会図書館全体を比較するようなものです。
- 多様性: 料理をしているキッチンから、ガレージで車を修理しているところまで、数千種類の異なる物体やスキルを網羅しています。
- 秘伝のソース: これらのビデオには「ロボットへの指示」が付随していないため、チームは潜在的アクション(Latent Actions)と呼ばれる特別な翻訳機を考案しました。例えば、誰かが瓶を開けているビデオを見ていると想像してください。ロボットには正確な筋肉の動きは見えませんが、この翻訳機は、手と瓶がどのように動いているかを見るだけで、「ひねって引く」という意図や物理学を解き明かします。これにより、ビデオを、あらゆるロボットが理解できるユニバーサルな取扱説明書へと変換します。
2. シミュレーター(世界モデル)
ロボットの脳がこれらのビデオから学習すると、それは**世界モデル(World Model)**になります。
- 比喩: 世界モデルは、パイロットのためのフライトシミュレーターのようなものです。パイロットは実際に飛行機を飛ばす前に、シミュレーターで練習します。シミュレーターでミスをしても、誰も怪我をしません。
- DreamDojoの仕組み: あなたがDreamDojoに「ロボットがカップに手を伸ばしたが、失敗したとしたら」と伝えると、モデルは次に何が起こるかを生成するビデオを作成します。モデルは物理学を理解しています。もしカップを押せば、それは滑ります。もし強く押しすぎれば、テーブルから落ちます。モデルは、見たことがない物体や環境であっても、これらの結果を瞬時にシミュレートできます。
3. スピードアップ(蒸留)
オリジナルの「脳」は非常に賢いのですが、数学の問題を解くのに10分かかる天才教授のように動作が遅いです。ロボットがリアルタイムで動くためには、人間と同じ速さで考える必要があります。
- 解決策: チームは**蒸留(Distillation)**と呼ばれるプロセスを使用しました。彼らは、この遅くて賢い教授を取り、彼らを模倣する速くて若い学生(「学生モデル」)を訓練しました。
- 結果: 学生モデルは、今や10.81フレーム/秒の速さで未来を予測できます。これはリアルタイムで動作させるのに十分な速さです。VRコントローラーで仮想のロボットを操作すると、ロボットはまるで本物の人間のように、即座に動き、反応します。
何ができるのか?(論文の主張に基づく)
論文では、このテクノロジーの3つの主な活用方法を強調しています:
ポリシーのテスト(ロボットのための「フライトシミュレーター」):
ロボットを果物の箱詰め作業に送り出す前に、DreamDojo内でその「脳」をテストできます。論文では、もしロボットの戦略がDreamDojoのシミュレーション内でうまく機能すれば、現実世界でもほぼ確実にうまく機能すること(99.5%の相関関係)を示しています。これにより、学習中にロボットが物を壊してしまうことを防ぎ、時間を節約できます。先読み(「チェスプレイヤー」):
ロボットが複雑なタスクを行う際、DreamDojoを使用してさまざまな結果を「夢見る(想像する)」ことができます。ロボットは、リンゴを掴むための5つの異なる方法を頭の中で試し、どの方法が最善の結果をもたらすかを確認してから、その特定の動きを実行できます。これにより、ロボットはより困難なタスクにおいて、よりスマートかつ成功率高く動けるようになります。ライブ・テレオペレーション(「バーチャルツイン」):
このモデルは非常に高速であるため、人間はVRヘッドセットを装着して、リアルタイムで仮想のロボットを操作できます。人間が手を動かせば、仮想のロボットも即座に動きます。これにより、人間が遠隔操作でロボットになることができ、これは人間が直接行うには危険すぎたり難しすぎたりするタスクに役立ちます。
まとめ
DreamDojoは、混沌として多様な現実世界と、精密なロボットの世界との間の架け橋です。オンライン上の膨大な人間の活動から学び、アクションにラベルを付けずに理解するための特別な「翻訳機」を使用することで、未来を想像し、アイデアを安全にテストし、リアルタイムで行動することができるロボットの脳を作り出します。これにより、ロボットは単に明示的に教えられたことだけを知っている硬直した機械から、世界の仕組みを理解する柔軟なエージェントへと進化します。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。