WholeBodyWAM: Learning Whole-Body World Action Models with Scalable Motion Priors
本論文は、大規模かつ異種混合なモーションコーパス(UniMotion-4K)を活用して転移可能なモーション・プライアを事前学習することで、非対称なMixture-of-Transformersアテンションを介してビデオおよびアクションのエキスパートと統合した際に、データ効率とダウンストリームの操作性能を大幅に向上させるヒューマノイド・ワールド・アクション・モデルであるWholeBodyWAMを提案する。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
人間のように動くロボットを作るために、エンジニアたちは根本的な問題に直面しています。それは、機械に全身を協調させる方法を教えることが非常に困難であるということです。人間は、コップに手を伸ばしたり部屋を歩いたりするとき、個々の筋肉の動きを一つひとつ考えているわけではありません。体は単一の流動的なユニットとして動きます。しかし、ロボットの場合、すべての関節や肢を個別に指令しなければならず、特定のロボットにこのスキルを教えるために必要な数百万時間の練習データを収集することは、時間がかかり、コストも高く、しばしば不可能なことです。科学者たちは、言語を理解し世界を見ることができる強力なモデルを構築してきましたが、これらのシステムは、ロボット自身の体が将来どのように動くかを予測することには苦戦することが多く、代わりに今起きていることに反応することに依存しています。この限界により、重い箱を運びながら凹凸のある地面を進んだり、バランスを崩さずに膝をついて物体を拾い上げたりといった、先を見越した計画を必要とする複雑なタスクを実行することが難しくなっています。
ある研究チームは、特定のロボットからの高価なデモンストレーションだけに頼るのではなく、インターネット上に存在する膨大な、無料の人間運動のライブラリからロボットに学習させることで、この課題に対処しました。彼らは、ロボットの体のための予測エンジンとして機能する「WHOLEBODYWAM」と呼ばれる新しいシステムを作り上げました。単にビデオを見て次に何をすべきかを推測するのではなく、このシステムは、体が時間の経過とともにどのように動くかという基礎的な物理学を学習します。これは、人間のビデオ、専門的な3Dモーションキャプチャのデータセット、およびその他のヒューマノイドロボットから記録された、4,100時間を超える動きを含む「UniMotion-4K」という大規模なモーションデータセットを用いて訓練されました。これらすべての異なるソースを、動きの単一の共有言語に変換することで、システムは、あるポーズから別のポーズへと体がどのように移行すべきかという一般的な「直感」を学習しました。この直感は実際のヒューマノイドロボットへと転移され、ロボットが自身の将来の動きを予測し、以前の手法よりもはるかに高いスキルと効率で複雑な全身タスクを実行することを可能にしました。
この研究の核心は、一般的な動きのルールを学ぶことと、それを特定の機械に適用する方法を学ぶことを分離した、2段階のトレーニングプロセスにあります。第一段階では、システムはターゲットとなるロボットの実際のコマンドを一度も見ることなく、大規模な人間とロボットのモーションデータセットを研究しました。システムは、「おもちゃを拾う」や「膝をつく」といったタ称の単純なテキスト記述に基づいて、体が次に何をするかを予測することを学びました。これにより、人間のような動きに必要な肢体の協調したダンスとバランスを理解する、強力な基盤、すなわち「予測的プライア(事前分布)」が構築されました。第二段階では、この事前学習された知識が、ビデオ理解モジュールおよびアクションジェネレーターと組み合わされました。その後、システムは特定のロボットである「TianGong 3.0」からの少数のデモンストレーションを見せられ、自身の一般的な動きの理解を、そのロボットの関節が実行する必要がある具体的なモーターコマンドへと翻訳する方法を学習しました。決定的なのは、システムは現在のシーンに単に反応するのではなく、学習した知識を用いて自身の体の将来の状態を想像し、その予測を用いてリアルタイムで行動を導くことです。
6つの困難な実世界のタスクでテストを行った際、結果は驚くべきものでした。ロボットには、おもちゃを拾う、洗濯機に洗濯物を入れる、枕をソファに移す、箱をテーブルまで運ぶといった動作が求められました。これらのタスクでは、ロボットは同時に屈んだり、歩いたり、膝をついたり、物体を操作したりする必要があります。新しいシステムは既存の最高の手法を凌駕し、すべてのタスクにおいて大幅に高い成功率を達成しました。例えば、箱を持ち上げ、サイドテーブルまで歩き、それを置くという「箱の移動」タスクでは、新システムは73.3%の成功率を記録し、他のアプローチよりもはるかに高い成功率を示しました。研究者たちは、初期の「モーションエキスパート」の訓練に使用したモーションデータが増えるほど、ロボットの性能が向上することを発見しました。これは、システムが単に特定の例を暗記したのではなく、スケーラブルなスキルを真に学習したことを示唆しています。さらに重要なことに、このシステムはデータに対して非常に効率的であることが証明されました。研究者が、特定のロボットのデモンストレーション量を半分に減らしても、大規模なモーションデータセットで事前学習されたロボットは、フルセットのデモンストレーションで訓練された他のロボットよりも優れた性能を示しました。
このアプローチは、環境の変化に対しても驚異的な適応能力を示しました。研究者がターゲットのバスケットをわずかに動かしたり、ロボットが拾うべきおもちゃの色や形を変えたりした際、システムは迅速に適応し、他のモデルが苦戦する中で高いパフォーマンスを維持しました。システムは、将来のビデオを生成することなく、計算コストを抑えつつこれを実現しました。代わりに、自身の関節の将来の位置を直接予測することで、約363ミリ秒という、リアルタイム制御に十分な速さで意思決定を行うことができました。この研究は、ロボットは人間と同じ動きを単純にコピーすることはできないものの、人間の動きの膨大なパターンから学ぶことで、自身の体を動かすための堅牢で予測的な理解を発展させることができるということを裏付けています。世界中に存在する膨大な人間の動きのデータを活用することで、この手法は、ヒューマノイドロボットが複雑なタスクを実行できるだけでなく、これまで考えられていたよりもはるかに少ないデモンストレーションでそれらを習得できる新たな道を切り開いています。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。