Motus2: A Self-Evolving General World Model for Dexterous Manipulation
Motus2は、スケーラブルなモデルアーキテクチャと段階的に拡張されるマルチモーダルデータセットを活用することで、エキスパートによるデモンストレーションと自己生成された相互作用データの両方を通じて継続的な改善を可能にし、方策、シミュレーション、および評価を閉じた意思決定および学習ループへと統合する、巧緻な操作のための自己進化型汎用ワールドモデルである。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
人間が行う複雑で予測不可能なタスクを真にこなせるロボットを構築するために、科学者たちは長い間、単に指示のリストに従うだけではないシステムを追い求めてきました。目標は、周囲を感知し、次に何が起こるかを想像し、行動を起こし、そしてその結果から学び、次回はより良くできるようにする機械を作り出すことです。この概念は「世界モデル」として知られ、ロボットにとっての内部シミュレーターとして機能します。現在の状況をただ反応して見るのではなく、ロボットは実際に動き出す前に、自分の動きがどのような結果をもたらすかを推測するために、頭の中でシミュレーションを実行します。これらのシステムの初期のバージョンは、未来を予測したり、次の手を提案したりすることはできましたが、多くの場合、「見て、推測し、行動し、止まる」という直線的なプロセスで動作していました。それらは、自分自身の予測を振り返り、それが良いか悪いかを判断し、人間が毎回正解を示さなくても、自らの意思決定スキルを向上させるための判断基準を持つことができませんでした。
研究チームは現在、道具の使用や人間のような手による物体の操作といった、繊細で複雑なタスクのために特別に設計された自己進化型ロボット脳である「Motus2」と呼ばれるシステムを導入しました。このシステムは、思考と学習の間のループを閉じるという点で、大きな前進を意味しています。Motus2は、単なる受動的な観察者や単純な追従者ではなく、自らが教師として機能します。それは一連の可能な動きを提案し、それらの動きが将来どのように見えるかをシミュレートし、そしてそれらの想像された結果が成功につながるかどうかを評価します。もしシミュレーションが失敗を示せば、ロボットはその間違いから学びます。もし成功を示せば、その経路を強化します。このサイクルにより、ロボットは、ステップごとに導いてくれる人間がいなくても、自らのアイデアを絶えずテストし、洗練させることで、自身のポリシー(行動のためのルールセット)を改善することができるのです。
このシステムの基礎は、人間の手から収集された膨大な量のデータに基づいています。研究者たちはまず、カメラが人の頭部に装着されているかのような一人称視点のビデオを使用して、人間がどのように世界と相互作用するかをロボットに教えることから始めました。彼らは、料理から整理整頓まで多種多様なタスクを示す単純な単眼ビデオから始まり、その後、人間の両眼視のように奥行きを感じさせる、高度に同期されたステレオビデオへと移行しました。これにより、ロボットは手が物体を掴み、持ち上げ、操作する際の微妙な物理学を学ぶことができました。しかし、身体構造が異なるロボットにとって、単に人間を観察するだけでは不十分です。そこで研究者たちは、人間の動きをロボット特有の腕や手のメカニズムへと翻訳することを学ぶ中間段階のトレーニングへとシステムを導きました。このプロセスには、数千時間の人間データに続いて、人間とロボットがどのように協力できるかを示す具体的な例が含まれていました。これにより、人間の直感とロボットの実行能力の間の溝を埋めることができました。
Motus2をユニークにしているのは、その知識の使い方です。このシステムは、同時に3つの異なる役割を果たす、単一の統合されたモデルを中心に構築されています。第一に、次に取るべき行動を提案する「ポリシー」として機能します。第二に、その行動をとった後に世界がどのようになるかを予測する「シミュレーター」として機能します。第三に、その予測された未来が良いものか悪いものかを判断する「エバリュエーター(評価器)」として機能します。従来のシステムでは、これらの機能は別々であったり、断絶していたりすることが多いのですが、ここでは密接に結びついています。ロボットが動きを検討するとき、即座に内部シミュレーションを実行して、その結果を予測します。そして、その結果が望ましいかどうかを自らに問いかけます。もし答えが「ノー」であれば、その経路を破棄して別の方法を試します。もし答えが「イエス」であれば、その行動を実行します。この内部対話は非常に迅速に行われるため、ロボックは筋肉を動かす前に、数ステップ先の計画を立て、最善の経路を選択することができるのです。
研究者たちは、2本の腕、2つの器用な手、そして人間の指先のような触覚センサーを備えた完全なロボットプラットフォーム上でこのシステムをテストしました。彼らは、ボールを特定の場所に置く、電球をソケットにねじ込む、消しゴムをペンに取り付けるといった、一連の困難なタスクをロボットに課しました。これらのテストにおいて、自らのシミュレーションから学ぶロボットの能力が極めて重要であることが証明されました。システムがタスク中に最適な選択肢を選ぶために内部エバリュエーターを使用できる場合、成功率は大幅に向上しました。さらに印象的なことに、システムが自身の予測を使用して学習ルール自体を更新できる場合、タスクへの習熟度はさらに高まりました。ロボットは単に運が良かったのではなく、シミュレートされた間違いを回避し、成功するとシミュレートされた行動を繰り返すことを真に学んだのです。
この成功の鍵となったのは、タスクの途中で情報が一時的に見えなくなったとしても、以前に起きたことを記憶するロボットの能力でした。多くの複雑な仕事では、手が物体の視界を遮ったり、最終的な結果が見えるずっと前に重要なステップが発生したりすることがあります。これに対処するため、研究者たちは、過去の重要な視覚的詳細を保持できる「ワーキングメモリ(作業記憶)」をロボットに与えました。彼らは、最近の出来事を記録する短いローリングウィンドウから、より長く詳細な履歴を維持するものまで、メモリ管理のさまざまな方法をテストしました。その結果、より長い履歴にアクセスできることが、より長い期間にわたる一連のイベントを記憶する必要があるタスクの解決を可能にすることが示され、過去を思い出す能力は未来を予測することと同じくらい重要であることが証明されました。
また、このシステムには触覚のための専用モジュールも組み込まれました。視覚は強力ですが、グリップが滑っているのか、あるいは表面が柔らかすぎるのかどうかまでは判断できないことがあります。ロボットには、触覚フィードバックを処理することに特化した軽量のエキスパートシステムが装備されていました。これにより、ロボットはリアルタイムで動きを微調整し、滑りや圧力の変化を感じた瞬間にグリップを調整することが可能になりました。視覚、触覚、思考、そして学習の組み合わせが、現実世界の不確実性を扱うことができる堅牢なシステムを生み出したのです。
これらの知見は、真に能力のあるロボットへの道は、単にデータを集めることではなく、そのデータを用いて自らを問い直し、改善できるシステムを構築することにあると示唆しています。大規模な人間との相互作用データと、予測と評価の自己修正ループを組み合わせることで、Motus2は、ロボットが以前は到達不可能であったレベルの適応力を持って物理的な世界を操作できることを実証しました。研究者たちは、トレーニングに使用するステレオビデオの量を増やすにつれて、人間の行動を予測するロボットの能力が一貫して予測可能な形で向上することを発見しました。このスケーリング(規模拡大)は、さらに多くのデータがあれば、これらのシステムはさらに熟達できる可能性があることを示唆しています。結局のところ、この研究は、ロボットがすべての問題に対するあらゆる解決策をプログラムされる必要はないということを示しています。もし、未来をシミュレートし、結果を判断し、その差異から学ぶことができれば、複雑で器用さが求められる世界における課題に応えるために、自らのスキルを進化させることができるのです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。