Riemann-1.0: An Embodied World Action Model for Physical AI
Riemann-1.0は、20万時間を超える多様なエンボディド・データの漸進的な事前学習戦略を活用することで、シミュレーションおよび実世界の長期間の操作タスクの両方において最先端の性能を達成する、マルチビュー観測、ロボットの状態、およびアクションを単一のフレームワークに統合した統一的な因果的自己回帰型ワールド・アクション・モデルである。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
人工知能は、テキストを読み、画像を認識し、コンピュータ画面の枠内でパズルを解くといった、デジタル領域における熟達者として長い間君臨してきました。しかし、機械が真に物理的な世界に加わるためには、単に目に見えるものを理解するだけでなく、その中でどのように行動するかを学ぶ必要があります。これが「身体化された知能(embodied intelligence)」の課題です。つまり、ロボットに対し、周囲の環境を感知し、原因と結果について推論し、人間がコップを手に取ったりシャツを畳んだりする時のような流暢さで物理的な動きを実行する方法を教えることです。機械が成功するためには、物体がどのように見えるかだけでなく、触れた時にそれらがどのように動き、変化するかを理解する世界のモデルが必要です。ブロックを押せばそれが滑るということや、蓋を持ち上げれば中身が現れるということを学ばなければなりません。これまで、これらの物理的な行動を計画することと、その行動による視覚的な結果を予測することの両方ができる単一のシステムを作り上げることは困難な壁であり、多くの場合、「考えるためのシステム」と「動くためのシステム」を別々に用意する必要がありました。
ある研究チームは、ロボットの行動とその結果としての世界の変化を、一つの連続した物語として扱うことでこの溝を埋めるために設計された、「Riemann-1.0」と呼ばれる新しいシステムを発表しました。このモデルは、何をすべきかを決定するためのツールと、次に何が起こるかを想像するためのツールを別々に構築するのではなく、その両方を同時に行う方法を学習します。それはシンプルですが強力な原理に基づいています。現実の世界では、行動は常に結果が見られる前に起こるという原則です。もしロボットがスプーンに手を伸ばすなら、まず動きが発生し、その後に視覚的な変化、つまりスプーンが動く現象が続きます。Riemann-1.0はこの順序を尊重するように構築されており、膨大なビデオと動きのデータコレクションから学習することで、次に何をすべきか、そしてそれを行った後に世界がどのようになるかを正確に予測します。
このシステムを教えるために、研究者たちは合計20万時間を超える相互作用からなる膨大な経験のライブラリを集めました。このコレクションは単なるロボットのビデオの山ではありませんでした。それは、3つの異なる種類の学習素材を組み合わせた、注意深く精選されたものでした。第一に、料理や掃除などの日常的なタスクを行う人間の視点から記録された、数千時間のビデオが含まれています。これらのビデオは、ロボット特有の機械的なデータこそ欠いているものの、物体がどのように相互作用し、タスクがどのように展開していくかという幅広い理解を提供しました。第二に、手持ちのロボットグリッパーやウェアラブルデバイスからのデモンストレーションが加えられました。これらは、人間の手の動きがどのように機械的な制御へと変換されるかを示す架け橋となります。最後に、実際のロボットの動きの精密な記録が含まれ、機械に自身の肢体を動かす方法を教えるために必要な、正確に実行可能な指示を提供しました。これらのソースを組み合わせることで、研究者たちは、人間の経験の広範な知恵から学びつつ、その知識をロボット制御の精密なメカニズムに根付かせることができる、統一されたデータセットを作り上げたのです。
Riemann-1.0の学習プロセスは、一般的な観察から具体的な実行へと進む、学校のカリキュラムのような構造をとっていました。第一段階では、モデルは膨大な人間のビデオを学習しました。これらのビデオにはロボットの動きのデータが含まれていないため、システムは、画面上で見られる視覚的な変化を引き起こしたはずの「目に見えない行動」を推定するための補助ツールを使用しました。これにより、完璧なロボットのデータを必要とせずに、世界がどのように動くかという基本的なダイナミクスを学習することができました。第二段階では、モデルに人間の手とロボットグリッパーの混合データが導入され、動きに関する理解を実際の物理的な制御へと整合させる学習を行いました。最後に、第三段階において、モデルはロボットがタスクを実行する高品質な記録のみに焦点を当てました。この最終フェーズは、生成されるコマンドが単に視覚的に妥当であるだけでなく、実際の機械が実行可能な物理的にも可能なものであることを保証するために、精密で実行可能なコマンドを生成する能力を研ぎ澄ませました。
このアプローチの結果は驚くべきものでした。コンピュータシミュレーションおよび実機のロボットの両方を用いた幅広いタスクにおいて、Riemann-1.0は従来の手法を大幅に上回る成果を上げました。多くのステップを伴う長く複雑なタスクをテストするためのシミュレーションにおいて、このモデルは62.6%の成功率を記録し、既存の最高水準のシステムに対して顕著な改善を示しました。二本腕ロボットに焦点を当てた別のシミュレーションでは、94.3%の成功率を達成しました。おそらく最も印象的なのは、色の付いたブロックを積み重ねる、服を畳む、散らかった机を整理する、あるいはキッチン用品を配置するといったタスクを実機のロボットに展開した際、システムは85%の割合でタスクを成功させたことです。また、ルービックキューブを箱に入れる、タオルを洗面器に入れるといった、見たことがない新しい状況への適応力も驚異的であり、これらの未知の試行においても85%の成功率を収めました。
単なるロボットコントローラーとして機能するだけでなく、Riemann-1.0はシミュレーターとしても機能することができます。行動と視覚的な結果の間の因果関係を理解しているため、研究者は「もしロボットが特定の動きを行ったらどうなるか」をモデルに問いかけることができます。モデルは未来のビデオを生成し、提供された行動に基づいて、物体がどのように動き、どこに到達するかを正確に示します。この二重の能力により、このシステムは、ロボットが実際に動く前に、計画がうまくいくかどうかを確認するための「脳」であると同時に、「想像力」としての役割も果たすことができます。行動がどのように変化を引き起こすかという現実に根ざした、未来の物理的世界を予測するこの能力は、人工知能を物理的な世界における信頼できるパートナーにするための重要な一歩となります。この研究は、行動する方法の学習と、世界がどのように反応するかを学ぶことを統合することで、機械が私たちが日々行うタスクに対して、より堅牢で汎用的な理解を発達させられることを示唆しています。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。