← 最新の論文
💻 computer science

FetchMan: Learning Visual Humanoid Loco-Manipulation Policies from Simulated Experiences

本論文は、Flow-GRPO強化学習を用いてポリシーを洗練させることで、合成的な行動模倣(behavior cloning)の性能限界を克服し、Unitree G1ヒューマノイドが未知のシーンにおけるloco-manipulationタスクにおいて73.3%のゼロショット成功率を達成することを可能にする、エンドツーエンドのsim-to-realパイプラインであるFetchManを紹介するものである。

原著者: Omar Rayyan, Zhi Li, Max Argus, Yuxin Jiang, Chang Yu, Chenfanfu Jiang, Yuchen Cui

公開日 2026-09-01
📖 1 分で読めます☕ さくっと読める

原著者: Omar Rayyan, Zhi Li, Max Argus, Yuxin Jiang, Chang Yu, Chenfanfu Jiang, Yuchen Cui

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

ロボットが部屋に入り、特定の物体を見つけ、それを手に取るという夢は、長らくロボット工学における中心的な目標となってきました。数十年にわたり、研究者たちは機械にこのような複雑な行動を教えようと苦闘してきました。なぜなら、これには「空間内での身体の移動」と「手を使って世界と相互作用すること」という2つの困難なスキルを同時に機能させる必要があるからです。ロボットは単独での歩行については非常に優れたものになっていますが、二足歩行でバランスを取りながら、手を伸ばして物を掴む能力を加えることは、プログラミングによる手動制御が極めて困難な、物理学の混沌とした混合状態を生み出します。また、このようにロボットを教えるために必要なデータを収集することも大きな障壁です。人間が、あらゆる部屋において、ボウルに向かって歩き、それを拾い上げるためのあらゆる可能な方法を実演し続けることは、何年もかかるでしょうし、ロボットを破損させるリスクもあります。これを解決するために、科学者たちはコンピュータ・シミュレーションへと目を向け、ロボットが損傷の恐れなく何百万回も練習できるデジタル世界を作り出してきました。しかし、大きな疑問が残っていました。デジタル世界で完全に訓練されたロボットは、実際の家という、乱雑で予測不可能な現実を扱うことができるのだろうか、という点です。

カリフォルニア大学ロサンゼルス校の研究チームは、アレン人工知能研究所およびワシントン大学の共同研究者と共に、「FetchMan」と呼ぶ新しいシステムを用いてこの課題に取り組みました。彼らの研究は、人間によく似た動きをするヒューマノイド・ロボット「Unitree G1」に焦点を当てています。チームは、コンピュータ・シミュレーションの中で数千もの例を見せるだけで、このロボットに部屋を移動してターゲットとなる物体を掴むことを教え、さらなる追加訓練なしに、実世界でそのタスクを完璧に遂行させることができるかどうかを確かめたいと考えました。彼らは、単にロボットにタスクの例を増やして見せるだけでは不十分であることを発見しました。15万通り以上の異なるシーンで訓練を行った後でも、ロボットの性能は厳しい限界に突き当たりました。ロボットはデジタルの教師を模倣することはできましたが、歩行からリーチング(手を伸ばす動作)へとスムーズに移行するために必要な、微妙なタイミングを学習することができなかったのです。ロボットは物体を掴もうとするのが早すぎたり、歩行を止めるのが早すぎたりすることがあり、それはロボットには見えない「秘密の情報」を使用している教師をコピーしようとしたために失敗が生じたのでした。

この障壁を打破するために、研究者たちは訓練プロセスに第2段階を追加しました。デジタルの教師をただコピーするのではなく、シミュレーション内でロボット自身に練習させ、物体まで歩いていき、それを拾い上げるというタスク全体を成功させた時のみ報酬を与えるようにしたのです。この手法は「強化学習」と呼ばれる技術を用いたもので、これによりロボットは正しいタイミングと動きを自ら編み出すことができました。ロボットは、単に模倣していた時に犯していた間違いを修正しながら、リーチングを行う前に物体に近づいて歩くことを学んだのです。チームがこの洗練されたロボットを実世界でテストした際、その結果は驚くべきものでした。訓練中に実際の部屋や実際の物体を一度も見学していなかったにもかかわらず、ロボットは未知の空間に入り、ターゲットとなるボウルを特定し、73パーセント以上の成功率でそれを掴むことができました。これは、初期の訓練手法が実世界のテストで約57パーセントの成功率しか達成できなかったのと比較して、大幅な改善でした。

研究者たちはまた、このアプローチがボウルだけでなく、多くの異なる種類の物体に対しても機能するかどうかを調査しました。彼らは、物体の名前をヒントとして与えることで、パン、ボトル、本といったアイテムを認識して拾い上げるシステムを訓練しました。このマルチオブジェクト版は、シングルオブジェクト版ほど高い成功率には至りませんでしたが、それでも多様な状況下でタスクを遂行することができ、この手法がスケールアップ可能であることを証明しました。この研究は、教師を模倣することは優れた出発点ではあるものの、複雑な物理的タスクをマスターするにはそれだけでは不十分であることを浮き彫りにしています。ロボットが世界の中での動き方を真に理解するためには、自らの成功と失敗から探索し、学ぶ自由が必要なのです。膨大な量のシミュレーションによる練習と、自己修正のための最終段階を組み合わせることで、チームは、一歩一歩人間の手助けを必要とすることなく、新しい環境に適応できるロボットを作り出すための明確な道筋を示しました。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →