← 最新の論文
🤖 AI

ADEPT: Accelerating Dexterity via Pre-Training and Post-Training using Reinforcement Learning

ADEPTは、汎用的なタスクでの事前学習と、生の視覚・触覚知覚から複雑で長期的な操作タスクを解決するためのゼロショットのSim-to-Real転移を可能にする安定した事後学習レシピを採用することにより、高自由度ロボットにおける人間レベルの器用さの開発を加速させる大規模な強化学習フレームワークである。

原著者: Jayjun Lee, Jessica Yin, Asif Rana, Nicholas Blauch, Sam Mady, Mohak Bhardwaj, Nima Fazeli, Nathan Ratliff, Karl Van Wyk, Ankur Handa

公開日 2026-08-20
📖 1 分で読めます☕ さくっと読める

原著者: Jayjun Lee, Jessica Yin, Asif Rana, Nicholas Blauch, Sam Mady, Mohak Bhardwaj, Nima Fazeli, Nathan Ratliff, Karl Van Wyk, Ankur Handa

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

ロボットは長らく工場の主役であり、車を組み立てたり箱を積み上げたりするために、硬直した精密さで動いてきました。しかし、壊れやすい卵を手に取り、ひっくり返し、ボウルの中にそっと置くといった、日常生活における流動的で繊細な作業を求められると、ほとんどの機械は失敗します。これが「器用さ(デクスタリティ)」の課題です。これには、数十の可動部品を同時に調整し、物体が滑ったり、転がったり、衝突したりするという混沌とした物理現象を管理するために、触覚と視覚にリアルタイムで反応することが求められます。長年、研究者たちは、厳格なルールをプログラミングしたり、人間のデモンストレーションを見せたりすることでロボットにこれらのスキルを教えようとしてきましたが、これらの手法は環境がわずかに変化しただけで失敗することがよくありました。しかし、ある新しいアプローチは、ロボットの器用さの秘訣は、特定のタスクをゼロからすべて教え込むことではなく、まず物理的な世界に対する広範で基礎的な経験を与えることにあると示唆しています。

研究チームは、物体を「再配置」するという一般的なゲームをマスターさせることで、複雑な操作スキルを学習させるADEPTと呼ばれる新しいフレームワークを開発しました。仮想世界の中で、ロボットの手がシリンダー、立方体、球体といったランダムな形状を単に掴み、テーブルの異なる場所に移動させることに数ヶ月を費やす様子を想像してみてください。ロボットは、単に物体を移動させるという目的以外に具体的な目標を持たず、リーチ(手を伸ばす)、把握、持ち上げ、そして回転することを学びます。このフェーズにより、物体がどのように振る舞うか、そしてそれらを制御するためにロボット自身の指がどのように動くべきかという、深く直感的な理解が構築されます。この基礎が築かれた後、研究者は、ペグを穴に挿入したり、皿を食器ラックに置いたりといった、特定の新しいタスクを導入します。最初からやり直すのではなく、ロボットは以前の経験をガイドとして利用します。研究者たちは、この方法によって、ロボットが初期のぎこちない学習フェーズをスキップし、即座にその一般的なスキルを新しい特定の課題に適用できることを発見しました。

このアプローチの威力は、ロボットが未経験のタスクに直面したときに明らかになります。実験において、研究者たちは、23個の可動関節を持つものと29個の可動関節を持つものの、2種類の多指ハンドを備えたロボットアームを用いてシステムをテストしました。彼らは高精度なシミュレーション内でロボットを訓練し、そこでは何千もの試行を同時に実行することができました。ロボットはまず、さまざまな単純な形状を再配置することを学びました。その後、研究者がロボットに、精密な位置合わせと接触力の扱いを必要とする難しいタスクである「ボードへのペグの挿入」を命じたとき、ロボットはゼロから始めたわけではありませんでした。彼らは、リーチ、把握、持ち上げるという、すでにマスターしていたスキルを即座に認識したのです。彼らが学ぶ必要があったのは、最後の繊細な挿入の部分だけでした。

しかし、あるタスクで訓練されたロボットに別のタスクを行わせようとすると、学んだことを忘れてしまうことがよくあります。研究者たちは、もしロボットの挙動を直接微調整(ファインチューニング)しようとすると、新しい指示が古いスキルを上書きしてしまい、ロボットが適切に把握したり持ち上げたりする能力を失ってしまうことを発見しました。これを解決するために、彼らは注意深いトレーニング・レシピを開発しました。まず、新しい挙動が古い成功した挙動に緩やかに近づくようにするテクニックを用い、核となるスキルが損なわれないようにしました。次に、新しいタスクにとっての「良い」動きとは何かという理解をゆっくりと調整し、バランスを崩すことなく適応できるようにしました。最後に、訓練中にロボットが使用していた内部データを取り除き、カメラを通じて見えるものと指先を通じて感じることだけに依存できる、よりシンプルなバージョンのロボットを訓練しました。この「生徒」ロボットが、現実の世界へと送り出されました。

結果は驚くべきものでした。現実世界において、これらのロボットは、視覚と触覚のフィードバックのみに頼りながら、ペグを掴み、手の中で向きを変え、穴に挿入することに成功しました。彼らは、対称的な星型のペグと、適合させるために単一の正確な向きを必要とする、より困難な非対称の四角形と円形のペグの両方を扱うことができました。また、システムは平らな皿を掴んで裏返し、食器ラックに置くという一連の動作も学習しましたが、これは初期のトレーニングでは明示的に示されていなかったシーケンスです。ロボットはこれらのタスクを5〜10秒で実行しました。これは人間と同等の速度であり、より単純なグリッパーと外部の固定具を使用する従来の手法では20〜70秒かかっていました。

決定的なことに、研究者たちは、ロボットが人間のように自然な方法で物体を保持することを発達させていることを見出しました。ペグの持ち方を教えられなくても、ロボットは人間と同じように、安定した多点グリップで指を巻き付ける方法を学習しました。対照的に、最初の再配置フェーズなしで訓練されたロボットは、一時的には機能するものの、圧力の下では失敗してしまうような、不器用で不安定な持ち方をすることがよくありました。この研究は、ロボットにまず物体に関する広範で一般的な経験を与えることで、すべてを一度に学ぼうとするよりも、はるかに速く、かつ確実に新しい特定のスキルを習得できることを示唆しています。このアプローチは、ロボットを単に速くするだけでなく、より堅牢にし、以前は手の届かなかったレベルの器用さで、現実世界の予測不可能な性質に対処することを可能にするのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →