← 最新の論文
🤖 machine learning

Cross-Embodiment Transfer via Behavior-Aligned Representations

本論文は、多様なクロスエンボディメント・データを統一し、ロボットの転移性能を大幅に向上させるために、行動に整合した表現、特にエンドエフェクタの軌跡をビジョン・ランゲージ・アクションモデル内で使用することを提案しており、シミュレーションでの事前学習後に実世界でのタスク完了率を28%向上させることを達成している。

原著者: Ajay Sridhar, Jensen Gao, Jonathan Yang, Jean Mercat, Suneel Belkhale, Dorsa Sadigh

公開日 2026-07-31
📖 1 分で読めます☕ さくっと読める

原著者: Ajay Sridhar, Jensen Gao, Jonathan Yang, Jean Mercat, Suneel Belkhale, Dorsa Sadigh

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

ロボットに家事のやり方を教えようとしている場面を想像してみてください。機械学習の世界には、あらゆる場所から集めた膨大なデータをモデルに与える方が、単一の特定のソースからのみデータを与えるよりも賢くなるという、ある有名な考え方があります。これは、世界中を旅して多くの言語を学んだ人間が、一つの小さな町にしか住んだことがない人よりも、新しい状況に適応しやすいのと似ています。ロボットにとってこれは、さまざまな種類のロボット(長い腕を持つものもあれば、短いものも、爪のような形をしたグリッパーを持つものも、ピンセットのようなものを持つものも)から収集されたデータを用いて学習させたいということを意味します。これは「クロスエンボディメント(異種身体間)」学習と呼ばれます。目標は、多くの異なる機械の経験のライブラリから知識を学び、見たこともない新しいロボットに応用できる「ユニバーサル」なロボットの脳を作り出すことです。しかし、大きな問題があります。背の高いロボットに搭載されたカメラは高い角度から世界を見ている一方で、低いロボットは床に近い位置から世界を見ています。彼らの「手」の動きは異なり、アクションコマンド(動作指令)も異なる「言語」で書かれています。これらのバラバラで不一致のあるデータセットを混ぜようとすることは、自動車、トラック、自転車のビデオを、それらの違いを説明することなく一度に見せながら、学生に車の運転を教えようとするようなものです。これは混乱を招き、多くの場合、ロボットは行き詰まってしまいます。

「Behavior-Aligned Representations(行動に整合した表現)によるクロスエンボディメント・トランスファー」と題されたこの論文は、「ロボットを全く同じに見せたり動かしたりしようとするのではなく、共通の『行動言語』を話せるように教えることはできないか?」という巧妙な問いを投げかけることで、その混乱に対処しています。著者たちは、スタンフォード大学とトヨタ・リサーチ・インスティテュートのチームです。彼らは、異なるロボット間の溝を埋めるために、個別のメカニズムではなく、動作の「ストーリー」に焦点を当てることで可能だと提案しています。彼らは、「行動に整合した表現(behavior-aligned representations)」、つまり、動きの簡略化された要約(例えば、「左へ下へ動く」といった動きのテキスト記述、持ち上げる対象物を囲むボックス、あるいはロボットの手が空中を移動する経路を辿る線など)を使用することを提案しています。

研究者たちは、自ら構築したRoboCasa-Xという新しいシミュレーション・ベンチマークを用いて、このアイデアをテストしました。彼らは、3種類のソースロボットからの膨大なデータセットを用いて、ロボットの脳(具体的にはVision-Language-Actionモデルと呼ばれるタイプ)を訓練しました。その後、訓練データに含まれていない4種類のターゲットロボットに対して、その知識を転移させました。そして、生のデータのみを用いた訓練と、これらの追加の「行動要約」を加えた訓練を比較しました。

結果は非常に示唆に富むものでした。研究によれば、これらの行動要約を追加することで、ロボットが新しい身体へとスキルを転移させるのが大幅に容易になることが分かりました。テストされたさまざまな種類の要約の中でも、「エンドエフェクタ・トレース(末端部軌跡)」、つまりカメラの視野内におけるロボットの手が描く2Dの経路が、最も強力なツールでした。ロボットがこれらのトレースを用いて訓練されたとき、彼らは新しいハードウェアへの適応能力が格段に向上しました。実際、シミュレーションデータで事前学習されたポリシー(方策)を実世界のロボットでテストした際、これらの表現を用いることで、タスク完了の進捗が28%向上しました。

興味深いことに、この論文は、ロボットが実際にタスクを行っている最中に、必ずしもこれらのトレースについて「考える」必要はないことも明らかにしました。モデルは、アクション(動作)と並行してこれらのトレースを予測するように訓練されるときに最もよく学習しましたが、実際の作業中には、単にアクションを直接予測するだけで十分に機能しました。これは、トレースが訓練中にタスクの根本的なロジックを学習するのを助ける「補助輪」として機能し、後で取り外すことができるものであることを示唆しています。さらに、チームは、これらの表現が、アクションコマンドが含まれていないデータ(アクションフリー・データ)からさえも、行動要約が存在すれば学習できることを示しました。

著者たちは、彼らの手法が特定のシミュレーションや実世界のテストにおいてうまく機能する一方で、ロボットがある程度のタスクの類似性とカメラの設定の共通性に依存していることを慎重に注記しています。彼らは、この方法があらゆる可能なロボットの不一致に対して機能することを証明したわけではありませんが、彼らの実験は、ロボットに共有の「行動的語彙」を与えることが、より適応性の高い機械を作るための有望な方法であることを強く示唆しています。特定の「誰(どのロボットモデルか)」ではなく、動きの「何(何を)」と「どのように(どうやって)」に焦つけることで、彼らは、膨大で混沌としたロボットデータのライブラリを、より賢く柔軟な機械を構築するために実際に役立つものにする方法を見出したのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →