← 最新の論文
⚡ electrical engineering

OmniRetarget: Interaction-Preserving Data Generation for Humanoid Whole-Body Loco-Manipulation and Scene Interaction

OmniRetargetは、インタラクションメッシュを活用することでエンボディメント・ギャップを克服し、人間と物体または環境との決定的な関係性を維持する、相互作用保存型のデータ生成エンジンであり、複雑な学習カリキュラムを必要とせずに、堅牢で長期的なヒューマノイドの移動操作およびパルクール技術のための高品質な訓練データの効率的な作成を可能にします。

原著者: Lujie Yang, Xiaoyu Huang, Zhen Wu, Angjoo Kanazawa, Pieter Abbeel, Carmelo Sferrazza, C. Karen Liu, Rocky Duan, Guanya Shi

公開日 2026-06-17
📖 1 分で読めます☕ さくっと読める

原著者: Lujie Yang, Xiaoyu Huang, Zhen Wu, Angjoo Kanazawa, Pieter Abbeel, Carmelo Sferrazza, C. Karen Liu, Rocky Duan, Guanya Shi

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

ロボットにパルクールをさせたり、重い椅子を持って丘を登らせたり、壁を登らせたりしたいと想像してみてください。すべての筋肉の動きを一つひとつ手作業でプログラミングすることもできますが、それはまるで、水の抵抗についての物理学の教科書を書くことで人に泳ぎ方を教えようとするようなものです。それはあまりにも困難で、時間がかかりすぎます。

その代わりに、OmniRetargetの開発者たちは、人間が動作を行う様子を見せることでロボットに学習させることにしました。しかし、ここに落とし穴があります。人間とロボットは見た目が全く異なるのです。もし人間の動きをそのままロボットにコピーしてしまうと、ロボットの足が床の上を滑ったり(スケートのように)、足が椅子を通り抜けたり、関節がありえない方向にねじれたりしてしまうかもしれません。

OmniRetಟargetは、この問題を解決する新しい「魔法の翻訳機」です。以下に、簡単な比喩を用いてその仕組みを説明します。

1. 「インタラクション・メッシュ」(見えないクモの巣)

人間、ロボット、椅子、そして地面が、目に見えない、伸縮性のあるクモの巣によってつながれていると考えてください。

  • 問題点: 人間が動くと、そのクモの巣は自然に伸び縮みします。もし単に人間のポーズをロボットにコピーしようとすると、ロボットの身体パーツの位置が異なるため、クモの巣が引きちぎれたり破れたりしてしまいます。
  • 解決策: OmniRetargetは、人間の関節と、その人間が触れている物体とをつなぐデジタルな「インタラクション・メッシュ(3Dの網)」を構築します。人間の動きをロボットへと変換する際、システムはこのウェブをロボットの体に合うように伸ばしたり縮めたりしますが、ウェブ自体は壊さないように維持します
  • 結果: もし人間の手が椅子に触れていれば、新しいバージョンにおけるロボットの手も必ず椅子に触れます。もし人間の足が地面にしっかりと踏みつけられていれば、ロボットの足もその場に留まります。これにより、ロボットが物体を通り抜けたり、滑ったりすることを防ぎます。

2. 「厳格なコーチ」(ハードな制約)

これまでの変換システムは、「人間のようになろうとしてみて。でも、少し床に埋まってしまっても大丈夫だよ」と言うようなコーチのようなものでした。
OmniRetargetは厳格なコーチです。これは、以下のルール(数学的な制約)を用いた、決して破ることのできないルールを使用します。

  • 「足は滑ってはならない」
  • 「体は椅子を通り抜けてはならない」
  • 「関節は後ろ側に曲がってはならない」
    システムは、人間の動きに似つつも、あらゆる物理法則に従う方法を見つけ出すという、複雑なパズルを解きます。

3. 「一対多」のコピー機(データ拡張)

通常、ロボットに赤い箱を拾うことを教えるには、人間が赤い箱を拾うデモンストレーションをする必要があります。青い箱を拾うことを教えるには、また別のデモンストレーションが必要です。
OmniRetargetは、スマートなコピー機のようなものです。

  • あなたがたった一つの人間のデモンストレーション(例:箱を拾う動作)を見せると、
  • システムは自動的に、何百ものバリエーションを生成します。例えば、背の高い箱を拾う、低い箱を拾う、異なる場所にある箱を拾う、あるいはより高いプラットフォームに登る、といった具合です。
  • これは、核となる動きのロジックを維持したまま、数学的に「クモの巣」の形を作り変えることで実現されます。これにより、わずかな数の人間のビデオから、膨大なトレーニング・データのライブラリを作成できるのです。

大きな成果:シミュレーションから現実へ

研究者たちは、強化学習(試行錯誤による学習法)を用いて、このシステムでロボット(Unitree G1 ヒューマノイド)を訓練しました。

  • トレーニング: データが非常にクリーンで物理的に正しかったため、ロボットはわずか5つの単純なルール(報酬)だけで学習することができました。間違いを修正するための複雑で煩雑な指示は必要ありませんでした。
  • 結果: ロボットは、椅子の運搬、椅子へのステップ、そこからのジャンプ、そしてロールといった動作を含む、30秒間のパコースコースを完遂することを学びました。
  • ゼロショット転移: これが最も印象的な部分です。ロボットは、これらの翻訳された動きを使用して、コンピュータ・シミュレーション内でのみ学習しました。しかし、いざ実世界でスイッチを入れると、追加の調整なしで即座に動作しました。ロボットは、現実のコンクリートの上での歩き方を「再学習」する必要はありませんでした。ただ、何をすべきかを理解していたのです。

まとめ

要するに、OmniRetargetは「エンボディメント・ギャップ(身体性の差)」を解決します。人間の動きを取り込み、それがロボットにとって意味を成すように、物理的に整合性の取れた保護的な「ウェブ」で包み込み、それを使って無限の練習シナリオを生み出します。これにより、ロボットはパルクールや物体の操作といった複雑で機敏なスキルを迅速に学習し、コンピュータ上のスキルを現実の世界へと成功裏に転移させることができるのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →