← 最新の論文
💻 computer science

Unleashing Infinite Motion: Scaling Expressive Quadrupedal Motion via Generative Video Priors

本論文は、LLMとビデオ拡散モデルを活用して、多様な四足歩行の動作に関する大規模な言語注釈付きデータセットを生成し、動物のデータに依存することなく、実機ロボットへの表現力豊かなコンパニオンのような振る舞いの展開を成功させるためのポリシー訓練を可能にする、完全自動化されたパイプラインであるUni-Moを紹介するものである。

原著者: Youzhi Liu, Li Gao, Yifei Qian, Liu Liu, Yang Cai, Ziqiao Li

公開日 2026-06-29
📖 1 分で読めます☕ さくっと読める

原著者: Youzhi Liu, Li Gao, Yifei Qian, Liu Liu, Yang Cai, Ziqiao Li

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 ✨ これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

論文解説:無限の動きを解き放つ:生成ビデオ・プライアによる表現力豊かな四足歩行動作のスケーリング

大きな問題:歩くことしかできないロボット犬

想像してみてください。あなたの手元にロボット犬がいるとします。それは走ったり、階段を飛び越えたり、蹴られても姿勢を立て直したりすることには非常に長けています。しかし、「お辞儀をして」「ダンスをして」「バックフリップをして」といった指示を出すと、ただあなたをじっと見つめるだけです。まるで、その場でのジョギングのやり方しか知らない、優秀なアスリートのようです。

長い間、科学者たちは本物の動物(犬やチーターなど)を撮影し、その動きを模倣させることで、ロボットに新しい技を教えようとしてきました。しかし、このアプローチには3つの大きな欠陥があります。

  1. 「協力的な動物」の問題: 本物の犬に対して「キャリブレーションのためにこのポーズで止まって」とか「命令に従ってバックフリップして」と言うことはできません。彼らはただ、自分の好きなように動くだけです。
  2. 「翻訳」の問題: 本物の犬は柔軟な脊椎と異なる体型を持っています。本物の犬の動きをロボットにコピーしようとするのは、丸い穴に四角い杭を打ち込もうとするようなものです。数学的な計算が破綻し、ロボットが不可能な動きをしたり、転倒したりしてしまいます。
  3. 「退屈」な問題: 私たちが実在の動物に依存している限り、得られるのは動物が自然に行う動き(歩行や走行)だけです。私たちがロボットに期待するような、楽しくて表現力豊かな動きは取りこぼされてしまいます。

解決策:Uni-Mo(「空想の犬」工場)

著者らは、Uni-Moと呼ばれる新しいシステムを提案しています。彼らは実在の動物を撮影する代わりに、AIを使って動きを**「夢に見る(作り出す)」**ことに決めました。

例えるなら、犬にダンスのルーチンを教えるために本物の犬を雇うのではなく、超スマートな「AI映画監督」を雇うようなものです。あなたがいわゆるテキストプロンプト(例:「バックフリップをして」)を与えると、AIがまさにその通りに動くロボット犬のビデオを生成します。

パイプラインのステップ・バイ・ステップの仕組みは以下の通りです。

1. 脚本家(LLM)

まず、大規模言語モデル(LLM、非常にクリエイティブなライターのようなもの)が、ロボット犬が行う数百の楽しいアイデアを考え出します。「タップダンスを踊る」「礼儀正しくお辞儀をする」「後ろにキックする」といったプロンプトを書き上げます。

2. 映画監督(ビデオ拡散モデル)

次に、これらのプロンプトが「ビデオ拡散モデル(Video Diffusion Model)」へと送られます。これは、テキストからビデオを生成できるAIです。

  • 従来の方法: 標準的なビデオAIにロボット犬のダンスを頼むと、AIは混乱してしまいます。ロボットの足が溶けたり、頭が塊になったり、体が taffy(飴細工)のように伸びたりします。これは**「アイデンティティの漂流(Identity Drift)」**と呼ばれます。キャラクターが毎秒形を変えてしまう、質の悪い特殊効果のようなものです。
  • 新しいトリック(Identity Consistency Loss): 著者らは、AIに対して特別なルールを考案しました。それは、「ロボットがどのように動こうとも、それは常に同じロボットでなければならない。体のパーツが溶けたり形が変わったりしてはいけない」という指示です。彼らは、AIが最初のフレームから最後のフレームまで、ロボットの外観を一貫して保つように強制する数学的な「ガードレール(損失関数/Loss function)」を追加しました。これにより、AIはロボットが堅牢で硬質な機械として見えるビデオを生成できるようになりました。

3. 翻訳者(3D抽出)

AIが完璧なロボットのダンスビデオを作成したら、システムはその2Dビデオを、実際のロボットが理解できる3Dの指示へと変換する必要があります。

  • ビデオ生成器がカメラを固定し、ロボットの形状を一貫させるよう強制されたため、システムはビデオを簡単に「読み取る」ことができます。
  • システムは、すべての関節がどのように動くべきかを正確に計算し、ロボットのための3D「台本」(軌跡)を作成します。

4. リハーサル(トレーニング)

システムはこれらの3D台本を取り込み、標準的なトレーニング手法を用いて、実際のロボット(Unitree Go2)にそれらを教えます。これは、ロボットに何をすべきか正確に示すダンスインストラクターを与えるようなものです。

結果:「Quad-Imaginarium」

チームは単に一つのビデオを作ったのではありません。彼らはQuad-Imaginariumと呼ばれる巨大なライブラリを構築しました。

  • 規模: 7,500種類近い異なるロボットの動きを含み、合計18.5時間のユニークなアクションを収録しています。
  • 多様性: アクロバット、ジェスチャー、そして実在の動物には滅多に見られない表現力豊かな行動が含まれています。
  • 成功率:
    • コンピュータ・シミュレーション内では、ロボットはこれらの新しい動きの**97.6%**を成功させました。
    • 現実世界の実機ロボットにおいても、転倒することなく**96.7%**の動きに成功しました。

なぜこれが重要なのか

この論文は、ロボットに動きを教えるために実在の動物に頼る必要はないことを証明しています。AIを使って「夢の動き」を生成し、それを現実へと慎重に翻訳することで、ロボット犬に「個性」を与えることができるのです。彼らは単なる「移動機械」であることをやめ、ダンスをしたり、身振り手振りをしたり、豊かで表現力豊かな方法で相互作用したりできる、「伴侶のような」存在になれるのです。

要約すると: 彼らは「実在の犬を撮影する」方法を「完璧なロボット映画を生成する」方法に置き換え、ビデオ内でロボットが溶けてしまう問題を解決し、実機のロボットがこれまでできなかったことを実行できるようにすることに成功したのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →