← 最新の論文
💻 computer science

OmniMotion-X: Versatile Multimodal Whole-Body Motion Generation

OmniMotion-Xは、自己回帰型拡散トランスフォーマーと斬新なリファレンスモーション・コンディショニング戦略を活用し、最大規模の統合モーションデータセット(OmniMoCap-X)で学習された、最先端かつ多用途なマルチモーダル・フレームワークであり、テキストからのモーション生成、音楽からのダンス生成、音声からのジェスチャー生成といった多様なタスクにおいて、リアルで一貫性があり、かつ制御可能な全身の人間動作を生成します。

原著者: Guowei Xu, Yuxuan Bian, Ailing Zeng, Zhuo Chen, Mingyi Shi, Shaoli Huang, Wen Li, Lixin Duan, Qiang Xu

公開日 2026-07-21
📖 1 分で読めます☕ さくっと読める

原著者: Guowei Xu, Yuxuan Bian, Ailing Zeng, Zhuo Chen, Mingyi Shi, Shaoli Huang, Wen Li, Lixin Duan, Qiang Xu

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

ロボットにダンスを教えようとしているところを想像してみてください。あなたは「左腕を動かして」と指示したり、曲を流して「このビートに合わせて踊って」と言ったりできるでしょう。しかし、もしロボットに「すべてを同時に」やってほしいとしたらどうでしょうか?歌を聴き、語られる物語に従い、床の特定の経路に反応しながら、それでもなお、本物の人間のように自然に動いてほしいとしたら?これは「モーション生成(動きの生成)」という分野における聖杯であり、コンピュータ科学者が、機械にゼロから人間の動きを作り出す方法を教えようとしている領域です。長い間、これらのロボットは不器用な初心者のようなものでした。音楽に合わせて踊ることはできても、あるいはテキストのプロンプトに従って演技することはできても、それらのスキルを組み合わせることはできなかったのです。また、彼らはしばなし混乱したデータで学習しており、それはまるで、実際の泳ぎ手の鮮明な映像を見るのではなく、プールで水を跳ね上げている人々のぼやけたビデオを見て水泳を学ぼうとするようなものでした。研究者たちが問い続けている大きな疑問は、「これらすべての異なる指示を一度に理解し、高品質なデータから学び、自分の足をもつれさせることなく、滑らかでリアルかつ持続的な人間の動きを作り出すことができる単一の『脳』を構築できるか?」ということです。

ここで、デジタルな動きのオーケストラに対する超強力な指揮者のように機能する新しいプロジェクト、OmniMotion-Xが登場します。これまでのモーション生成AIモデルを、一つの楽器だけを完璧に奏でられるソリストだと考えてみてください。バイオリンのソロが欲しければ一つのモデルを呼び出し、ドラムのソロが必要なら別のモデルを呼ぶといった具合です。彼らはセッション(ジャム)することができませんでした。しかし、OmniMotion-Xは、統一された「シーケンス・トゥ・シーケンス(sequence-to-sequence)」モデルです。これは、単に脚本(テキスト)を読み上げたりビート(音楽)を聴いたりするだけでなく、前のシーン(参照モーション)を見て、「よし、彼らが直前までどのように動いていたかに基づいて、次にどのように動くべきかを正確に導き出そう」と言えるマスター・ストーリーテラーのようなものです。これは「拡散トランスフォーマー(Diffusion Transformer)」と呼ばれる巧妙なテクニックを使用しており、それはノイズや静止画の詰まった粘土の塊から始まり、完璧で流れるようなダンスが現れるまで、ゆっくりとノイズを削ぎ落としていく彫刻家のようなものです。

ここでの秘訣は、研究者がどのようにモデルを教えたかという点にあります。あらゆる可能な指示を一度にロボットに投げつけるのではなく――それは犬に対して、同時に「座れ」「待て」「持ってこい」「ゴロン」と教えるようなものです――彼らは「弱から強へ(weak-to-strong)」という学習戦略を用いました。まず、「物語に基づいて体を動かす」といった単純な概念をモデルに教えました。ロボットが基本を習得したところで、徐々に「今度はこの特定のリズムに合わせて」や「今度はこの正確な経路に従って」といった、より難しい制約を追加していきました。このステップ・バイ・ステップのアプローチによって、ロボットが混乱したり圧倒されたりするのを防いだのです。

しかし、賢い脳には良質なデータが必要です。そして、ここがこの論文のもう一つの輝かしい部分です。チームは、既存のモーションデータセットの多くが、異なる箱から集められたバラバラのパズルピースのようなものであることに気づきました。一部は低品質な推定値であり、一部は一貫性のない記述であり、どれ一つとして互いに適合していませんでした。これを解決するために、彼らは史上最大の統一モーションデータセットであるOmniMoCap-Xを構築しました。彼らは28種類の高品質なモーションキャプチャ・ソースを集めました。これは、ハイテクなスーツを着用した28組のプロのダンス・グループや俳優たちの記録のようなものです。そして、これらすべてを一つの巨大で完璧に整理されたライブラリへとまとめ上げました。彼らは、ロボットがすべての動きに対して同じ「言語」(SMPL-Xと呼ばれます)を話せるように、すべてを標準化しました。さらに、高度なAIを使用してこれらの動きのビデオを観察し、そこで何が起きているのかについての詳細で構造化された物語を記述させることで、ロボットが単に「人が動いた」ことだけでなく、「なぜ」「どのように」動いたのかまで理解できるようにしました。

結果は素晴らしいものです。テキストからダンスへの変換、音声からジェスチャーへの変換、あるいは人が次に何をしようとしているかの予測といったタスクでテストした際、OmniMotion-Xは従来のあらゆる手法を凌駕しました。それは単にランダムに手足をバタつかせるのではなく、一貫性があり、現実的で、崩れることなく長く続く動きを作り出しました。例えば、曲に基づいてダンスを生成するように頼んだ場合、単にランダムに動くのではなく、ステップをビートに同期させました。もし「参照モーション」(例えば人が歩いているクリップ)を与えれば、その歩行をシームレスに継続したり、新しい指示に基づいてそのスタイルを変更したりすることができ、スタイルと流れを維持したまま実行できました。

しかし、製作者たちは、自分たちのロボットがまだできないことについても正直です。単独の人物の動きには優れていますが、その人物が複雑な物体と相互作用したり、他の人と現実的に関わったりする場合(例:カップを落とさずに手に取る、あるいは友人とハイタッチするなど)には苦戦します。また、動作が少し遅く、一つのサンプルを生成するのに約2.14秒かかり、これはより単純なモデルよりも遅いです。しかし、この論文は、異なる種類のデータを統合し、ステップ・バイ・ステップのスマートな方法でモデルを教えることで、デジタル・ヒューマンが現実のものと同じような優雅さと複雑さを持って動くことに、より近づけるということを証明しています。これはまだ解決された問題ではありませんが、機械にダンス、ジェスチャー、そして動きを教えるための、極めて大きな飛躍なのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →