← 最新の論文
💻 computer science

MACE-Dance: Motion-Appearance Cascaded Experts for Music-Driven Dance Video Generation

MACE-Dance は、現実的な 3 次元運動合成のための BiMamba-Transformer ベースのモーションエキスパートと、高忠実度な動画生成のためのアピアランスエキスパートを組み合わせるカスケード型エキスパート混合アーキテクチャを採用する新規の音楽駆動型ダンス動画生成フレームワークであり、これにより運動の質と視覚的な外観の両方において最先端の性能を達成する。

原著者: Kaixing Yang, Jiashu Zhu, Xulong Tang, Ziqiao Peng, Xiangyue Zhang, Puwei Wang, Jiahong Wu, Xiangxiang Chu, Hongyan Liu, Jun He

公開日 2026-05-08
📖 1 分で読めます☕ さくっと読める

原著者: Kaixing Yang, Jiashu Zhu, Xulong Tang, Ziqiao Peng, Xiangyue Zhang, Puwei Wang, Jiahong Wu, Xiangxiang Chu, Hongyan Liu, Jun He

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたが、音楽に合わせて完璧に動く人物のダンス動画を作成したいと想像してください。しかし、振付師やダンサー、撮影クルーを雇いたくありません。単に楽曲と写真を入力すれば、残りはコンピュータに任せてほしいのです。

これが、MACE-Dance論文が取り組む課題です。著者らは、コンピュータにすべてを一度に教えること(音楽を直接動画に変換すること)は、一人の人物に作曲家、ダンサー、撮影監督を同時に務めさせるようなものだと気づきました。その結果、三つの役割すべてにおいて平均的な出来に終わることが多いのです。

代わりに、MACE-Danceは**「カスケード型エキスパート混合(Cascaded Mixture-of-Experts)」**アプローチを採用します。これは、一人の万能職人ではなく、リレー形式で連携する二人の専門家を雇う、高級ダンス制作会社のようなものです。

二人の専門家(エキスパート)

1. 動作の専門家(振付師)

  • 役割: この専門家は音楽を聴き、体がどのように動くべきかを決定します。ダンサーの髪型、服装、肌色といった外見には関心を持たず、物理法則とリズムのみを重視します。
  • 秘密の武器: BiMamba-Transformerと呼ばれる特殊な脳構造を使用します。
    • 比喩: 指揮者が、ドラムのビートという「局所的なリズム」(Mamba)を聴きながら、交響曲全体という「壮大な構造」(Transformer)も理解できるようなものです。これにより、この専門家は物理的に可能(足が後ろに曲がるようなことは起きない)かつ芸術的に表現力のある(単なるロボットの痙攣ではない)ダンス動作を生成できます。
  • 出力: 動画ではなく、ダンス動作の「スケルトン」または 3D マップを生成します。

2. 外観の専門家(監督兼スタイリスト)

  • 役割: この専門家は、最初の専門家から受け取った 3D スケルトンと、ユーザーが提供した人物の写真を基に、動画を「描き上げ」、写真の人物が実際にその動作を演じるようにします。
  • 秘密の武器: **Kinematic-Aesthetic Fine-Tuning(運動学的・美的微調整)**と呼ばれる二段階のトレーニングプロセスを使用します。
    • 比喩: 第一に、腕や脚がスケルトンに完全に追従するよう、体が正しく動くことを学習します(運動学的)。第二に、衣服が歪まないこと、顔が認識可能であること、照明が自然に見えることを保証し、動画が美しく見えるよう学習します(美的)。
  • 出力: 写真の人物が楽曲に合わせて踊る、高品質な動画です。

このアプローチが勝る理由

この論文は、従来の手法がこれを一つの巨大なステップで行おうとしたことが問題を引き起こしたと主張しています。

  • 「ぼやけ」問題: 一部の手法では、ダンサーが溶けた蝋人形のように見えました。
  • 「不具合」問題: 他の手法では、ダンサーの手足がパタパタと跳ねたり、テレポートしたりしました。
  • 「間違った動き」問題: 一部の生成ダンスはクールに見えたものの、音楽のビートに実際には合っていなかったのです。

MACE-Dance は、動作の物理法則画像の美しさを分離することでこれを解決します。3D の「スケルトン」を仲介役として用いることで、システムは美しく見せることに取り組む前に、ダンスが物理的に現実的であることを保証します。

「ジム」と「採点表」

自らのシステムが機能することを証明するため、著者らは推測に頼らず、大規模なトレーニング場と結果を評価する新しい方法を整備しました。

  1. MA-Data(ジム): 彼らは、K-POP から伝統的な民族舞踊まで、20 種類以上のダンススタイルを網羅する 7 万枚のダンスクリップ(116 時間の動画)からなる巨大なデータセットを作成しました。これは、既存のデータが AI を適切に教育するには規模も多様性も不足していたため必要でした。
  2. 採点表: 彼らは二つの要素を個別にチェックする新しい評価システムを設計しました。
    • 動作スコア: ダンスは物理的に可能に見えますか?ビートに合っていますか?
    • 外観スコア: 動画は滑らかに見えますか?人物は元の写真の人物に似ていますか?

結果

MACE-Dance を他のトップ AI ダンス生成器と比較してテストしたところ、ほぼすべてのカテゴリーで勝利しました。

  • 人間の審査員: ダンスの背景を持つ実在の人々が動画を見て評価したところ、圧倒的に MACE-Dance を好みました。彼らは、動作がより創造的で、タイミングが優れており、動画がより自然だと述べました。
  • 「長時間ダンス」テスト: ほとんどの AI システムは数秒後には混乱し、不具合を起こし始めます。一方、MACE-Dance は、ダンサーの形状が崩れたり、動画がちらついたりすることなく、長時間の連続ダンス動画(デモでは 30 秒以上)を生成できます。

まとめ

MACE-Dance は、単一のロボットに両方を任せるのではなく、ステップを設計する世界クラスの振付師と、それを撮影する世界クラスの監督を雇うようなものです。仕事を分割することで、彼らは音楽と同期しているだけでなく、物理的に現実的で視覚的に見事なダンス動画を生成するシステムを構築しました。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →