← 最新の論文
💻 computer science

Wan-Dancer: A Hierarchical Framework for Minute-scale Coherent Music-to-Dance Generation

本論文は、グローバルなキーフレーム計画とローカルな時間的精緻化を分離することで、既存の拡散モデルの時間的な限界を克服し、音楽から直接、分単位の長時間かつ高精細(720p/30fps)でリズムの一貫したダンスビデオを生成する新しい階層的フレームワークであるWan-Dancerを導入するものである。

原著者: Mingyang Huang, Peng Zhang, Li Hu, Guangyuan Wang, Bang Zhang

公開日 2026-07-13
📖 1 分で読めます☕ さくっと読める

原著者: Mingyang Huang, Peng Zhang, Li Hu, Guangyuan Wang, Bang Zhang

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

曲全体に合わせてダンスの振り付けをしようとしている場面を想像してみてください。しかし、あなたの脳はわずか15秒間の動きしか覚えておらず、すぐにバグが発生したり、ダンサーの顔を忘れたり、あるいは足をもつれさせて転んでしまったりします。これが、現在のほとんどのAIダンス生成器の現状です。短いバースト(短時間の動き)には優れていますが、1分間のパフォーマンスを求められた途端、ビデオは揺らぎ始め、ダンサーのアイデンティティはちらつき、リズムは崩壊してしまいます。

そこで登場するのが、AlibabaのTongyi Labによる新しいフレームワーク、Wan-Dancerです。これは、冷静さを失うことなく、最初から最後までダンス全体を計画できることができる「スーパーパワーを持ったマスター・コレオグラファー(熟練の振付師)」のように機能します。

問題点:「短期記憶」による健忘症

現在のAIモデルは、非常に短期的な記憶しか持たないダンサーのようなものです。20秒間のダンスを求められれば、素晴らしい動きを見せます。しかし、60秒以上へと押し進めると、「テンポラル・ドリフト(時間的漂流)」に陥ります。これは、ダンサーが曲の開始時にはポップスターのように見えていたのに、終わる頃には全く別人のようになっていたり、動きが単調でロボットのようになったりすることを意味します。これまでの手法では、短いクリップをつなぎ合わせることで解決しようとしてきましたが、それは映画のリールをテープで繋ぎ合わせるようなもので、継ぎ目がどうしても見えてしまい、ストーリーが崩れてしまいます。

解決策:「グローバル・プランナー」と「ローカル・ダンサー」

Wan-Dancerは、この仕事を2つの明確な役割に分け、階層的なチームとして連携させることでこの問題を解決しています。

  1. グローバル・プランナー(全体像): まず、AIは曲の全体を一度に俯瞰します。単に次の動きを推測するのではなく、曲全体に散りばめられた主要なポーズや構造的な瞬間である「キーフレーム」を計画します。これは、レンガを一つずつ積む前に、超高層ビルの設計図を描く建築家のようなものです。これにより、ダンサーは5秒時点のダンスをしている最中であっても、50秒時点に自分がどこにいるべきかを把握できるのです。
  2. ローカル・リファイナー(細部): 設計図が決まったら、システムの第2の部分がその隙間を埋めていきます。これらのキーポーズを取り込み、その間にある滑らかな高解像度のフレームを生成します。ここで、流れるような動きの魔法が生まれます。ダンサーがポーズからポーズへと瞬間移動するのではなく、空間の中を滑らかに移動するように制御します。

秘訣:3つのクールな仕掛け

これを実現するために、研究者たちはツールキットに3つの特定のツールを追加しました。

  • タイムトラベリング・クロック(ダイナミック・フレームレート): 音楽の速度は常に一定ではありません。スローなバラードもあれば、速いテクノトラックもあります。Wan-Dancerは、特殊な「タイムマップされた」時計(RoPEエンベディングと呼ばれるもの)を使用しており、生成されるフレームレートに関わらず、どれだけの時間が経過したかをAIに正確に伝えます。これにより、AIは混乱することなく、3秒のビートや10秒のスローモーションの区間に完璧に同期することができます。
  • モーションブラー・シールド(オプティカルフロー損失): ダンサーが速く回転すると、映像はブレてしまいます。古いAIモデルは単に画像をぼやけさせ、手を塊のようにしてしまうことがありました。Wan-Dancerは「オプティカルフロー(オプティカルフロー損失)」を使用します。これは、フレームごとに動画を厳格にチェックする厳しい教師のようなものです。もしAIが高速回転中にディテールをぼかそうとすると、教師が「ダメだ、その手を修正しろ」と指示を出し、高速移動時でもダンサーが鮮明に見えるようにします。
  • スピード・ダイヤル(モーション・コントロール): このシステムは、スロー、ミディアム、ファストの動きをそれぞれ異なる方法で扱うよう訓練されています。AIは「ミディアム」の速度が通常、人間のダンスにおいて最適な状態であることを学習しており、動きが遅すぎたり(退屈)、あるいは速すぎたり(物理的に不可能で不自然)することを防いでいます。

結果:1分間の魔法

チームは、中国古典舞踊、K-Pop、ラテン、タップ、ストリートダンスの5つの異なるスタイルを含む、約200時間の高品質なダンスビデオの膨大なデータセットを用いてテストを行いました。

結果は驚くべきものです。Wan-Dancerは、720p解像度30フレーム/秒の安定したビデオを、1分以上(具体的には最大160秒まで実証)生成できます。

  • アイデンティティ: ダンサーは最初から最後まで同じ人物に見えます。
  • リズム: 動きは音楽のビートに完璧にヒットします。
  • 汎用性: 「ラテンダンスを踊っているダンサー」といった単純なテキストプロンプトに基づいて、ダンススタイルを切り替えることができます。

また、16本の参照ビデオとLoRA(Low-Rank Adaptation)と呼ばれる技術を用いることで、AIに特定のルーチンを教えることも可能です。これは、システム全体をゼロから再学習させることなく、AIに特定の振り付けを模倣させることができることを意味します。

できないこと(そして次なるステップ)

Wan-Dancerがまだできないことについても触れておく必要があります。これは、後でレンダリングするための3Dスケルトンを生成するのではなく、直接ビデオへと向かいます。しかし、著者らはこれが完璧ではないことも認めています。

  • 顔の一貫性: 体型は一貫していますが、非常に長いシーケンスでは顔がわずかにちらつくことがあります。彼らは将来的にこれを修正する計画です。
  • グループダンス: 現在はソロパフォーマンスです。彼らは、お互いに相互作用する複数のダンサーの振り付けを教えたいと考えています。
  • 倫理: チームの姿勢は明確です。これは芸術を創造するためのものであり、フェイクニュースやディープフェイクを作るためのものではありません。彼らは、すべての出力がAI生成物として明確にラベル付けされることを約束しています。

要約すると、Wan-Dancerは、「大きな絵を描く計画」と「細部の実行」という具合に大きな問題を分割することで、ついにAIがリズムを外すことなく曲全体に合わせて踊れるようになることを示唆しています。これは、15秒のクリップから、実際に人間が踊っているように見えるフル1分間のパフォーマンスへと進化する、重要な一歩です。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →