← 最新の論文
💻 computer science

FlowDance: Music-Driven Dance Video Generation with Parallel Pose and RGB Streams

本論文は、新たに構築された高解像度のダンスデータセットに支えられ、モーションとアイデンティティの保持のための特化した注入技術を伴う並列のポーズおよびRGBストリームを統合することで、音楽駆動型のダンスビデオを生成するフレームワークであるFlowDanceを提示する。

原著者: Genying Li, Boda Lin, Jiachen Li, Zijian Jia, Haojie Zheng, Yiming Wang, Shuchen Weng, Si Li

公開日 2026-08-18
📖 1 分で読めます☕ さくっと読める

原著者: Genying Li, Boda Lin, Jiachen Li, Zijian Jia, Haojie Zheng, Yiming Wang, Shuchen Weng, Si Li

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

音楽と動きは、古くから深く、言葉にならない対話を共有してきました。リズムが始まると、脳がそのビートを名付けるよりも先に、体はしばしば反応します。何十年もの間、科学者やエンジニアは、コンピュータにこの繋がりを理解させ、曲を見てそれに合わせたダンスを生み出すことができるマシンを作ろうと試みてきました。初期の試みは、動きの骨格そのものに焦点を当て、メロディに合わせて跳んだり回転したりできるデジタルなスティックフィギュア(棒人間)を作成することでした。これらのシステムは動きの基本的な形状を生成することはできましたが、その動きを行っている「人」を捉えることはできませんでした。それらには、ダンサーを単なる線の集まりではなく、本物の人間らしく見せるための、特定の顔、独特な服装、そして微細なディテールが欠けていたのです。課題は、ダンスという抽象的な概念と、音楽に合わせて動く特定の人物という視覚的な現実との間の溝を埋めることであり、同時に、ビデオの最初から最後までを滑らかで信憑性のあるものにすることでした。

研究チームは現在、タスクに対するコンピュータの考え方を変えることで、この課題に対処する「FlowDance」と呼ばれる新しいシステムを開発しました。すべてを一つの巨大なステップで行おうとしたり、プロセスをバラバラで断絶した段階に分割したりするのではなく、このシステムは、並行して走る二つの情報のストリーム(流れ)を用いて動作します。一つのストリームは動きの構造に焦点を当て、ダンサーのポーズを示す簡略化されたビデオを作成し、もう一方のストリームは視覚的な外観に焦点を当て、人物の実際のビデオを生成します。これら二つのストリームは、ビデオが作成されている間、常に互いに通信し合っています。構造的なストリームは視覚的なストリームを導き、人物の手足が正しく動くようにし、一方で視覚的なストリームは、ダンサーの顔や服がクリップ全体を通して一貫性を保つようにします。このアプローチにより、システムは特定の個人が曲に合わせて自然に踊るビデオを生成でき、以前の手法に見られたようなエラーを起こすことなく、その人物のアイデンティティや衣装の詳細を維持することができます。

この問題を解決しようとする以前の試みは、多くの場合、一連の独立したツールの連鎖に依存していました。あるツールが身体の3D形状を推測し、二番目のツールがその形状を2Dの図形へと平面化しようとし、三番目のツールがその図形を用いて最終的なビデオを描画するという仕組みです。研究者たちは、最初のステップでのエラーが蓄積し、結果としてダンサーの手足が突然伸びたり、体がサイズを変えたり、顔が歪んだりするビデオにつながることを発見しました。他の手法は、音楽と写真を直接ビデオへと一度にマッピングしようとしましたが、これはコンピュータが同時にあまりにも多くの複雑な問題を解決しなければならないため、動きが硬くなったり、説得力に欠けたりすることがよくありました。FlowDanceは、動きと画像生成を関連付けつつも明確に区別することで、これらの落とし穴を回避しています。このシステムは、学習済みのビデオモデルを基礎として使い、そこに音楽がポーズに影響を与えるための特定のパスと、ダンサーの顔や体が元の写真と同じに見えるようにするための別のパスを追加しています。

このシステムを訓練するために、研究者たちはインターネットからダンスビデオの膨大なコレクションを構築し、高品質で一人の人物が踊っているクリップを慎重に選別しました。彼らは16万5,000本以上の短いクリップ(各5秒間)を集め、それぞれに詳細なラベルを付けました。すべてのビデオに対して、音楽、ダンサーの3次元的な動き、カメラアングル、および関節の2D位置を記録しました。「FlowDanceSet」と名付けられたこのデータセットにより、コンピュータはリズムと人間の身体の具体的な動きとの関係を、人間が実際にどのように見えるかと共に学習することができました。その後、システムは見たことがない新しい曲や新しいダンサーを用いてテストされました。その結果、FlowDanceは他の現在の手法よりも滑らかでリアルなビデオを生成することが示されました。他のシステムによって作成されたビデオと比較するテストにおいて、人間の観察者は、FlowDanceが作成したビデオの方が、ダンサーがより自然に見え、動きがより流動的であり、音楽と動きの結びつきがより強いとして、一貫してFlow 最も好みました。

また、このシステムは、ダンサーのアイデンティティを失うことなく、より長いビデオを扱う方法も導入しました。ビデオが長くなるにつれ、コンピュータは最初のフレームの人物がどのような姿であったかを忘れてしまい、時間の経過とともに顔や服がわずかに変化してしまう「ドリフト(漂流)」現象が起こることがよくあります。FlowDanceは、作成プロセスの様々な時点で、ダンサーの元の写真を繰り返しシステムにフィードバックすることで、この問題を解決します。これにより、視覚的な詳細が固定され、複雑でエネルギッシュな動きを行っている間も、一貫した外見を維持しながら数秒間のシーケンスを生成することが可能になります。研究者たちは、この手法を並行ストリームと組み合わせることで、ダンサーの衣服、体型、および顔の特徴が安定したまま、複雑でエネルギッシュな動きを実行できるビデオを作成できることを見出しました。この研究は、動きの計画と画像のレンダリングというタスクを分離しつつ、それらを常に通信状態に置くことで、構造的に正確であり、かつ視覚的に説得力のあるダンスビデオを作成することが可能であることを証明しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →