← 최신 논문
💻 computer science

MACE-Dance: Motion-Appearance Cascaded Experts for Music-Driven Dance Video Generation

MACE-Dance는 BiMamba-Transformer 기반의 모션 전문가를 통한 사실적인 3D 모션 합성과 고품질 비디오 생성을 위한 외관 전문가를 결합한 캐스케이드 혼합 전문가 아키텍처를 활용하는 새로운 음악 기반 댄스 비디오 생성 프레임워크로, 이를 통해 모션 품질과 시각적 외관 모두에서 최첨단 성능을 달성합니다.

원저자: Kaixing Yang, Jiashu Zhu, Xulong Tang, Ziqiao Peng, Xiangyue Zhang, Puwei Wang, Jiahong Wu, Xiangxiang Chu, Hongyan Liu, Jun He

게시일 2026-05-08
📖 3 분 읽기☕ 가벼운 읽기

원저자: Kaixing Yang, Jiashu Zhu, Xulong Tang, Ziqiao Peng, Xiangyue Zhang, Puwei Wang, Jiahong Wu, Xiangxiang Chu, Hongyan Liu, Jun He

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 노래에 완벽하게 맞춰 춤추는 사람의 댄스 영상을 만들고 싶다고 상상해 보세요. 하지만 안무가나 댄서, 촬영 팀을 고용하고 싶지는 않습니다. 그저 노래와 사진을 입력하면 컴퓨터가 나머지를 모두 처리하기를 원할 뿐입니다.

이것이 바로 MACE-Dance 논문이 해결하려는 과제입니다. 저자들은 컴퓨터에게 모든 것을 한 번에 가르치려 시도하는 것 (음악을 직접 영상으로 변환하는 것) 은 한 사람에게 작곡가, 안무가, 촬영 감독을 동시에 맡기는 것과 같다고 깨달았습니다. 그들은 대개 세 가지 역할 모두에서 평범한 결과만 만들어냅니다.

대신 MACE-Dance 는 "계단식 혼합 전문가 (Cascaded Mixture-of-Experts)" 방식을 사용합니다. 이는 한 명의 일반인이 아니라, 릴레이 경주처럼 협력하는 두 명의 전문가는 고용하는 고급 댄스 제작 회사와 같습니다.

두 명의 전문가 (The Experts)

1. 동작 전문가 (안무가)

  • 역할: 이 전문가는 음악을 듣고 몸이 어떻게 움직여야 하는지 파악합니다. 댄서의 외모 (머리, 옷, 피부) 는 상관없으며, 물리학과 리듬만 중요하게 생각합니다.
  • 비밀 무기: BiMamba-Transformer라는 특수한 뇌 아키텍처를 사용합니다.
    • 비유: 드럼 비트의 국소적인 리듬 (Mamba) 을 들을 수 있으면서도 전체 교향곡의 거대한 구조 (Transformer) 를 이해하는 지휘자를 상상해 보세요. 이를 통해 이 전문가는 물리적으로 가능한 (다리가 뒤로 구부러지는 등의 일이 발생하지 않는) 동시에 예술적으로 표현력 있는 (단순한 로봇 같은 경련이 아닌) 춤 동작을 창조할 수 있습니다.
  • 산출물: 아직 영상이 아닌, 춤 동작의 "스켈레톤" 또는 3D 맵을 생성합니다.

2. 외형 전문가 (감독 및 스타일리스트)

  • 역할: 이 전문가는 첫 번째 전문가로부터 받은 3D 스켈레톤과 사용자가 제공한 사람의 사진을 바탕으로 영상을 "그려냅니다". 즉, 사진 속 사람이 실제로 그 동작을 수행하도록 만듭니다.
  • 비밀 무기: **Kinematic-Aesthetic Fine-Tuning (운동학적 - 미적 미세 조정)**이라는 두 단계 훈련 과정을 사용합니다.
    • 비유: 먼저, 팔과 다리가 스켈레톤을 완벽하게 따르도록 몸이 올바르게 움직이도록 학습합니다 (Kinematic). 그 다음, 옷이 왜곡되지 않고 얼굴이 식별 가능하며 조명이 자연스러워지도록 영상이 아름답게 보이도록 학습합니다 (Aesthetic).
  • 산출물: 사진 속 사람이 노래에 맞춰 춤추는 고품질 영상입니다.

이 접근법이 승리하는 이유

이 논문은 이전 방법들이 이 작업을 거대한 한 단계로 수행하려다 문제를 야기했다고 주장합니다:

  • "흐릿함" 문제: 일부 방법은 댄서가 녹아내리는 밀랍 인형처럼 보이게 만들었습니다.
  • "글리치" 문제: 다른 방법들은 댄서의 팔다리가 갑자기 꺾이거나 순간이동하는 현상을 만들었습니다.
  • "잘못된 동작" 문제: 어떤 방법들은 멋져 보이지만 음악의 비트와 실제로 맞지 않는 춤을 생성했습니다.

MACE-Dance 는 움직임의 물리학이미지의 미적 아름다움을 분리함으로써 이를 해결합니다. 3D "스켈레톤"을 중개자로 사용하여, 시스템이 예쁘게 보이게 만들기 전에 춤이 물리적으로 현실적인지 먼저 보장합니다.

"체육관"과 "채점표"**

자신들의 시스템이 작동함을 증명하기 위해 저자들은 단순히 추측하지 않고 거대한 훈련장과 새로운 결과 평가 방식을 구축했습니다:

  1. MA-Data (체육관): 그들은 K-POP 에서 전통 민속 춤까지 20 가지 이상의 다양한 춤 스타일을 아우르는 7 만 개의 댄스 클립 (116 시간 분량의 영상) 으로 구성된 거대한 데이터셋을 만들었습니다. 기존 데이터가 AI 를 제대로 가르치기에 충분히 크거나 다양하지 않았기 때문에 이것이 필요했습니다.
  2. 채점표: 그들은 두 가지를 별도로 확인하는 새로운 채점 시스템을 설계했습니다:
    • 동작 점수: 춤이 물리적으로 가능한 것처럼 보이는가? 비트를 맞추는가?
    • 외형 점수: 영상이 매끄러운가? 원본 사진 속 사람과 닮았는가?

결과

MACE-Dance 를 다른 최상급 AI 댄스 생성기들과 비교 테스트했을 때, 거의 모든 카테고리에서 승리했습니다.

  • 인간 심사위원: 춤 배경을 가진 실제 사람들이 영상을 시청했을 때 압도적으로 MACE-Dance 를 선호했습니다. 그들은 동작이 더 창의적이고 타이밍이 더 좋으며 영상이 더 자연스럽다고 평가했습니다.
  • "긴 춤" 테스트: 대부분의 AI 시스템은 몇 초 후 혼란을 겪고 글리치가 발생하기 시작합니다. 반면 MACE-Dance 는 댄서의 형태가 무너지거나 영상이 깜빡임 없이 30 초 이상 길고 연속적인 댄스 영상을 생성할 수 있습니다.

요약

MACE-Dance 는 한 명의 로봇에게 두 가지 일을 모두 맡기는 대신, 세계적 수준의 안무가에게 동작을 설계하게 하고 세계적 수준의 감독에게 촬영하게 하는 것과 같습니다. 업무를 분리함으로써 그들은 음악과 동기화될 뿐만 아니라 물리적으로 현실적이고 시각적으로 놀라운 댄스 영상을 생성하는 시스템을 만들었습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →