Wan-Dancer: A Hierarchical Framework for Minute-scale Coherent Music-to-Dance Generation
이 논문은 전역 키프레임 계획과 지역적 시간 정밀화를 분리함으로써 기존 확산 모델의 시간적 한계를 극복하고, 음악으로부터 분 단위의 고해도(720p/30fps) 및 리듬감 있게 일관된 댄스 비디오를 직접 생성하는 새로운 계층적 프레임워크인 Wan-Dancer를 소개한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
전체 노래에 맞춰 안무를 짜려고 노력한다고 상상해 보세요. 하지만 당신의 뇌는 약 15초 정도의 동작만 기억할 수 있고, 그 이후에는 오류가 발생하거나 무용수의 얼굴을 잊어버리거나 발이 꼬여 넘어지기 시작합니다. 이것이 현재 대부분의 AI 댄스 생성기가 처한 상태입니다. 이들은 짧은 순간의 움직임에는 뛰어나지만, 1분 길이의 퍼포먼스를 요청하는 즉시 비디오는 흔들리고, 무용수의 정체성은 깜빡거리며, 리듬은 무너집니다.
여기, 전체 곡을 처음부터 끝까지 계획할 수 있는 초능력을 가진 마스터 안무가처럼 행동하는 Alibaba의 Tongyi Lab에서 나온 새로운 프레임워크, Wan-Dancer가 등장했습니다.
문제점: 짧은 기억력의 "건망증"
현재의 AI 모델들은 기억력이 매우 짧은 무용수와 같습니다. 만약 20초 동안 춤을 추게 하면 아주 멋지게 해냅니다. 하지만 60초 이상으로 밀어붙이면 "시간적 표류(temporal drift)" 현상을 겪습니다. 이는 무용수가 노래 초반에는 팝스타처럼 보이다가 끝날 때쯤에는 완전히 다른 사람처럼 변하거나, 움직임이 반복적이고 로봇처럼 변하는 것을 의미합니다. 이전의 방법들은 짧은 클립들을 이어 붙여 이를 해결하려 했지만, 그것은 마치 영화 필름을 테이프로 이어 붙이는 것과 같아서 연결 부위가 항상 눈에 띄고 이야기가 깨지게 됩니다.
해결책: "글로벌 플래너(Global Planner)"와 "로컬 댄서(Local Dancer)"
Wan-Dancer는 이 작업을 두 개의 뚜렷한 역할로 나누어 계층적인 팀으로 협업하게 함으로써 문제를 해결합니다.
- 글로벌 플래너 (전체적인 그림): 먼저, AI는 노래 전체를 한꺼번에 봅니다. 단순히 다음 동작을 예측하는 것이 아니라, 노래 전체에 걸쳐 펼쳐진 "키프레임(keyframes)"—즉, 춤의 주요 포즈와 구조적 순간들—을 계획합니다. 이것은 벽돌을 한 장 쌓기 전에 마천루의 청사진을 그리는 건축가와 같습니다. 이를 통해 무용수는 5초 지점에서 춤을 추고 있는 동안에도 50초 지점에 자신이 어디에 있을지를 알 수 있게 됩니다.
- 로컬 리파이너 (세부 사항): 청사진이 설정되면, 두 번째 부분이 그 빈틈을 채웁니다. 이 시스템은 앞서 만든 키 포즈들을 가져와 그 사이의 매끄러운 고해상도 프레임들을 생성합니다. 이곳에서 유려한 움직임의 마법이 일어나며, 무용수가 한 포즈에서 다른 포즈로 순간 이동하는 것이 아니라 공간을 미끄러지듯 이동하도록 보장합니다.
비결: 세 가지 멋진 기술
이것이 제대로 작동하도록 연구진은 세 가지 특정 도구를 툴킷에 추가했습니다.
- 시간 여행 시계 (동적 프레임 레이트): 음악은 항상 같은 속도가 아닙니다. 때로는 느린 발라드이고, 때로는 빠른 테크노 트랙입니다. Wan-Dancer는 특수한 "시간 매핑" 시계(RoPE 임베딩이라 불림)를 사용하여, 생성되는 초당 프레임 수와 상관없이 정확히 얼마나 시간이 흘렀는지 AI에게 알려줍니다. 이를 통해 AI는 3초의 비트나 10초의 슬로우 모션 구간에서도 혼란 없이 음악과 완벽하게 싱크를 맞출 수 있습니다.
- 모션 블러 방패 (광학 흐름 손실): 무용수가 빠르게 회전하면 잔상이 남습니다. 기존의 AI 모델들은 단순히 이미지를 뭉개버려 손을 덩어리로 만들어 버리곤 했습니다. Wan-Dancer는 "광학 흐름(optical flow)" 손실 함수를 사용합니다. 이것은 마치 비디오를 프레임 단위로 체크하여 움직임이 완벽하게 일치하는지 확인하는 엄격한 선생님과 같습니다. 만약 AI가 빠른 회전 중에 디테일을 뭉개려고 하면, 선생님은 "안 돼, 저 손을 수정해"라고 말하며 빠른 속도에서도 무용수가 선명함을 유지하도록 만듭니다.
- 속도 조절 다이얼 (모션 컨트롤): 이 시스템은 느린, 중간, 빠른 움직임을 다르게 처리하도록 훈련되었습니다. AI는 "중간" 속도가 보통 인간의 춤에 가장 적합하다는 것을 학습하여, 움직임이 너무 느려지거나(지루함) 너무 빨라져서 물리적으로 불가능하고 글리치가 발생하는 것을 방지합니다.
결과: 1분의 마법
팀은 약 200시간의 고품질 댄스 영상 데이터셋을 사용하여 이를 테스트했으며, 여기에는 중국 고전 무용, K-Pop, 라틴, 탭 댄스, 스트릿 댄스 등 다섯 가지 뚜렷한 스타일이 포함되었습니다.
결과는 인상적입니다. Wan-Dancer는 720p 해상도에서 **30fps(초당 프레임)**로 1분 이상(구체적으로 최대 160초까지 시연됨) 지속되는 안정적인 영상을 생성할 수 있습니다.
- 정체성: 무용수는 첫 초부터 마지막 초까지 동일한 인물로 보입니다.
- 리듬: 동작들이 음악의 비트에 완벽하게 맞습니다.
- 다재다능함: "라틴 댄스를 추는 무용수"와 같은 간단한 텍스트 프롬프트에 따라 춤 스타일을 전환할 수 있습니다.
또한, 단 16개의 참조 영상과 LoRA(Low-Rank Adaptation)라는 기술을 사용하여 AI에게 특정 루틴을 가르칠 수 있다는 점도 보여주었습니다. 이는 전체 시스템을 처음부터 다시 훈련시킬 필요 없이 AI가 특정 안무를 흉내 내도록 만들 수 있음을 의미합니다.
한계점 (그리고 향후 과제)
Wan-Dancer가 아직 하지 못하는 것을 명시하는 것이 중요합니다. 이 모델은 나중에 렌더링해야 하는 3D 스켈레톤을 생성하는 것이 아니라, 바로 비디오를 생성합니다. 하지만 저자들은 이것이 완벽하지 않다고 인정합니다.
- 얼굴 일관성: 신체는 일관되게 유지되지만, 매우 긴 시퀀스에서는 얼굴이 약간 깜빡거릴 수 있습니다. 그들은 향후 이를 해결할 계획입니다.
- 그룹 댄스: 현재는 솔로 공연입니다. 그들은 AI가 서로 상호작용하는 무용수 그룹을 안무하도록 가르치기를 원합니다.
- 윤리: 팀은 매우 분명하게 밝힙니다: 이것은 예술을 창조하기 위한 것이지, 가짜 뉴스나 딥페이크를 만들기 위한 것이 아닙니다. 그들은 모든 출력물이 AI에 의해 생성되었음을 명확히 표시할 것을 약속합니다.
요약하자면, Wan-Dancer는 큰 문제를 "전체적인 그림" 계획과 "세부적인 실행"으로 나눔으로써, 우리가 드디어 비트를 놓치지 않고 노래 전체에 맞춰 AI가 춤을 추게 할 수 있음을 시사합니다. 이는 15초짜리 클립에서 벗어나 실제 인간이 춤을 추는 것처럼 보이는 1분 이상의 퍼포먼스로 나아가는 중요한 진전입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.