FlowDance: Music-Driven Dance Video Generation with Parallel Pose and RGB Streams
이 논문은 새롭게 큐레이션된 고해상도 댄스 데이터셋을 바탕으로, 동작 및 정체성 보존을 위한 특화된 주입 기술과 함께 병렬 포즈 및 RGB 스트림을 통합하여 음악 기반 댄스 비디오를 생성하는 프레임워크인 FlowDance를 제시한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
음악과 움직임은 오랫동안 깊고 무언의 대화를 나누어 왔습니다. 리듬이 시작되면, 몸은 마음이 비트를 이름 붙이기도 전에 종종 반응하곤 합니다. 수십 년 동안 과학자와 엔지니어들은 컴퓨터가 이 연결 고리를 이해하도록 가르치기 위해 노력해 왔으며, 노래를 보고 그에 맞춰 춤을 만들어내는 기계를 만들기를 희망했습니다. 초기 시도들은 움직임의 골격 자체에 집중하여, 멜로디에 맞춰 점프하고 회전할 수 있는 디지털 막대 인형(stick figures)을 만드는 데 주력했습니다. 이러한 시스템들은 움직임의 기본적인 형태는 생성할 수 있었지만, 그 동작을 수행하는 '사람'을 포착하지는 못했습니다. 그것들은 특정 얼굴, 독특한 의상, 그리고 무용수를 단순한 선들의 집합체가 아닌 실제 인간처럼 보이게 만드는 미세한 디테일이 결여되어 있었습니다. 과제는 춤이라는 추상적인 아이디어와 특정 인물이 음악에 맞춰 움직이는 시각적 실체 사이의 간극을 메우는 것이었으며, 이 과정에서 영상이 처음부터 끝까지 매끄럽고 믿을 만하게 유지되도록 하는 것이었습니다.
한 연구팀은 이제 이 과제를 해결하기 위해 컴퓨터가 작업을 생각하는 방식을 바꾸는 새로운 시스템인 FlowDance를 개발했습니다. 모든 것을 한 번에 거대한 단계로 처리하거나, 과정을 서로 단절된 별개의 단계로 나누는 대신, 이 시스템은 나란히 실행되는 두 개의 병렬 정보 스트림을 사용하여 작동합니다. 한 스트림은 움직임의 구조에 집중하여 무용수의 포즈를 단순화된 영상으로 만들어내고, 다른 스트림은 시각적 외형에 집중하여 실제 인물의 영상을 생성합니다. 이 두 스트림은 영상이 생성되는 동안 끊임없이 서로 대화합니다. 구조적 스트림은 시각적 스트림을 안내하여 사람의 팔다리가 올바르게 움직이도록 보장하며, 시각적 스트림은 무용수의 얼굴과 옷이 클립 전체에서 일관되게 유지되도록 보장합니다. 이러한 접근 방식은 시스템이 특정 개인의 정체성과 의상의 디테일을 보존하면서도 오류 없이 자연스럽게 음악에 맞춰 춤추는 영상을 생성할 수 있게 해줍니다.
이 문제를 해결하려는 이전의 시도들은 종종 별개의 도구들로 이루어진 사슬에 의존했습니다. 한 도구는 신체의 3D 형태를 추측하고, 두 번째 도구는 그 형태를 2D 그림으로 평면화하며, 세 번째 도구는 그 그림을 사용하여 최종 영상을 그려냈습니다. 연구자들은 첫 번째 단계에서의 오류가 누적되어 무용수의 팔다리가 갑자기 늘어나거나, 몸의 크기가 변하거나, 얼굴이 왜곡되는 영상을 초래한다는 것을 발견했습니다. 다른 방법들은 음악과 사진을 영상으로 직접 매핑하여 모든 것을 한꺼번에 처리하려고 했으나, 이는 컴퓨터가 너무 많은 복잡한 문제를 동시에 해결해야 했기에 움직임을 뻣뻣하거나 설득력 없게 만들곤 했습니다. FlowDance는 움직임과 이미지 생성을 연결하되 구별함으로써 이러한 함정을 피합니다. 이 시스템은 사전 학습된 비디오 모델을 기반으로 삼고, 음악이 포즈에 영향을 미치는 특정 경로를 추가하며, 무용사의 얼굴과 몸이 원본 사진과 동일하게 보이도록 하는 또 다른 경로를 추가합니다.
이 시스템을 훈련시키기 위해 연구진은 인터넷에서 댄스 영상 컬렉션을 구축했으며, 품질이 높고 단일 인물이 춤을 추는 클립을 신중하게 선정했습니다. 그들은 165,000개 이상의 짧은 클립(각 5초 길이)을 수집하고 상세한 라벨을 추가했습니다. 모든 영상에 대해 음악, 무용수의 3차원 움직임, 카메라 각도, 그리고 관절의 2D 위치를 기록했습니다. FlowDanceSet이라고 명명된 이 데이터셋을 통해 컴퓨터는 음악의 리듬과 인간의 몸이 움직이는 특정한 방식 사이의 관계를 학습하는 동시에, 실제 사람이 움직일 때 어떻게 보이는지를 학습할 수 있었습니다. 이후 시스템은 본 적 없는 새로운 노래와 새로운 무용수를 대상으로 테스트되었습니다. 결과는 FlowDance가 기존의 다른 방식들보다 더 매끄럽고 사실적인 영상을 생성했음을 보여주었습니다. 출력을 다른 시스템이 만든 영상과 비교하는 테스트에서, 인간 관찰자들은 FlowDance가 만든 영상이 더 자연스럽고, 움직임이 더 유연하며, 음악과 동작 사이의 연결성이 더 강하다고 일관되게 평가했습니다.
또한 이 시스템은 무용사의 정체성을 잃지 않고 더 긴 영상을 처리하는 방법을 도입했습니다. 영상이 길어질수록 컴퓨터는 첫 프레임의 인물이 어떻게 생겼는지 기억하는 데 어려움을 겪는 경우가 많으며, 이로 인해 시간이 지남에 따라 얼굴이나 옷이 미세하게 변하는 '드리프트(drift)' 현상이 발생합니다. FlowDance는 생성 과정 중 다양한 시점에 무용사의 원본 사진을 시스템에 반복적으로 다시 입력함으로써 이를 해결합니다. 이는 시각적 디테일을 고정시켜 시스템이 많은 초 동안 일관된 외형을 유지하며 시퀀스를 생성할 수 있게 합니다. 연구진은 이 방법이 병렬 스트림과 결una되어, 무용수가 복잡하고 에너지 넘치는 동작을 수행하는 동안에도 의상, 체형, 얼굴 특징이 안정적으로 유지되는 영상을 만들 수 있음을 발견했습니다. 이 연구는 움직임을 계획하는 작업과 이미지를 렌더링하는 작업을 분리하되, 이들을 지속적으로 소통하게 함으로써 구조적으로 정확하면서도 시각적으로 설득력 있는 댄스 영상을 만드는 것이 가능하다는 것을 입증합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.