AniCrafter: Customizing Realistic Human-Centric Animation via Avatar-Background Conditioning in Video Diffusion Models
AniCrafter는 '아바타-배경' 컨디셔닝 메커니즘을 도입하여 기존의 구조 의존적 방식의 한계를 극복함으로써, 개방형 도메인의 동적인 배경 내에서 실감 나고 폐쇄(occlusion)를 고려한 인간 중심의 애니메이션 생성을 가능하게 하는 새로운 확산 기반 모델이다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 사진 속에서 걸어 나와 북적이는 도시의 거리에서 춤을 추는 캐릭터를 만드는 영화를 제작하려 한다고 상상해 보세요. 컴퓨터 과학의 세계에서 이것은 "비디오 생성(video generation)"이라는 까다로운 퍼즐입니다. 오랫동안 컴퓨터는 정지된 이미지를 움직이게 하거나, 적어도 단순하고 비어 있는 공간에서 무언가를 움직이게 하는 데는 뛰어났습니다. 하지만 자동차가 지나다니고, 나무가 흔들리며, 빛이 변하는 복잡하고 실제적인 세계의 영상 속에 사람을 넣으려고 하면 상황은 꼬이기 시작합니다. 컴퓨터는 종종 혼란에 빠져, 사람을 떠다니는 유령이나 배경과 어울리지 않는 글리치(glitch) 섞인 스티커처럼 만들어 버립니다.
이 문제를 해결하기 위해 과학자들은 "비디오 확산 모델(Video Diffusion Models)"이라는 것을 사용합니다. 이 모델들을 수백만 개의 영상을 본 매우 재능 있는 예술가라고 생각해보세요. 그들은 단순히 복사해서 붙여넣는 것이 아니라, 빛, 그림자, 그리고 움직임이 작동하는 "규칙"을 학습합니다. 그들은 스켈레톤(뼈대) 그림이나 포즈 같은 힌트를 받으면, 그것을 바탕으로 완전히 새로운 영상을 상상해낼 수 있습니다. 그러나 이전의 시도들은 이 예술가들을 이용해 특정 인물을 새로운 배경에 넣으려고 할 때 자주 실패했습니다. 사람은 뻣뻣해 보이거나, 옷의 움직임이 부자연스러웠으며, 마치 실제 그 자리에 서 있는 것이 아니라 배경 위에 그려진 것처럼 보였습니다. 핵심적인 질문은 이것이었습니다. 어떻게 하면 컴퓨터가 사람이 장면 '안에' 있어서 환경과 상호작용하고 있다는 것을 이해하게 만들 것인가, 즉 단순히 배경 위에 떠 있는 것이 아니라 말입니다.
여기, 도쿄 대학교와 다른 기관의 연구진이 개발한 새로운 도구인 AniCrafter가 등장합니다. AniCra-fter를 단순히 캐릭터를 움직이는 것을 넘어, 캐릭터와 주변 세계 사이의 관계를 재구축하는 "디지털 인형술사"라고 생각해보세요. 연구진은 비결이 단지 컴퓨터에게 사람을 어떻게 움직일지 알려주는 것이 아니라, 그 사람이 이미 포함된 장면이 어떤 모습이어야 하는지에 대한 "초안(rough draft)"을 주는 데 있다는 것을 발견했습니다.
그들이 이 일을 어떻게 해냈는지 살펴보겠습니다. AI에게 처음부터 전체 영상을 추측하라고 요청하는 대신, 그들은 먼저 '3D 가우시안 스플래팅(3D Gaussian Splatting)'이라는 기술을 사용하여 사람의 "3D 스켈레톤"을 구축했습니다. 사진 한 장을 찍어 순식간에 그 형태를 유지하는 수백만 개의 작은 빛나는 3D 점 구름으로 변환한다고 상상해 보세요. 그런 다음 이 3D 구름이 원하는 리듬에 맞춰 춤을 추도록 만들었습니다. 이를 통해 원하는 움직임은 정확하지만, 머리카락이나 천의 세밀한 디테일은 부족하고 약간 흐릿해 보이는 "거친 영상(rough video)"이 만들어졌습니다.
그다음, 이 거친 영상을 사용하고자 하는 배경 영상 위에 덧붙였습니다. 이는 기묘한 하이브리드 영상을 만들어냈습니다. 배경은 완벽하지만, 사람은 약간 흐릿한 3D 렌더링 버전처럼 보이는 상태였습니다. 이것이 바로 "아바타-배경(avatar-background)" 트릭입니다. 그들은 이 하이브리드 영상을 자신들의 AI 모델에 입력하며 이렇게 말했습니다. "너는 배경이 어떻게 생겼는지 알고 있고, 사람의 대략적인 형태도 알고 있어. 이제 저 사람을 수정해줘. 머리카락이 자연스럽게 휘날리게 하고, 옷이 바람에 출렁이게 하며, 피부 위의 조명이 배경의 가로등과 일치하도록 만들어줘."
이 논문은 이전의 방법들이 단순히 스켈레톤 포즈(막대기 사람 형태)만을 제공하고 결과가 좋기를 바라거나, 혹은 완벽한 3D 모델을 먼저 만들려고 노력했기 때문에 실패했다고 주장합니다. AniCrafter는 이러한 접근 방식을 거부합니다. 대신, 이 문제를 "복원(restoration)" 작업으로 취급합니다. 괜찮지만 불완전한 버전의 장면에서 시작하여, AI의 강력한 두뇌를 이용해 디테일을 다듬는 것입니다.
결과는 인상적입니다. 테스트에서 AniCrafter는 사람의 사진을 가져와 북적이는 시장이나 바람 부는 공원 같은 완전히 다른 영상 속에서 춤추게 만들면서도, 얼굴이 원래 사진과 똑같이 보이도록 유지했습니다. 또한 사람이 나무나 자동차 뒤로 걸어가는 까다로운 상황에서도 나무가 사람의 몸을 가리는 것처럼 실제로 일어나는 일처럼 정확하게 처리했습니다. 연구진이 자신들의 방법을 기존의 가장 뛰어난 도구들과 비교했을 때, AniCrafter는 더 현실적이고 움직임이 더 자연스러우며 이상한 글리치가 적은 영상을 일관되게 생성해냈습니다.
가장 멋진 기능 중 하나는 빛을 다루는 방식입니다. 만약 당신이 햇살 가득한 공원에 있는 사람의 사진을 찍어 어둡고 비 내리는 골목길에 넣으려고 한다면, 기존 방식들은 그 사람이 여전히 햇빛 아래 서 있는 것처럼 보이게 만들 것입니다. 하지만 AniCrafter는 사람을 "재조명(re-light)"하는 법을 배웠습니다. AI는 그 사람이 새로운 환경에 맞춰 더 어둡고 젖어 보여야 한다는 것을 파악해냈고, 덕분에 최종 영상은 하나의 실제 순간을 카메라로 포착한 것처럼 느껴지게 되었습니다.
연구진은 이를 수천 개의 영상에 대해 테스트했습니다. 그들은 "거친 3D 초안"과 "완벽한 배경"을 결합함으로써, AI가 이전보다 훨씬 더 잘 스카프가 펄럭이거나 머리카락이 바람에 움직이는 것과 같은 누락된 디테일을 채워 넣을 수 있다는 것을 발견했습니다. 심지어 평균적인 체형뿐만 아니라 매우 다양한 체형의 사람들도 처리할 수 있음을 보여주었습니다.
이 도구는 강력하지만, 저자들은 그 한계에 대해서도 솔직하게 밝히고 있습니다. 현재로서는 캐릭터의 모든 각도에서 걸어 다닐 수 있는 완전한 3D 세계를 만들 수는 없으며, 여전히 실감 나는 평면 영상을 만드는 데 집중하고 있습니다. 하지만 역동적이고 움직이는 세상 속에서 정적인 사진을 살아 움직이게 만들고자 하는 구체적인 목표에 있어서, AniCrafter는 새로운 방향을 제시합니다. 컴퓨터에게 전체를 상상하라고 요구하는 대신, 좋은 시작점을 주고 디테일을 수정하게 하라는 것입니다. 이는 마치 조각가에게 아무것도 없는 상태에서 무언가를 만들라고 하는 대신, 거친 찰흙 덩어리를 주고 최종 걸작을 깎아내라고 요청하는 것과 같습니다. 이 논문은 모든 것을 처음부터 구축하려고 노력하는 것보다 "수정하는" 접근 방식이 더 효과적이며, 결과적으로 더욱 생동감 넘치는 영상을 만들어낸다는 것을 보여줍니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.