Multi-View Face and Gesture Animation with Dynamic Gaussians
본 논문은 얼굴과 손의 개별적인 모델링을 파라메트릭 상체 메쉬 및 3D 가우시안 스플래팅과 결합하여 정확한 얼굴 표정과 손 동작을 갖춘 포토리얼리스틱하고 고충실도의 상체 아바타를 생성하는 새로운 멀티뷰 파이프라인인 MVFGA를 제시하며, 이와 함께 MVFGA-MoCap 데이터셋을 공개한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 비디오 게임이나 가상 회의를 위해 실제 사람의 디지털 트윈을 만들려고 한다고 상상해 보십시오. 컴퓨터 그래픽스의 세계에서 이것은 마치 인간처럼 보이지만 똑같이 움직이고 말할 수 있는 인형을 만드는 것과 같습니다. 오랫동안 과학자들은 까다로운 문제와 씨름해 왔습니다. 어떻게 하면 얼굴은 실제 감정을 담아 미소 짓게 하면서, 동시에 손은 완벽한 정확도로 흔들거나 가리키게 할 것인가 하는 문제입니다. 얼굴에 너무 집중하면 손은 딱딱한 블록처럼 보이고, 몸 전체에 집중하면 얼굴은 매끄럽고 표정이 없는 가면처럼 변해버립니다. 이 논문은 움직이는 이미지를 만드는 법을 컴퓨터에게 가르치는 데 전념하는 과학 분야인 컴퓨터 애니메이션에서 나왔습니다. 이 연구는 두 가지 주요 아이디어를 기반으로 합니다. 하나는 사람의 형태에 맞춰 늘리고 비틀 수 있는 유연한 디지털 골격과 같은 "파라메트릭 모델(parametric models)"이며, 다른 하나는 전통적인 평면 삼각형 대신 수백만 개의 작고 흐릿한 3D 점들로 장면을 채색하는 현대적 기법인 "3D 가우시안 스플래팅(3D Gaussian Splatting)"입니다. 목표는 단순히 사진 속에서만 실물처럼 보이는 것이 아니라, 움직일 때 살아있는 것처럼 느껴지는 아바타를 만드는 것이며, 이를 통해 무언가 거의 인간 같지만 미묘하게 어색하여 느껴지는 불쾌한 골짜기(uncanny valley) 현상을 피하는 것입니다.
이 연구를 진행한 연구진인 알리레자 자반마르디(Alireza Javanmardi)와 그의 팀은 새로운 시스템인 MVFGA(Multi-View Face and Gesture Animation with Dynamic Gaussians)를 구축함으로써 이 문제를 해결하기로 했습니다. 그들의 접근 방식은 마치 거대한 솥 하나에 온전한 식사를 한꺼번에 요리하려고 노력하는 대신, 재료를 따로 준비한 뒤 완벽하게 결합하는 숙련된 요리사와 같습니다. 전체 인체를 하나의 거대하고 엉망인 덩어리로 모델링하는 대신, 그들은 특별한 "상체" 인형을 만들었습니다. 그들은 표준 디지털 신체 모델을 가져와 다리를 수술적으로 제거하고 몸통, 머리, 팔만을 남겼습니다. 그런 다음, 그들은 매우 영리한 작업을 수행했습니다. 이 인형에 두 개의 특화된 "제어 패널"을 부착한 것입니다. 한 패널은 FLAME라고 불리는 시스템을 사용하여 오로지 얼굴에만 전념하며, 다른 한 패요는 MANO라고 불리는 시스템을 사용하여 오로로 손에만 전념합니다. 이를 통해 컴퓨터는 얼굴 표정과 손가락 움직임을 독립적으로 조절할 수 있으며, 덕분에 미소가 실수로 손가락 모양을 왜곡하거나 손을 흔드는 동작이 눈의 형태를 뒤틀리게 하는 일이 발생하지 않습니다.
이 유연한 골격을 준비한 후, 그들은 단순히 와이어프레임 단계에서 멈추지 않았습니다. 그들은 인형 위에 "3D 가우시안(3D Gaussians)" 층을 덮었습니다. 이 작은, 빛나고 흐릿한 구름 한 움큼을 인형의 표면에 모두 붙인다고 상상해 보십시오. 이 구름들은 단순한 장식이 아닙니다. 이들은 사람의 피부, 머리카락, 옷의 색상과 질감을 담고 있습니다. 인형이 움직일 때 이 구름들은 함께 늘어나고 찌그러지며, 만화가 아닌 사진처럼 보이는 초고화질의 사실적인 이미지를 만들어냅니다. 컴퓨터가 이 작업을 수행하는 법을 배우도록 하기 위해, 팀은 단 하나의 카메라만을 사용하지 않았습니다. 그들은 피사체를 중심으로 원형으로 배치된 17대의 카메라가 있는 스튜디오를 설치했습니다. 그들은 우스꽝스러운 표정을 짓거나 복잡한 손 동작을 하고 자유롭게 대화를 나누는 15명의 서로 다른 사람들을 촬영했습니다. 이는 컴퓨터가 모든 가능한 각도에서 움직이는 인간 위에서 빛과 그림자가 어떻게 작동하는지를 정확히 배울 수 있는 훈련장 역할을 하는 MVFGA-MoCap이라는 거대한 데이터셋을 생성했습니다.
그들의 실험 결과는 매우 인상적이었습니다. MVFGA를 다른 최고 수준의 방법들과 비교했을 때, MVFGA는 일관되게 더 선명하고 사실적인 이미지를 생성했습니다. 예를 들어, 컴퓨터가 생성한 이미지가 실제 사진과 얼마나 유사한지를 측정했을 때, 그들의 방식은 오차율(L1)이 단 4.06에 불과했으며, 이는 차점자의 오차인 9.59보다 훨씬 낮은 수치였습니다. 시각적 유사성(SSIM) 측면에서도 0.938을 기록하며 경쟁자들을 앞질렀습니다. 하지만 진짜 마법은 디테일에서 일어났습니다. 다른 방식들은 종종 손을 흐릿한 덩어리로 만들거나 손가락이 서로 교차할 때 특정 형태를 잃어버리는 반면, MVFGA는 손가락을 뚜렷하고 정확하게 유지했습니다. 또한 그들은 자신들의 아바타가 사람의 대화 영상만으로도 구동될 수 있으며, 시스템이 카메라가 실제로 보지 못했던 각도에서도 디지털 트윈의 얼굴 표정과 손 동작을 충실히 재현한다는 것을 발견했습니다.
하지만 저자들은 이것이 모든 것을 해결하는 마법 지팡이가 아니라는 점을 주의 깊게 명시하고 있습니다. 그들의 시스템은 여전히 기초가 되는 "골격" 모델에 의존하므로, 바람에 휘날리는 셔츠나 떨어지는 모자처럼 모델이 명시적으로 추적하지 않는 "이차적 움직임(secondary motions)"을 쉽게 처리할 수는 없습니다. 또한, 주로 정면 뷰를 기준으로 학습되었기 때문에, 데이터셋에서 뒤쪽 정보를 충분히 포착하지 못했기에 아바타를 뒤에서 바라볼 경우 다소 어려움을 겪습니다. 이러한 한계에도 불구하고, 이 논문은 얼굴과 손을 분리하고 그 위에 3D 점들의 구름을 입힘으로써, 우리가 더욱 몰입감 있는 가상 현실 경험과 더 나은 디지털 통신 도구를 위한 길을 열어주는, 진정으로 생동감 넘치는 디지털 인간에 훨씬 더 가까워졌음을 시사합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.