CETalk: Continuous Valence-Arousal Control for Audio-Driven 3D Talking Head Generation
이 논문은 이산적인 감정 범주의 한계를 극복하면서 미세한 감정 제어와 정확한 입술 동기화를 달성하기 위해 연속적인 가치-각성(Valence-Arousal) 표현과 다중 스케일 시간적 모델링 아키텍처를 활용하는 오디오 기반 3D 토킹 헤드 생성 프레임워크인 CETalk을 소개한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
급변하는 디지털 미디어 세계에서 실물과 같은 가상 인간을 창조하는 능력은 공상 과학의 영역에서 실용적인 응용의 영역으로 넘어왔습니다. 이러한 디지털 아바타는 가상 비서, 가상 현실 통신, 그리고 인터랙티브 엔터테인먼트 분야에서 점점 더 많이 사용되고 있습니다. 이 분야의 핵심 과제는 이 캐릭터들이 단순히 입만 움직이는 것이 아니라 얼굴 전체로 말하게 만드는 것입니다. 초기 시스템들은 음성 단어에 입 모양을 맞추는 데는 성공했지만, 인간의 대화를 실감 나게 만드는 미묘하고 변화무쌍한 감정을 전달하는 데는 종종 어려움을 겪었습니다. 전통적인 방식은 감정을 '행복', '슬픔', '분노'와 같이 별개의 독립된 상자로 취급했습니다. 이 방법은 큰 틀에서는 효과적이었으나, 미소가 서서히 사라지며 걱정스러운 표정으로 변하거나, 흥분이 조용히 끓어오르다 갑자기 터져 나오는 것과 같은 인간 감정의 유동적이고 연속적인 특성을 포착하는 데는 실패했습니다. 더욱이, 말의 타이밍과 감정의 타이밍은 근본적으로 다릅니다. 입은 단어의 빠른 소리에 맞춰 빠르게 움직여야 하는 반면, 감정 표현은 얼굴 전체에 걸쳐 더 느리게 진화하기 때문입니다.
허페이 공과대학교의 연구진은 이러한 구체적인 문제들을 해결하기 위해 CETalk라는 새로운 시스템을 개발했습니다. 이 시스템은 감정을 경직된 범주로 강제하는 대신, 감정이 얼마나 긍정적인지 혹은 부정적인지, 그리고 얼마나 활발한지 혹은 수동적인지를 추적하는 연속적인 2차원 지도를 사용합니다. 이러한 접근 방식은 컴퓨터가 인간 대화의 자연스러운 흐름을 반영하여 부드럽게 변화하는 얼굴 애니메이션을 생성할 수 있게 해줍니다. 연구팀은 기존의 비디오 녹화본으로부터 3D 얼굴 움직임을 재구성하고 모든 프레임에 대해 이러한 연속적인 감정 수치를 자동으로 추정하여, 시스템을 훈련시키기 위한 대규모의 새로운 데이터셋을 구축했습니다. 이 데이터는 컴퓨터에게 음성에 필요한 빠르고 정밀한 움직임과 기분을 전달하는 느리고 광범위한 변화를 구분하도록 가르치는 데 필요한 토대를 제공했습니다.
새로운 시스템의 핵심은 시간을 처리하는 방식에 있습니다. 연구진은 드러머가 일정하고 빠른 비트를 유지하는 동안 가수가 길고 느린 음을 길게 끄는 것처럼, 음성과 감정이 서로 다른 속도로 작동한다는 점을 깨달았습니다. 이를 관리하기 위해 시스템은 처리를 두 개의 병렬 경로로 분리합니다. 한 경로는 입과 턱의 고속 디테일에 집중하여 모든 음절이 오디오와 완벽하게 동기화되도록 보장합니다. 다른 경로는 눈썹을 찌푸리거나 눈을 크게 뜨는 것과 같이 감정을 표현하는 더 느리고 넓은 얼굴의 움직임에 집중합니다. 이 두 정보 스트림은 스마트 통합 시스템에 의해 다시 결합되며, 이 시스템은 매 순간 음성 움직임과 감정 표현 중 어느 쪽에 더 많은 비중을 둘지 결정합니다. 이를 통해 최종 애니메이션은 입 모양 동기화가 정확하면서도 풍부한 감정적 깊이를 가질 수 있습니다.
연구진은 세 가지 종류의 비디오 데이터를 사용하여 기존의 여러 방식과 자신들의 시스템을 비교했습니다. 결과에 따르면, 그들의 방식은 이전의 최고 방법들보다 훨씬 더 정확한 입 모양 움직임과 더 사실적인 얼굴 표정을 만들어냈습니다. MEAD 데이터셋을 이용한 테스트에서, 그들의 시스템은 입 움직임 오차를 약 7.48밀리미터로, 전체 얼굴 움직임 오차를 약 9.91밀리미터로 줄였으며, 해당 벤치마크에서 테스트된 모든 다른 기술들을 능가했습니다. 정확도를 넘어, 이 시스템은 연속적인 감정 지시를 따르는 데 있어 탁월한 능력을 보여주었습니다. 부정적인 상태에서 긍정적인 상태로 점진적으로 변화하는 얼굴을 생성하라는 요청을 받았을 때, 시스템은 의도된 감정 궤적을 경쟁 모델들보다 훨씬 더 정밀하게 따라갔습니다.
또한 연구진은 이 시스템이 감정의 강도에 대한 세밀한 제어를 가능하게 한다는 것을 입증했습니다. 입력 값을 조정함으로써, 목소리와의 동기화를 깨뜨리지 않고도 캐릭터의 표정을 미묘하게 더 강렬하게 만들거나 혹은 더 차분하게 만들 수 있었습니다. 이러한 수준의 제어는 디지털 휴먼이 진정으로 살아있는 것처럼 느끼게 하는 데 매우 중요하며, 실제 인간의 상호작용을 정의하는 미묘하고 연속적인 감정 변화를 수행할 수 있게 합니다. 감정을 불연속적인 범주로 다루는 것에서 벗어나 인간의 정서가 가진 연속적인 특성을 수용함으로써, 이 연구는 가상 통신이 기계를 보는 느낌이 아니라 사람과 연결되는 느낌을 주도록 만드는 데 있어 중요한 진전을 이루었습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.