Identity-Consistent Expression Fields: A Disentangled Neural Radiance Field Framework for Few-Shot Facial Expression Synthesis
본 논문은 정적인 정체성 특징을 동적인 표정 변형으로부터 분리하고 신뢰도 가중 워핑 메커니즘을 채택하여, 새로운 표정으로의 외삽 상황에서도 퓨샷 시나리오에서 정체성을 보존하는 고품질의 얼굴 표정 합성을 달성하는 얽힘이 해제된 뉴럴 라디언스 필드 프레임워크인 Identity-Consistent Expression Fields (ICEF)를 제안한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 로봇에게 특정 친구를 그리는 법을 가르치려 한다고 상상해 보세요. 당신에게는 그 친구의 사진이 딱 세 장뿐입니다. 하나는 웃는 모습, 하나는 놀란 모습, 그리고 하나는 무표정한 모습입니다. 당신의 목표는 로봇이 한 번도 본 적 없는 익살스럽고 과장된 표정(예를 들어, 눈썹을 치켜뜨며 혀를 내미는 표정)을 짓고 있는 그 친구의 새로운 사진을 생성하게 만드는 것입니다. 이것이 바로 컴퓨터가 수학을 이용해 평면적인 2D 사진을 3D 세계로 바꾸는 영리한 방법인 **신경 방사 휘도장(Neural Radiance Fields, NeRF)**의 세계입니다. NeRF를 삼각형으로 이루어진 3D 모델이 아니라, 어느 지점에서 보느냐에 따라 그 지점의 색상과 밀도가 정확히 어떠해야 하는지를 알고 있는 마법 같은 "안개"라고 생각하세요.
오랫동안 이 3D 안개 제조기들은 새로운 각도에서 얼굴을 보여주는 데는 뛰어났지만, 단 몇 장의 사진만을 사용하여 (미소에서 찡그림으로 변하는 것처럼) 표정을 바꾸라고 요청받으면 종종 혼란에 빠지곤 했습니다. 이들은 얼굴 전체를 변형시키려 시도했는데, 그 과정에서 사람의 고유한 특징까지 실수로 바꿔버렸습니다. 이는 비디오 게임에서 캐릭터의 의상을 바꾸려는데, 게임 엔진이 옷과 함께 캐릭터의 코 모양이나 피부 질감까지 바꿔버리는 것과 같습니다. 이는 영화나 비디오 게임을 위한 가상 아바타를 만드는 데 있어 큰 문제인데, 왜냐하면 당신은 캐릭터가 무언가 다른 행동을 하더라도 여전히 '자기 자신'처럼 보이기를 원하지, 낯선 사람으로 변하기를 원하지 않기 때문입니다.
여기에 ICEF(Identity-Consistent Expression Fields, 정체성 일관적 표현장)라는 새로운 아이디어가 등장했습니다. 이 논문의 연구자들은 기존 방식들이 하나의 복잡하고 엉킨 "특징 볼륨(feature volume, 얼굴의 모든 세부 사항을 담고 있는 디지털 컨테이너)"을 새로운 표정에 맞게 왜곡하려고 했다는 점에 주목했습니다. 문제는 이 컨테이너가 너무 유연했다는 점입니다. 새로운 표정에 맞춰 늘어나라는 요청을 받으면, 이 컨테이너는 사람의 정체성까지 함께 왜곡해 버렸습니다. ICEF는 더 똑똑한 접근 방식을 제안합니다. 얼굴을 하나의 크고 엉킨 컨테이너 대신 두 개의 뚜렷한 부분으로 나누는 것입니다. 첫째, 사람의 얼굴이 가진 모든 고유한 세부 사항(피부 질감, 코의 정확한 모양, 눈동자 색 등)을 중립적인 상태로 간직하는 **변하지 않는 "신분증(ID card)"**을 유지합니다. 둘째, 얼굴 표정을 지을 때 실제로 움직이는 부분(입, 눈, 눈썹 등)만을 움직이는 별도의 **유연한 "틀(mold)"**을 만듭니다.
이 논문은 이 두 가지를 엄격히 분리함으로써, 컴퓨터가 "신분증"에는 전혀 손을 대지 않고 "틀"만을 늘려 새로운 표정을 만들 수 있다고 제안합니다. 틀이 신분증을 실수로 붙잡지 않도록 하기 위해, 그들은 특별한 규칙(정규화 도구)을 추가했습니다. 이 규칙은 컴퓨터에게 "입과 눈만 움직이고, 이마와 볼은 그대로 두어라"라고 명령합니다. 또한, 연구자들은 만약 컴퓨터에게 주어진 몇 장의 사진과 매우 다른 표정을 만들라고 요구하면, 컴퓨터가 무모하게 추측하며 실수를 저지를 수 있다는 점을 깨달았습니다. 이를 해결하기 위해 ICEF는 "신뢰도 측정기"를 사용합니다. 새로운 표정이 알고 있는 예시들과 거리가 멀 경우, 시스템은 복잡하고 위험한 추측을 신뢰하는 대신 얼굴을 움직이는 더 단순하고 안전한 방식으로 자동 전환합니다.
테스트에서 저자들은 이 방법이, 특히 새로운 표정이 학습 사진들과 매우 다를 때 정체성을 유지하는 데 훨씬 더 효과적이라는 것을 발견했습니다. 그들은 기존 방식들이 한계에 부딪혔을 때 사람의 정체성을 흐릿하게 만들거나 왜곡하기 시작한 반면, ICEF는 정체성을 선명하고 일관되게 유지한다는 것을 보여주었습니다. 이 논문은 이 방법이 가능한 모든 얼굴에 적용되는 완벽하고 완성된 제품이라고 주장하는 것이 아니라, 이 "분리" 전략이 소량의 데이터(few-shot)를 이용한 얼굴 애니메이션에서의 정체성 드리프트 문제를 해결하는 견고한 방법임을 시사합니다. 이는 디지털 아바타가 자신의 얼굴을 잃지 않으면서도 어떤 장면이든 연기할 수 있게 만드는 과정을 향한 한 걸음입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.