Emotion Intensity Matters: Generating Realistic Expressions in Virtual Humans with CVAEs
본 논문은 소규모의 실제 인간 얼굴 표정 데이터셋으로 학습된 조건부 변이형 오토인코더(CVAE)를 제안하며, 이는 수동 개입 없이도 의미적 일관성을 유지하고 변화하는 감정의 강도를 정확하게 반영하는 조절 가능한 사실적인 가상 인간 애니메이션을 생성한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
컴퓨터 그래픽스의 세계에서, 진정으로 살아있는 듯한 느낌을 주는 캐릭터를 만드는 것은 예술가들이 직면할 수 있는 가장 어려운 과제 중 하나입니다. 우리는 오랫동안 사실적인 가상 인간을 구축할 수 있었지만, 그들을 실재하는 것처럼 느끼게 만드는 데는 단순히 좋은 얼굴 그 이상의 것, 즉 미묘하게 변화하는 감정의 언어가 필요합니다. 수십 년 동안 애니메이터들은 카메라로 실제 배우의 얼굴을 포착하여 그 움직임을 디지털 캐릭터에 매핑하는 퍼포먼스 기반 애니메이션(performance-driven animation)이라는 방법에 의존해 왔습니다. 이 방식은 효과적이지만, 모든 표정마다 인간 연기자가 필요하며, 처음부터 다시 시작하지 않고는 변형을 만들 수 없다는 한계가 있습니다. 새로운 접근 방식은 컴퓨터가 인간 감정의 규칙을 이해하도록 학습시켜, 카메라 앞의 배우 없이도 스스로 새로운 표정을 발명할 수 있도록 하는 것을 목표로 합니다. 문제는 감정이 정적이지 않다는 점이었습니다. 감정은 아주 미세한 슬픔의 기미부터 압도적인 비탄의 물결에 이르기까지 강도가 변화합니다. 대부분의 컴퓨터 모델은 이러한 뉘앙스를 포착하는 데 어려움을 겪으며, 종종 너무 매끄럽거나 일반적인 얼굴을 만들어내어, 감정을 믿을 수 있게 만드는 특유의 강렬함이 부족한 모습을 보입니다.
브라질 리오그란데두술루스 가톨릭 대학교의 연구진은 컴퓨터가 다양한 강도의 현실적인 감정 표현을 생성할 수 있도록 가르치는 새로운 방법을 개발하여 이 문제를 해결하고자 했습니다. 그들은 여섯 가지 기본 인간 감정인 행복, 분노, 공포, 슬픔, 혐오, 놀라움에 집중했습니다. 컴퓨터에게 단순히 영상을 복사하도록 요구하는 대신, 연구진은 시스템이 실제 인간의 연기 모음으로부터 이러한 감정들의 기저 구조를 학습하도록 훈련시켰습니다. 연구팀은 여덟 명의 남성과 여덟 명의 여성을 포함한 16명의 서로 다른 사람들의 영상 자료를 수집하였으며, 이들은 여섯 가지 감정을 두 가지 뚜렷한 강도 수준(낮음과 높음)으로 연기했습니다. 이 영상으로부터 연구진은 눈썹이 얼마나 높이 올라가는지 또는 입이 얼마나 넓게 벌어지는지와 같이 가상 얼굴의 움직임을 제어하는 구체적인 수치 값들을 추출했습니다. 그 결과 7,680개의 구체적인 얼굴 표정 순간들을 얻었으며, 이는 매우 복잡한 작업치고는 상대적으로 적은 숫자이지만 연구진은 이를 모델을 가르치는 데 사용했습니다.
그들 방법의 핵심은 조건부 변이형 오토인코더(Conditional Variational Autoencoder)라고 불리는 일종의 인공지능입니다. 간단히 말해, 이 시스템은 일련의 예시를 공부한 다음 설명에 따라 새로운 그림을 그리는 데 능숙한 학생처럼 작동합니다. 컴퓨터에는 얼굴 데이터와 함께 어떤 감정이 나타나고 있는지, 강도는 어떠한지, 그리고 성별이 남성인지 여성인지 알려주는 라벨이 주어졌습니다. 시스템은 이 정보를 압축된 내부 표현으로 압축하는 법을 배웠으며, 본질적으로 각 감정이 다양한 강도에서 어떻게 보이는지에 대한 정신적 지도를 생성했습니다. 새로운 표정을 생성하라는 요청을 받으면, 컴퓨터는 "강도가 높은 행복한 표정의 여성" 또는 "강도가 낮은 슬픈 표정의 남성"을 만들도록 지시받을 수 있으며, 그 지시에 부합하는 새로운 일련의 얼굴 움직임을 생성해 냈습니다. 연구진은 시스템이 일관된 감정적 변형을 성공적으로 생성할 수 있다는 것을 발견했지만, 초기 결과에는 이 기술에서 흔히 나타나는 결함이 있었습니다. 즉, 표정이 너무 매끄럽다는 것이었습니다. 컴퓨터는 세부 사항을 평균화하는 경향이 있어, 얼굴이 차분하고 다소 밋밋해 보였으며, 실제 인간의 감정이 가진 날카로운 정점을 놓치곤 했습니다.
이러한 매끄러운 효과를 해결하기 위해, 팀은 프로세스에 정교화 레이어(refinement layer)로서 두 번째 단계를 추가했습니다. 그들은 처음에 사용했던 실제 인간의 표정과 첫 번째 컴퓨터 모델이 만든 약간 밋밋한 버전 사이의 차이를 계산했습니다. 그런 다음 두 번째의 특화된 시스템을 훈련시켜 이러한 차이의 패턴을 학습하게 했습니다. 이 두 번째 시스템은 교정 도구처럼 작동하여, 첫 번째 모델이 놓친 부분이 정확히 어디인지 식별하고 빠진 에너지와 역동성을 다시 더해주었습니다. 이 교정이 적용되었을 때, 가상 얼굴은 자연스러운 활기를 되찾았습니다. 입의 움직임은 더 뚜렷해졌고, 감정의 강도는 원래의 인간 연기와 밀접하게 일치하는 수준으로 돌아왔습니다. 통계적 테스트를 통해 최종적으로 교정된 표정들이 초기 컴퓨터 생성 버전보다 실제 인간 데이터에 훨씬 더 가깝다는 것이 확인되었으며, 이는 얼굴 제어 방식의 유사성을 효과적으로 두 배로 높였습니다.
연구는 또한 별도의 독립적인 컴퓨터 프로그램이 이 새로운 가상 얼굴들에서 감정을 얼마나 잘 인식하는지를 측정했습니다. 교정 단계 전에는 컴퓨터가 특히 공포나 놀라움과 같은 복잡한 감정에 대해 어려움을 겪기도 했습니다. 하지만 정교화 단계 이후에는 대부분의 감정에 대해 인식률이 크게 향상되었으며, 이는 추가된 세부 사항들이 단순한 노이즈가 아니라 진정한 감정적 단서임을 시사합니다. 연구진은 이 시스템이 낮은 강도와 높은 강도 모두에서 잘 작동한다는 점에 주목했으며, 이는 매번 새로운 시나리오를 위해 재학습할 필요 없이 인간 표현의 전체 범위를 다룰 수 있음을 증명했습니다. 시스템이 실제 관객에게 얼마나 자연스럽게 느껴지는지 확인하기 위해 인간 관찰자를 대상으로 한 추가적인 테스트가 여전히 필요하지만, 이번 결과는 비교적 적은 양의 실제 세계 데이터로부터 제어 가능하고 표현력이 풍부한 가상 캐릭터를 만드는 것이 가능하다는 것을 보여줍니다. 이 접근 방식은 인간 배우나 수동적인 예술적 조정 없이도 인간 감정의 전체 스펙트럼을 표현할 수 있는 디지털 캐릭터를 만들기 위한 진전된 경로를 제시합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.