← 최신 논문
💻 computer science

Instant Expressive Gaussian Head Avatars at Over 100 FPS

본 논문은 효율적인 국소 융합 전략과 분리된 모션 학습을 채택함으로써 기존 방식들의 고질적인 문제인 속도, 일관성, 그리고 디테일 사이의 절충 관계를 해결하고, 단일 이미지를 3D 일관성을 갖춘 고도의 표현력을 가진 실시간 애니메이션 가능 가우시안 헤드 아바타로 즉각 변환하는 피드포워드 파이프라인을 제안한다.

원저자: Kaiwen Jiang, Xueting Li, Seonwook Park, Ravi Ramamoorthi, Shalini De Mello, Koki Nagano

게시일 2026-06-29
📖 4 분 읽기☕ 가벼운 읽기

원저자: Kaiwen Jiang, Xueting Li, Seonwook Park, Ravi Ramamoorthi, Shalini De Mello, Koki Nagano

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 사람의 디지털 트윈을 만들고 싶다고 상상해 보세요. 즉, 실시간으로 말하고, 미소 짓고, 주변을 둘러볼 수 있는 그 사람의 3D 얼굴 버전 말입니다. 오랫동안 컴퓨터 과학자들은 '트릴레마(trilemma)'라고 불리는 세 갈래 길에서 헤매고 있었습니다. 세 가지 요소 중 보통 두 가지만 선택할 수 있었기 때문입니다:

  1. 속도: 비디오 콜(영상 통화)을 할 수 있을 만큼 충분히 빠른가?
  2. 3D 일관성: 사람이 고개를 돌렸을 때, 얼굴이 견고한 3D 물체처럼 보이는가, 아니면 형편없는 비디오 게임처럼 뒤틀리고 깨지는가?
  3. 표현력: 코의 주름, 눈가의 잔주름, 미세한 입 모양 변화와 같은 아주 작은 디테일까지 포착하는가?

대부분의 방식은 빠르지만 평면적이고 가짜처럼 보이거나(2D 방식), 3D로서 실감 나 보이지만 실시간으로 사용하기에는 너무 느렸습니다(3D 방식).

이 논문은 Instant Expressive Gaussian Head Avatars라는 새로운 솔루션을 소개합니다. 이것은 한 장의 인물 사진을 생동감 넘치는 3D 인형극 모델로 순식간에 바꿔주는 "마법의 번역기"라고 생각하면 됩니다.

작동 원리는 다음과 같습니다. 일상적인 비유를 들어 설명하겠습니다.

1. 구성 요소: 3D "스프레이 페인트"

얼굴을 단단한 메쉬(찰흙 조각 같은 것)나 복잡한 빛의 구름(안개 낀 방 같은 것)으로 만드는 대신, 저자들은 **3D 가우시안(3D Gaussians)**을 사용합니다.

  • 비유: 고해상도 사진을 찍어서 3D 공간에 떠 있는 수백만 개의 작고 색이 있는, 반투명한 "스프레이 페인트 점"들로 바꾼다고 상상해 보세요.
  • 도움이 되는 이유: 이 점들은 렌더링(화면에 그리는 것) 속도가 매우 빠릅니다. 카메라를 주변으로 움직여도 즉각적으로 견고한 3D 물체처럼 보입니다. 이는 속도3D 일관성 문제를 해결합니다.

2. 핵심 비결: 다른 차원에서 "근육" 움직이기

어려운 부분은 이 점들이 미소나 찌푸림을 흉내 내도록 움직이게 만드는 것입니다.

  • 기존 방식: 이전 방식들은 이 점들을 물리적인 3D 공간에서 직접 밀어서 움직이려고 했습니다. 이는 마치 손가락으로 젖은 찰흙을 조각하려는 것과 같습니다. 느릴 뿐만 아니라, 주름이 잡히는 것과 같은 미세한 디테일을 놓치기 쉽습니다.
  • 새로운 방식: 저자들은 점들을 물리적 공간에서 움직이는 대신, 점들 내부의 정보를 바꾸어야 한다는 것을 깨달았습니다.
  • 비유: 각 스프레이 페인트 점 안에 아주 작은 "설명서"(특징 벡터)가 들어있다고 상상해 보세요. 시스템은 점을 직접 움직이는 대신, 그 설명서 안의 내용을 다시 씁니다.
    • 미소를 짓게 하려면, 시스템은 점들을 위로 밀어 올리는 것이 아니라, 입 주변 점들의 "색상과 형태"에 대한 지침을 변경합니다.
    • 이 과정은 "고차원 특징 공간"(복잡한 수학적 세계)에서 일어나며, 이를 통해 속도를 늦추지 않으면서도 피부가 접히거나 주름지는 모습과 같은 훨씬 더 섬세하고 디테일한 움직임을 포착할 수 있습니다.

3. 학습: "슈퍼 선생님"으로부터 배우기

이 시스템이 어떻게 움직이는지 가르치기 위해서는 많은 데이터가 필요했습니다. 실제 영상은 카메라 각도가 계속 변하기 때문에 3D 모델을 혼란스럽게 만들기 쉽습니다.

  • 전략: 저자들은 강력한 AI(확산 모델, Diffusion Model)를 사용하여, 사람들이 극적인 표정을 짓고 있는 수천 장의 완벽한 "정면" 사진을 생성했습니다.
  • 비유: 이것은 학생이 그림을 배우는 것과 같습니다. 학생이 붐비는 방 안에서 이상한 각도로 서 있는 사람을 스케치하려고 애쓰는 대신, 선생님(확산 모델)이 재미있는 표정을 짓고 있는 사람의 완벽한 정면 사진을 주는 것입니다. 학생은 이 완벽한 사진으로부터 움직임을 배웁니다.
  • 안전장치: AI가 이상한 것(예를 들어, 수염이 없는 곳에 콧수염을 그려 넣는 것 등)을 환각하여 만들어내지 않도록, "선생님"은 얼굴의 앞부분에만 그림을 그리도록 제한합니다. 그런 다음 별도의 도구를 사용하여 측면 모습이 어떻게 보여야 하는지 파악함으로써, 3D 물체가 일관성을 유지하도록 합니다.

4. 결과: 즉각적이고 표현력이 풍부함

최종 시스템은 다음과 같이 작동합니다:

  1. 입력: 당신은 한 명의 인물 사진(원본, Source)을 제공합니다.
  2. 즉각적인 변환: 시스템은 그 사진을 즉시 3D "스프레이 페인트" 아바타로 변환합니다. 이 작업은 약 20밀리초가 걸립니다.
  3. 애니메이션: 다른 사람이 말하는 영상(드라이버, Driver)을 제공합니다. 시스템은 드라이버의 표정을 읽고 원본 아바타의 점들 안에 있는 "설명서"를 즉시 업데이트합니다.
  4. 출력: 당신은 원본 인물이 드라이버의 표정을 따라 하는 영상을 얻게 되며, 원하는 어떤 각도에서든 볼 수 있습니다.

성능:

  • 속도: 100 FPS(초당 프레임 수) 이상의 속도로 실행됩니다. 이는 매끄럽고 끊김 없는 비디오 콜을 하기에 충분한 속도입니다.
  • 품질: 다른 빠른 방식들이 놓치는 코의 주름이나 눈의 움직임 같은 디테일을 포착합니다.
  • 일관성: 아바타가 고개를 돌려도 얼굴이 견고하게 유지되며 깨지지 않습니다.

요약하자면, 저자들은 실시간 3D 인형술사 역할을 하는 시스템을 구축했습니다. 이 시스템은 단 한 장의 사진을 가져와 이를 수백만 개의 지능적인 점들로 이루어진 3D 캐릭터로 바꾸고, 비디오 게임의 속도와 고성능 영화의 디테일을 결합하여, 긴 컴퓨터 처리 시간 없이도 그 캐릭터의 얼굴을 제어할 수 있게 해줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →