← 최신 논문
💻 computer science

CapTalk: Text-Guided Stylization and Speech-Driven 3D Head Animation

CapTalk는 구동 오디오와 함께 대규모 텍스트 설명 데이터셋을 활용하여 말하기 스타일과 감정 표현을 각각 동적으로 제어할 수 있는 실시간 동기화 3D 헤드 애니메이션을 가능하게 하는 새로운 텍스트 기반 프레임워크입니다.

원저자: Xuangeng Chu, Yuan Gan, Ziteng Cui, Shuhong Liu, Jian Wang, Bing Zhou, Tatsuya Harada

게시일 2026-05-29
📖 3 분 읽기☕ 가벼운 읽기

원저자: Xuangeng Chu, Yuan Gan, Ziteng Cui, Shuhong Liu, Jian Wang, Bing Zhou, Tatsuya Harada

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

디지털 인형, 즉 말할 수 있는 3D 머리를 상상해 보세요. 보통 오디오(예: 누군가의 말소리 녹음) 를 입력하면 이 인형은 입 모양만 모방합니다. 입술만 움직이는 복화술사의 인형과 같은 것이죠. 인형이 행복하거나 화난 표정을 짓거나 특정 방식으로 고개를 끄덕이게 하려면, 보통 해당 동작을 수동으로 프로그래밍하거나 먼저 실제 사람이 그렇게 하는 동영상을 입력해야 합니다.

CapTalk은 게임의 규칙을 바꾸는 새로운 시스템입니다. 오디오만 듣는 것이 아니라, 사용자가 입력한 텍스트 지시문도 듣습니다. 배우에게 지시를 내리는 감독처럼 생각하면 됩니다. 디지털 머리에 "이 문장을 말하되, 긴장감 있고 빠른 템포의 스타일로, 행복한 표정을 지으며 말해"라고 하거나, "천천히 말하되 진지한 어조와 큰 고개 끄덕임으로 말해"라고 지시할 수 있습니다.

간단한 비유를 들어 작동 원리를 살펴보면 다음과 같습니다:

1. 문제: "일률적" 인형

기존 방법들은 음악상자와 같았습니다. 노래 (오디오) 를 넣으면 매번 똑같은 곡 (표정 움직임) 이 재생되었습니다. 다른 "스타일"을 원한다면 전체 음악상자 메커니즘을 교체하거나, 이미 그렇게 움직이는 사람의 특정 녹음본을 찾아야 했습니다. 이로 인해 고유한 캐릭터를 만들거나 대화의 분위기를 즉석에서 바꾸기 어려웠습니다.

2. 해결책: 새로운 "대본"과 새로운 "도서관"

연구자들은 이 문제를 해결하기 위해 두 가지 주요 요소를 개발했습니다:

  • 새로운 도서관 (데이터셋): 그들은 유튜브에서 200 시간 분량의 동영상으로 구성된 방대한 컬렉션을 만들었습니다. 하지만 동영상을 단순히 저장한 것이 아니라, 스마트한 AI 도구를 활용해 모든 클립에 대한 "대본"을 작성했습니다.

    • 한 AI 는 오디오를 들어 감정을 추측했습니다 (예: "이 사람은 화난 것일까, 행복한 것일까?").
    • 또 다른 AI 는 동영상을 지켜보며 물리적 스타일을 설명했습니다 (예: "입이 크게 벌어지는가? 고개를 많이 끄덕이는가?").
    • 이로 인해 모든 움직임이 감정과 스타일 설명으로 태그된 거대한 도서관이 탄생했습니다.
  • 새로운 감독 (모델): CapTalk이라는 모델을 구축하여 번역기 역할을 하게 했습니다. 이 모델은 세 가지 요소를 입력받습니다:

    1. 오디오: 무엇을 말하는지.
    2. 스타일 캡션: 어떻게 말해야 하는지에 대한 텍스트 설명 (예: "미세한 고개 움직임", "넓게 벌어진 입").
    3. 감정 캡션: 감정에 대한 텍스트 설명 (예: "중립", "흥분").

3. 작동 원리: "시간 창" 퍼즐

긴 연속된 만화 애니메이션을 그려보라고 상상해 보세요. 한 번에 전체를 그리려 하면 지저분해집니다. CapTalk 은 애니메이션을 작은 "시간 창"(4 초 정도의 짧은 클립) 으로 나눕니다.

  • 코덱 (축소 광선): 먼저 시스템은 얼굴의 복잡한 3D 움직임을 단순한 코드로 압축합니다. 고화질 영화를 디지털 지시문 (0 과 1) 집합으로 변환하는 것과 같습니다.
  • 자기회귀 생성기 (이야기꾼): 그런 다음 모델은 이전 지시문, 오디오, 그리고 사용자의 텍스트 메모를 바탕으로 다음 지시문 세트를 예측합니다. 줄거리 (오디오) 와 캐릭터의 성격 (사용자의 텍스트 메모) 을 아는 이야기꾼이 다음 몇 줄의 이야기 (표정 움직임) 를 완벽하게 즉흥적으로 만들어내는 것과 같습니다.
  • 텍스트의 마법: 오디오는 그대로 두면서 텍스트 메모를 "긴장된"에서 "자신감 있는"으로 변경하면, 모델은 문장 중간에도 즉시 고개 움직임과 입 모양을 새로운 지시에 맞게 변경합니다.

4. 결과: 더 나은 성능

연구자들은 CapTalk 을 다른 방법들과 비교 테스트한 결과 다음과 같은 점을 발견했습니다:

  • 더 나은 립싱크: 입이 단어와 완벽하게 맞춰 움직입니다.
  • 더 나은 스타일 제어: "큰 고개 움직임"을 요청하면 실제로 고개가 많이 움직입니다. "미세한" 움직임을 요청하면 가만히 있습니다.
  • 현실감: 사람들이 동영상을 시청하는 테스트에서 CapTalk 을 다른 방법들보다 선호했는데, 움직임이 더 자연스럽고 지시문에 더 잘 부합했기 때문입니다.

요약

CapTalk 은 디지털 배우에게 대본뿐만 아니라 무대 지시문도 포함된 대본을 주는 것과 같습니다. "극적이고 눈이 커지는 스타일로 말해"라고 입력하면, 3D 머리는 오디오와 완벽하게 동기화되어 즉시 그 특정 스타일을 수행합니다. 이는 경직된 사전 프로그래밍 애니메이션에서 유연하고 텍스트로 안내되는 공연으로의 전환을 의미합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →