← 최신 논문
💻 computer science

MoCoTalk: Multi-Conditional Diffusion with Adaptive Router for Controllable Talking Head Generation

MoCoTalk는 적응형 다중 조건 라우터와 특수한 구강 증강 쉐이딩 메쉬를 통해 정체성, 포즈, 표정, 오디오 단서를 통합하여 간섭을 해결하고 오디오 - 시각 정합성을 향상시킴으로써 최첨단 제어 가능한 토킹 헤드 생성을 달성하는 새로운 다중 조건 비디오 확산 프레임워크입니다.

원저자: Xinyan Ye, Jiankang Deng, Abbas Edalat

게시일 2026-05-12
📖 3 분 읽기☕ 가벼운 읽기

원저자: Xinyan Ye, Jiankang Deng, Abbas Edalat

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

한 사람이 말하는 동영상을 만들고 싶지만, 그 사람에 대한 정지된 사진 한 장만 있다고 상상해 보세요. 그 사진이 살아 움직여 고개를 돌리고, 표정을 바꾸며, 특정 음성 녹음에 맞춰 입술을 움직이길 원합니다. 이것이 바로 '말하는 얼굴 생성 (talking head generation)'의 과제입니다.

이 논문은 MoCoTalk이라는 새로운 시스템을 소개합니다. 이는 마리오네트 인형극의 마스터 퍼펫티어처럼 작동하지만, 실 대신 정교한 '믹싱 보드'를 사용하여 애니메이션을 제어합니다.

다음은 이를 간단한 개념으로 분해한 작동 원리입니다:

1. 문제: 너무 많은 입력, 혼란스러운 뇌

이전 방법들은 하나의 레시피만 가진 요리사처럼 작동했습니다. 사람이 말하게 하고 싶다면 그걸 할 수 있었고, 고개를 돌리게 하고 싶다면 그걸 할 수 있었습니다. 하지만 원래 사진과 정확히 동일한 얼굴을 유지하면서 동시에 두 가지 작업을 원한다면, 구식 시스템들은 혼란에 빠졌습니다. 그들은 "고개 움직임 50% 와 입술 움직임 50%"와 같은 '고정된 레시피'를 사용하여 지시사항들을 섞으려 했습니다. 그 결과, 얼굴이 왜곡되거나 입술이 소리와 맞지 않는 어수선하고 부자연스러운 동영상이 만들어지곤 했습니다.

2. 해결책: '적응형 라우터' (지휘자)

MoCoTalk 은 네 가지 유형의 지시사항을 동시에 받아들임으로써 이 문제를 해결합니다:

  1. 참조 사진: 사람이 본래의 모습으로 보이게 유지합니다.
  2. 얼굴 키포인트: 눈, 코, 눈썹이 움직여야 할 위치 (고개 자세와 표정) 를 시스템에 알려줍니다.
  3. 3D 쉐이딩 메쉬: 조명과 전체적인 형태를 처리하기 위한 얼굴의 3D 모델입니다.
  4. 오디오: 입술 움직임을 구동하는 음성 녹음입니다.

이 네 가지를 맹목적으로 섞는 대신, MoCoTalk 은 **Adaptive Multi-Condition Router (적응형 다중 조건 라우터)**라는 특수 구성 요소를 사용합니다. 이는 오케스트라의 지휘자와 같습니다.

  • 일반적인 오케스트라에서는 모든 악기가 항상 같은 볼륨으로 연주합니다.
  • MoCoTalk 에서 지휘자는 생성 중인 비디오 (음악) 와 악보 (네 가지 입력) 를 듣습니다.
  • 오디오가 "입을 크게 열어라"라고 말하면, 지휘자는 그 순간 오디오 악기의 볼륨을 높이고 고개 움직임 악기의 볼륨을 낮춥니다.
  • 비디오가 미묘한 미소가 필요하면, 지휘자는 키포인트 신호를 증폭시킵니다.

이 '지휘'는 프레임 단위로 즉각적으로 이루어져, 올바른 지시사항이 올바른 시간에 주도권을 잡도록 보장하며 신호들이 서로 충돌하는 것을 방지합니다.

3. '입술 강화 메쉬' (흐릿한 입술 수정)

말하는 얼굴을 애니메이션화할 때 가장 어려운 부분 중 하나는 입술입니다. 이전 도구에서 사용된 표준 3D 모델들은 얼굴의 형태를 포착하는 데는 뛰어나지만, 입술에 대해서는 종종 '게으름'을 보입니다. 입술을 흐릿하게 섞어 마치 사람이 명확하게 말하는 것이 아니라 껌을 씹는 것처럼 보이게 만드는 경향이 있습니다.

MoCoTalk 은 **Mouth-Augmented Mesh (입술 강화 메쉬)**를 도입합니다.

  • 표준 점토 조각상 (좋은 머리 모양은 있지만 입술은 흐릿함) 을 상상해 보세요.
  • 이제 오직 입과 입술만 보는 고해상도 전문 스캐너를 상상해 보세요.
  • MoCoTalk 은 점토 조각상을 가져와 스캐너에서 얻은 고해상도 입술 데이터로 **패치 (patch in)**합니다.
  • 그 결과, 원래 사람의 완벽한 머리 모양을 가지면서도 말과 완벽하게 일치하는 날카롭고 사실적인 입술 움직임을 가진 3D 모델이 탄생합니다.

4. '입술 일관성 손실 (Lip Consistency Loss)' (입모음 확인)

입술 움직임이 실제로 소리와 일치하는지 확인하기 위해 시스템은 '입술 일관성 손실 (Lip Consistency Loss)'을 사용합니다.

  • 이는 입모음을 읽는 엄격한 교사와 같습니다.
  • AI 가 동영상을 생성하는 동안, 이 교사는 생성된 입술과 오디오를 봅니다.
  • 입술 모양이 그 특정 소리에 속한 것처럼 보이지 않으면, 교사는 AI 에게 '엄지손가락 아래로 (불합격)'를 주어 벌점을 부과하고, 입술과 소리가 완벽하게 동기화될 때까지 다시 시도하도록 강요합니다.

5. 결과: 유연하고 고품질의 비디오

이 논문은 이 '지휘자'와 '패치된 입술'을 사용하여 MoCoTalk 이 다음과 같은 동영상을 생성한다고 주장합니다:

  • 더 사실적: 얼굴은 원래 사진처럼 보이며 움직임은 매끄럽습니다.
  • 더 완벽한 동기화: 입술이 목소리와 완벽하게 타이밍을 맞춰 움직입니다.
  • 제어 가능: 섞고 맞출 수 있습니다. 예를 들어, 한 비디오의 고개 움직임, 다른 비디오의 목소리, 그리고 사진의 얼굴을 가져와 시스템이 환상을 깨뜨리지 않고 이를 자연스럽게 혼합할 수 있습니다.

간단히 말해, MoCoTalk 은 매 순간 어떤 지시사항을 들어야 할지 정확히 아는 지능형 시스템을 사용하여 정지된 사진에 생명을 불어넣는 새로운 방법입니다. 이를 통해 최종 비디오는 자연스럽고, 동기화되며, 원래 인물과 일치하도록 보장됩니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →