← 최신 논문
⚡ electrical engineering

Talker-T2AV: Joint Talking Audio-Video Generation with Autoregressive Diffusion Modeling

Talker-T2AV는 고수준의 의미 정보는 공유된 백본에서 공동으로 모델링하고 저수준의 세부 정보는 각 모달리티별 디코더로 처리하는 자기회귀 확산 모델(Autoregressive Diffusion Model)을 통해, 오디오와 비디오 간의 결합력을 높이면서도 효율적인 통합 생성(Joint Generation)을 구현한 연구입니다.

원저자: Zhen Ye, Xu Tan, Aoxiong Yin, Hongzhan Lin, Guangyan Zhang, Peiwen Sun, Yiming Li, Chi-Min Chan, Wei Ye, Shikun Zhang, Wei Xue

게시일 2026-04-28
📖 2 분 읽기☕ 가벼운 읽기

원저자: Zhen Ye, Xu Tan, Aoxiong Yin, Hongzhan Lin, Guangyan Zhang, Peiwen Sun, Yiming Li, Chi-Min Chan, Wei Ye, Shikun Zhang, Wei Xue

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

1. 기존 기술의 문제점: "따로 노는 연주자들" 🎻🎺

기존의 AI 방식은 크게 두 가지 문제가 있었습니다.

  • 첫 번째 문제 (너무 끈적한 관계): 기존 방식은 목소리를 만들 때와 입 모양을 만들 때, 두 정보를 너무 촘촘하게 섞어버렸습니다. 마치 바이올린 연주자와 트럼펫 연주자가 서로의 악보를 너무 심하게 공유해서, 바이올린 소리를 내야 할 때 트럼펫 소리가 섞여 나오는 것과 같았습니다. 결과적으로 소리도 이상해지고 영상도 어색해졌죠.
  • 두 번째 문제 (정해진 시간만 연주 가능): 기존 AI는 연주 시간이 딱 정해져 있었습니다. 5초짜리 곡을 연주하도록 세팅되어 있는데, 갑자기 10초짜리 긴 문장이 들어오면 AI는 당황해서 말을 중간에 끊거나 아주 빠르게 말해버리는 실수를 했습니다.

2. Talker-T2AV의 해결책: "천재 지휘자와 전문 연주자" 🎼

이 논문에서 제안한 Talker-T2AV는 역할을 아주 똑똑하게 나누었습니다.

Step 1: 천재 지휘자 (Autoregressive Backbone)

먼저, 아주 똑똑한 **'지휘자 AI'**가 등장합니다. 이 지휘자는 악기를 직접 연주하지는 않지만, 전체적인 흐름을 완벽하게 파악합니다.

  • "자, 이제 이런 내용의 말을 할 거야. 목소리는 이런 느낌으로, 입 모양은 이 타이밍에 움직여야 해!"라고 **전체적인 계획(High-level plan)**을 세웁니다.
  • 지휘자는 문장이 길어지면 그만큼 더 오래 지휘를 할 수 있어서, 말이 끊기지 않고 자연스럽게 이어집니다.

Step 2: 전문 연주자 (Modality-Specific Diffusion Heads)

지휘자의 신호가 떨어지면, 이제 각 분야의 **'전문 연주자'**들이 나섭니다.

  • 목소리 연주자: 지휘자의 신호를 받아 아주 깨끗하고 자연스러운 목소리(오디오)만 전문적으로 만들어냅니다.
  • 영상 연주자: 똑같은 지휘자의 신호를 받지만, 오직 입 모양과 얼굴 근육의 움직임(비디오)만 전문적으로 그려냅니다.

두 연주자는 서로의 영역을 침범하지 않으면서도, 지휘자라는 공통의 기준을 따르기 때문에 목소리와 입 모양이 마치 한 몸처럼 완벽하게 맞아떨어집니다(Lip-sync).

3. 이 기술이 왜 대단한가요? (3-in-1 만능 모델) 🌟

이 모델의 가장 놀라운 점은 **'하나의 모델로 세 가지 일을 다 할 수 있다'**는 것입니다.

  1. 텍스트 → 영상+소리: 글자만 입력하면 말하는 영상과 소리를 동시에 만듭니다. (영화 제작)
  2. 소리 → 영상: 이미 있는 목소리를 주면, 그 목소리에 딱 맞는 입 모양 영상을 만듭니다. (더빙/애니메이션)
  3. 영상 → 소리: 소리 없는 영상에 글자를 넣으면, 영상 속 인물의 입 모양에 맞춰 자연스러운 목소리를 입혀줍니다. (영상 더빙)

요약하자면! 📝

Talker-T2AV는 **"지휘자(전체 흐름 계획)와 전문 연주자(소리/영상 각각의 디테일)를 분리"**함으로써, 기존 AI보다 훨씬 더 말이 자연스럽고, 입 모양이 정확하며, 긴 문장도 막힘없이 만들어내는 똑똑한 AI 시스템입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →