← 최신 논문
💻 computer science

Conversational Human Audio-visual Talking Dialogue Generation

이 논문은 대규모 언어 모델과 토킹 페이스(talking face) 모델을 통합함으로써 단일 텍스트 프롬프트로부터 다양하고 정렬된 2인 대화 오디오-비주얼 클립을 생성하는 새로운 프레임워크인 CHAT을 소개하며, 이는 비용이 많이 드는 실제 데이터 수집에 대한 확장 가능하고 윤리적으로 건전한 대안을 제공하는 동시에 다운스트림 태스크에 대한 우수한 성능과 유용성을 입증한다.

원저자: Junhao Song, Lluis Guasch, Xilin He, Zhongyu Yang, Yingfang Yuan, Weicheng Xie, Linlin Shen, Haijun Lin, Shizhe Liu, Wei Pang, Siyang Song

게시일 2026-07-07
📖 3 분 읽기☕ 가벼운 읽기

원저자: Junhao Song, Lluis Guasch, Xilin He, Zhongyu Yang, Yingfang Yuan, Weicheng Xie, Linlin Shen, Haijun Lin, Shizhe Liu, Wei Pang, Siyang Song

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

두 사람이 활기찬 대화를 나누는 영화 장면을 만든다고 상상해 보십시오. 보통 이를 제대로 구현하려면 배우를 고용하고, 카메라를 설치하고, 오디오를 녹음하고, 입 모양이 말과 일치하고 얼굴 표정이 분위기에 맞는지 확인하기 위해 몇 시간 동안 편집하는 과정을 거쳐야 합니다. 이는 비용이 많이 들고 시간이 오래 걸리며, 때로는 개인정보 보호 문제도 일으킵니다.

이 논문은 마치 "마법의 작가이자 감독" 역할을 하는 CHAT이라는 새로운 AI 도구를 소개합니다. 배우를 고용하는 대신, 단순히 시나리오를 설명하는 한 문장(예: "AI에 대해 토론하는 두 친구")을 입력하기만 하면 CHAT이 전체 비디오 클립을 만들어 줍니다.

작동 방식은 다음과 같이 간단한 단계로 나뉩니다.

1. 작가 (텍스트 대화 생성)

먼저, AI는 창의적인 작가 역할을 합니다. 사용자가 프롬프트를 제공하면, AI는 두 캐릭터 사이의 전체 대화를 만들어 냅니다. 단순히 글자만 쓰는 것이 아니라, 이들이 누구인지(예: "사려 깊은 신사"와 "활기찬 여성")를 설정하고, 그들이 어떤 감정을 느껴야 하는지(행복함, 진지함, 흥분됨)도 결정합니다.

2. 성우 및 감독 (오디오 정교화)

다음으로, AI는 그 텍스트를 음성으로 변환합니다. 하지만 단순히 단어를 로봇처럼 읽는 것이 아닙니다. AI는 여기에 "인간적인 손길"을 더합니다:

  • 감정: 맥락에 따라 목소리가 행복하거나, 슬프거나, 화난 것처럼 들리도록 만듭니다.
  • 사실감: 현실 세계에서는 누군가 말을 할 때, 상대방이 듣고 있다는 것을 보여주기 위해 "음", "어허", "오!"와 같은 작은 소리를 내기도 합니다. 이 AI는 이러한 작은 소리들을 자동으로 추가하여, 대화가 단순히 대본을 차례대로 읽는 것이 아니라 실제 주고받는 느낌이 들도록 만듭니다.

3. 애니메이터 (얼굴 행동 생성)

마지막으로, AI는 캐릭터들에게 시각적인 생명력을 불어넣습니다. 이 부분은 가장 복잡하며, 영리한 "2단계 댄스"를 사용합니다:

  • 단계 A (기초): 먼저 캐릭터의 입이 말하는 단어에 맞춰 움직이게 합니다.
  • 단계 B (반응): 여기서 마법이 일어납니다. AI는 상대방이 무엇을 하고 무엇을 말하는지를 살핍니다. 만약 A가 농담을 던지고 있다면, AI는 A가 말하는 동안 B가 미소를 짓거나 웃게 만듭니다. 만약 A가 슬퍼한다면, B는 걱정스러운 표정을 짓습니다. 이는 두 얼굴이 서로에게 실시간으로 반응하게 하여, 다른 대부분의 AI 도구가 놓치는 "상호 반응성"을 만들어냅니다.

이것이 왜 중요한가요?

저자들은 기존의 AI 도구들이 보통 다음 두 가지 중 하나를 수행한다고 설명합니다:

  1. 혼자서 말하기: 사람은 말하게 만들지만, 다른 사람에게 반응하지는 않습니다.
  2. 혼자서 반응하기: 영상에 반응하게 만들지만, 대화나 상대방의 음성을 생성하지는 못합니다.

CHAT은 독특하게도 두 사람의 대화 양쪽 모두를 동시에 생성하며, 두 사람 모두 자연스럽게 서로에게 반응하도록 만듭니다.

"50,000개 장면" 라이브러리

이것이 실제로 작동함을 증명하기 위해, 연구진은 CHAT을 사용하여 50,000개의 다양한 대화 클립(CHAT-AVD-50k 데이터셋이라 불림)으로 구성된 거대한 라이브러리를 자동으로 생성했습니다. 그들은 이것이 다른 AI 시스템을 위한 거대한 "훈련 체육관"을 만드는 것과 같다고 말합니다. 이 라이브 library를 사용하여 다른 AI 모델들을 학습시켰을 때, 그 모델들은 실제 인간의 영상으로만 학습했을 때보다 인간의 상호작용을 더 잘 이해하게 되었습니다.

한계점

논문은 이 과정이 현재 느리고 비용이 많이 든다는 점을 인정합니다. 매 클립마다 작가, 성우, 애니메이터를 동시에 실행해야 하므로 많은 컴퓨팅 파워를 필요로 합니다. 아직 노트북에서 몇 초 만에 실행할 수 있는 도구는 아니지만, 기초부터 시작하여 사실적인 상호작용적 인간 대화를 만드는 것이 가능하다는 것을 입증합니다.

요약하자면: CHAT은 단순한 아이디어를 가져와 두 사람이 자연스럽고 감정적이며 상호작적인 대화를 나누는 사실적인 비디오로 바꿔주는 시스템입니다. 이를 통해 배우를 직접 고용하지 않고도 두 명의 배우가 완벽하게 함께 연기하도록 만드는 문제를 해결합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →