← 최신 논문
💻 computer science

Talking Together: Synthesizing Co-Located 3D Conversations from Audio

본 논문은 200 만 건 이상의 대화 쌍으로 구성된 대규모 데이터셋을 기반으로 동적 공간 관계와 상호 시선을 모델링하여 혼합 오디오로부터 두 명의 동시 위치 참가자를 위한 사실적이고 공간 인식을 갖춘 3D 얼굴 애니메이션을 생성하는 새로운 듀얼 스트림 시스템을 제시합니다.

원저자: Mengyi Shan, Shouchieh Chang, Ziqian Bai, Shichen Liu, Yinda Zhang, Luchuan Song, Rohit Pandey, Sean Fanello, Zeng Huang

게시일 2026-03-10
📖 3 분 읽기☕ 가벼운 읽기

원저자: Mengyi Shan, Shouchieh Chang, Ziqian Bai, Shichen Liu, Yinda Zhang, Luchuan Song, Rohit Pandey, Sean Fanello, Zeng Huang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

두 친구 사이의 실제 대화를 재현하려고 한다고 상상해 보세요. 하지만 두 사람의 목소리가 하나의 오디오 파일에 섞여 녹음된 것만 가지고 있습니다. 대부분의 현재 기술은 화상 통화 중 연결이 끊긴 것처럼, 두 개의 분리된 "말하는 머리"가 공허한 공간에 떠다니며 정면을 응시하고 서로를 완전히 무시하는 모습입니다. 그들은 말은 하고 있을지 몰라도, 상호작용은 하지 않습니다.

이 논문은 이를 해결하는 새로운 시스템인 **"함께 대화하기 (Talking Together)"**를 소개합니다. 이 시스템은 그 단일의 섞인 오디오 녹음 파일을 받아, 두 사람이 서로 마주 보고 눈을 맞추고 고개를 끄덕이며 자연스럽게 반응하는 완전하고 사실적인 3D 장면을 생성합니다.

다음은 이를 단순한 개념으로 나누어 설명한 방법입니다:

1. "이중 스트림" 주방

시스템을 나란히 일하는 두 명의 셰프가 있는 주방이라고 상상해 보세요.

  • 문제: 보통 셰프에게 섞인 한 냄비 수프 (오디오) 를 주면, 어떤 재료가 어떤 요리에 속하는지 구별할 수 없습니다.
  • 해결책: 이 시스템은 **이중 스트림 아키텍처 (Dual-Stream Architecture)**를 사용합니다. 같은 주방에서 일하는 두 명의 셰프 (A 를 위한 셰프와 B 를 위한 셰프) 를 상상해 보세요. 그들은 특별한 "교차 대화" 시스템을 갖추고 있습니다. 셰프 A 가 요리를 하는 동안, 셰프 B 가 무엇을 하고 있는지 엿보아 멈추거나, 고개를 끄덕이거나, 놀란 표정을 지어야 할지 확인할 수 있습니다. 이를 통해 시스템이 두 사람이 동시에 말하고 있을 때조차 누가 말하고 누가 듣고 있는지 파악할 수 있게 됩니다.

2. "역할 연기" 배지

셰프들이 누가 무엇을 하는지 알 수 있도록 시스템은 그들에게 디지털 배지를 줍니다.

  • 화자 vs. 청자: 시스템은 오디오를 분석하여 누가 말하고 누가 듣고 있는지 추측합니다. 그런 다음 "화자"에게는 "당신은 말하고 있으니 입술을 움직여!"라는 배지를, "청자"에게는 "당신은 듣고 있으니 고개를 끄덕이고 눈을 맞추세요!"라는 배지를 줍니다.
  • 마법: 오디오가 지저분하거나 두 사람이 동시에 말하더라도, 이 배지들은 두 캐릭터의 애니메이션을 구별 가능하고 사실적으로 유지하는 데 도움을 줍니다.

3. "눈 맞춤" 코치

실제 대화에서 가장 어려운 부분 중 하나는 상대방을 바라보는 것입니다. 기존 방법들은 종종 캐릭터들이 카메라를 멍하니 응시하게 만들었습니다.

  • 수정: 연구자들은 특별한 "시선 손실 (Eye Gaze Loss)"을 추가했습니다. 이를 애니메이션 위를 서성이며 매 프레임을 점검하는 엄격한 코치라고 생각하세요. 캐릭터들이 해야 할 때 서로를 바라보지 않으면, 코치는 그들에게 "페널티"를 줍니다. 이는 AI 가 상호 눈 맞춤과 자연스러운 시선 이동을 하는 미묘한 기술을 배우도록 강제하여, 대화가 살아있는 느낌을 갖게 합니다.

4. "텍스트에서 장면으로" 감독

과거에는 컴퓨터에게 사람들이 어디에 서야 하는지 지시할 수 없었습니다. 그들은 무작위 위치에 나타났을 뿐입니다.

  • 혁신: 이 시스템은 "그들은 테이블 너머로 다투고 있다"거나 "그들은 친밀하게 속삭이고 있다"와 같은 간단한 지시를 입력할 수 있게 합니다.
  • 작동 원리: 시스템은 (지능형 비서와 같은) 대규모 언어 모델을 사용하여 텍스트를 3D 좌표로 변환합니다. 애니메이션이 시작되기 전에 연기자들에게 "좋아, 너는 여기에 서고 너는 저기에 서"라고 지시하는 감독처럼 작동합니다.

5. "데이터 다이어트"

AI 모델은 운동선수와 같습니다. 강해지기 위해서는 많은 데이터를 섭취해야 합니다. 문제는 같은 방에서 대화하는 두 사람의 고품질 비디오가 충분하지 않았다는 것입니다.

  • 풍요로운 식사: 팀은 그들의 AI 를 위한 거대한 다이어트를 만들었습니다:
    1. "야생" 뷔페: 실제 사람들이 야생에서 어떻게 상호작용하는지 학습하기 위해 200 만 개 이상의 실제 대화 비디오 클립을 스크랩했습니다.
    2. "무균" 보충제: 또한, 깨끗하고 고품질의 단일 인물 비디오를 가져와 인위적으로 섞어 합성 데이터셋을 만들었습니다. 이는 실제 세계 비디오의 흐림과 노이즈 없이 완벽한 립싱크 (입술 움직임과 단어 매칭) 를 AI 에게 가르쳤습니다.
  • 결과: 둘 다로 훈련함으로써 AI 는 야생 비디오에서 사회적 지능을, 깨끗한 비디오에서 기술적 정밀함을 모두 학습하게 되었습니다.

결론

결과는 두 사람을 단순히 말하게 하는 것이 아니라, 그들을 대화하게 하는 시스템입니다. 이는 실제 대화의 "춤"을 포착합니다: 고개 기울임, 눈 맞춤, 공유된 공간, 그리고 상대방의 말에 대한 반응입니다. 이는 하나의 오디오 파일에서 생성된 모든 것을 "화상 회의" 느낌에서 "실제 회의" 느낌으로 이동시킵니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →