Wan-Streamer v0.1: End-to-end Real-time Interactive Foundation Models
Wan-Streamer는 단일 트랜스포머 내에서 언어, 오디오, 비디오 처리를 통합하여 약 200ms의 모델 측 지연 시간을 가진 초 단위 미만의 전이중 멀티모달 통신을 달성함으로써, 기존의 계단식 시스템에 내재된 오류 누적과 지연을 제거하는 네이티브 스트리밍 방식의 엔드 투 엔드 대화형 파운데이션 모델입니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
친구와 대화를 나누고 있다고 상상해 보세요. 당신은 친구의 문장이 완전히 끝날 때까지 기다렸다가, 잠시 생각을 한 뒤에 말을 시작하지 않습니다. 대신, 친구가 말하는 동안 경청하고, 고개를 끄덕이고, 눈을 맞추며, "잠깐, 정말?"이라거나 웃음과 함께 말을 가로채기도 합니다. 그리고 친구가 여전히 말하고 있는 동안에도 당신은 이미 답변을 구상하기 시작합니다. 이것이 바로 풀 듀플렉스(full-duplex) 상호작용입니다. 모든 일이 동시에 일어나며, 서로 겹치고 자연스럽게 흘러가는 것이죠.
오랫동안 컴퓨터는 이런 방식에 매우 서툴렀습니다. 컴퓨터는 보통 다음과 같이 별도의 주자들이 달리는 이어달리기 방식으로 작동합니다:
- 주자 A가 당신의 목소리를 듣고 이를 텍_트로 변환합니다 (음성-텍스트 변환).
- 주자 B가 그 텍스트를 읽고 답변을 생각합니다 (두뇌).
- 주자 C가 그 답변을 다시 음성으로 바꿉니다 (텍스트-음성 변환).
- 주자 D가 그 음성을 가져가서 단어에 맞춰 얼굴을 움직이게 합니다 (비디오 생성).
답변이 당신의 귀에 도달할 때쯤이면 이미 많은 지연 시간이 발생하며, "주자"들이 서로 충분히 빠르게 소통하지 못하기 때문에 컴퓨터는 당신의 표정을 놓치거나 어색하게 말을 끊기도 합니다.
Wan-Streamer는 이어달리기 팀이 아니라 하나의 초고속 인간이 되고자 하는 새로운 종류의 AI입니다. 이 기술이 어떻게 작동하는지 쉬운 비유를 통해 설명해 드리겠습니다.
1. "1인 밴드" vs "오케스트라"
현재 대부분의 시스템은 바이올린 연주자, 드러머, 가수가 서로 다른 방에 있는 오케스트라와 같습니다. 그들은 자신의 파트를 시작하기 위해 신호를 기다려야 합니다. 만약 드러머가 느리다면 전체 노래가 늘어지게 됩니다.
Wan-Streamer는 기타를 치고, 노래를 부르고, 박자를 맞추는 일을 동시에 수행하는 1인 밴드와 같습니다. 이 모델은 듣기, 생각하기, 말하기, 또는 얼굴 움직임을 위한 별도의 모듈을 가지고 있지 않습니다. 이는 하나의 거대한 "두뇌"(Transformer 모델)로서, 당신의 비디오를 보고, 목소리를 듣고, 텍스트를 동시에 읽으며, 즉각적으로 무엇을 말할지, 어떤 소리를 낼지, 그리고 얼굴을 어떻게 움직일지를 동시에 결정합니다.
2. "생각하는 자"와 "수행하는 자"
이 과정을 믿을 수 없을 정도로 빠르게 만들기 위해, 제작자들은 지휘자와 연주자처럼 완벽하게 조화를 이루는 두 가지 역할로 작업을 나누었습니다:
- 생각하는 자 (The Thinker): 이 부분은 당신의 말을 듣고, 이해하고, 답변을 계획합니다. 마치 다음 음표를 결정하는 지휘자와 같습니다.
- 수행하는 자 (The Performer): 이 부분은 계획을 전달받아 실제로 소리와 영상을 만들어냅니다. 마치 악기를 연주하는 연주자와 같습니다.
여기에는 마법 같은 기술이 있습니다. 수행하는 자가 현재의 답변을 위한 영상과 오디오를 만드는 동안, 생각하는 자는 이미 당신의 다음 문장을 듣고 있으며 다음 답변을 계획하고 있습니다. 이들은 바톤을 매우 빠르게 주고받으며, 대화 중에 멈춤 현상이 발생하지 않도록 합니다. 이를 통해 시스템은 끊김 없이 실시간 대화를 유지할 수 있습니다.
3. "라이브 스트리밍" vs "편집된 영화"
기존의 AI 비디오 시스템은 영화를 편집하는 것과 같습니다. 장면 전체가 촬영될 때까지 기다렸다가 나중에 편집합니다. 만약 대사 하나를 바꾸고 싶다면, 전체를 다시 편집해야 합니다.
Wan-Streamer는 라이브 뉴스 방송과 같습니다. 발생하는 상황에 맞춰 프레임 단위로 비디오를 생성합니다.
- 당신이 말을 멈추면, AI는 멈춰버리는 것이 아니라, 실제 사람처럼 당신이 계속 말하기를 기다리며 "숨을 쉬고", 눈을 깜빡이며, 당신을 바라봅니다.
- 만약 당신이 AI의 말을 가로막으면, AI는 "고정된 상태"로 문장을 끝까지 마치는 것이 아니라 즉시 멈추고 당신의 말을 듣습니다.
- 또한 당신의 표정에 즉각 반응합니다. 당신이 혼란스러워 보이면, AI는 같은 순간 내에 속도를 늦추거나 스스로를 설명할 수 있습니다.
4. 얼마나 빠른가요?
이 논문은 이 시스템이 믿기 힘들 정도로 빠르다고 주장합니다:
- AI의 "두뇌" 시간: AI가 당신의 말을 듣고, 생각하고, 답변 생성을 시작하는 데 걸리는 시간은 약 200밀리초(0.2초)입니다. 이는 인간이 눈을 한 번 깜빡이는 것보다 빠릅니다.
- 전체 대화 시간: 인터넷을 통해 신호를 주고받는 시간(약 350ms)을 더하면, 총 지연 시간은 약 550밀리초(0.55초)입니다.
이것을 체감해 보자면: 만약 당신이 0.5초의 지연 시간이 있는 화상 통화로 친구와 대화하고 있다면, 당신은 거의 그것을 느끼지 못할 것입니다. 당신은 친구의 말을 끊을 수도 있고, 친구도 자연스럽게 반응할 것입니다.
무엇이 특별한가?
이 논문은 Wan-Streamer가 단순히 여러 도구를 "이어 붙인" 것이 아니라는 점을 강조합니다. 이 모델은 처음부터 듣고, 말하고, 얼굴을 움직이는 법을 동시에 학습했습니다.
- "텍스트 중간 매개체"가 없음: 당신의 목소리를 텍스트로 변환했다가 다시 목소리로 바꾸는 과정을 거치지 않습니다. 소리와 영상을 직접 이해합니다.
- 자연스러운 리듬: 사람들이 서로 말을 가로채며 대화하는 실제 대화 패턴을 학습했기 때문에, 언제 멈춰야 할지, 언제 고개를 끄덕여야 할지, 언제 끼어들어야 할지를 알고 있습니다. 따라서 로봇 같거나 딱딱하지 않습니다.
요점
Wan-Streamer는 당신과 실시간으로 얼굴을 마주 보며 대화할 수 있는 디지털 휴먼의 프로토타입입니다. 이 AI는 단순히 질문에 답하는 것이 아닙니다. 당신을 관찰하고, 당신의 말을 경청하며, 어색한 멈춤 없이 대화를 이어가면서 살아있는 듯한 얼굴과 목소리로 당신에게 반응합니다. 이는 AI가 단순한 컴퓨터 프로그램이 아니라, 테이블 맞은편에 앉아 있는 사람처럼 느껴지게 만드는 단계로 나아가는 길입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.