Video = World + Event Stream
이 논문은 비디오를 지속적인 '세계(world)'와 동적인 '이벤트 스트림(event stream)'의 결합으로 구성하여 환경 변화와 에이전트 행동에 대한 저지연 범용 예측을 가능하게 하는 실시간 시청각 상호작용 모델인 Wan-Streamer v0.3을 소개한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 영화를 보고 있다고 상상해 보세요. 하지만 단순히 앉아서 구경만 하는 것이 아니라, 장면 속에 들어가 등장인물과 대화를 나누고, 그들도 당신에게 즉각적으로 대답하는 상황입니다. 이것이 바로 **실시간 인공지능(real-time artificial intelligence)**의 흥미로운 세계입니다. 컴퓨터가 마치 인간 친구처럼 우리를 이해하고 빠르게 반응하려고 노력하는 영역이죠. 이를 위해 AI는 세 가지를 동시에 다뤄야 합니다. 즉, 무엇을 보는지(비디오), 무엇을 듣는지(오디오), 그리고 무엇을 말하거나 행동하는지(텍스트 및 동작)입니다. 오랫동안 AI가 지연 없이 이 모든 것을 수행하게 만드는 것은 무거운 배낭을 메고 마라톤을 하는 것만큼이나 느리고 투박한 일이었습니다. 연구자들이 던진 핵심적인 질문은 이것이었습니다. 어떻게 하면 AI에게 자신이 서 있는 '무대'와 그 위에서 일어나는 '사건'을 이해하도록 가르쳐서, 자연스럽고 즉각적으로 반응하게 만들 수 있을까?
여기 Alibaba Group의 Wan 팀이 만든 새로운 창조물인 Wan-Streamer v0.3이 있습니다. 이 논문을 아주 빠르고 똑똑한 디지털 배우를 위한 영리한 레시피라고 생각해보세요. 저자들은 비디오를 변화하는 픽셀들의 거대하고 혼란스러운 덩어리로 취급하는 대신, 이를 두 가지 단순한 부분인 **월드(World, 세계)**와 **이벤트 스트림(Event Stream, 사건 흐름)**으로 나눌 수 있다는 점을 깨달았습니다. '월드'는 변하지 않는 안정적인 요소들입니다. 당신이 있는 방, 가구, 사람의 얼굴, 그리고 배경 소음 같은 것들이죠. 이는 크게 변하지 않습니다. '이벤트 스트림'은 변화하는 모든 것입니다. 사람이 걷거나, 말하거나, 손을 흔들거나, 자동차가 지나가는 것 말이죠. 비디오가 단지 '월드'와 '이벤트의 흐름'의 결합이라는 것을 이해하도록 가르침으로써, 그들은 AI가 다음에 일어날 일을 훨씬 더 똑똑하고 빠르게 예측할 수 있는 방법을 찾아냈습니다.
핵심 아이디어: 무대와 연극
이 논문은 비디오를 바라보는 새로운 관점을 제안합니다. 극장을 상상해 보세요. 월드는 무대 디자인입니다. 그려진 배경, 조명, 소품, 그리고 배우의 의상 같은 것들이죠. 연극이 시작되면 이 요소들은 대부분 그대로 유지됩니다. 이벤트 스트림은 연극 그 자체입니다. 배우가 무대를 가로질러 걷거나, 대사를 외치거나, 소품을 떨어뜨리거나, 몸을 돌리는 동작들입니다.
과거의 AI 모델들은 연극 전체와 무대 디자인 전체를 한꺼번에 학습하려고 시도했기에 어려움이 많았습니다. Wan-Streamer v0.3은 더 간단한 기술을 제안합니다. AI에게 무대 디자인을 한 번 가르쳐준 다음, 그 후에는 오직 연극에만 집중하게 만드는 것입니다.
연구진은 방대한 양의 실제 세계 비디오를 통해 모델을 학습시켰습니다. 단순히 AI에게 다음 프레임을 추측하라고 시킨 것이 아니라, '월드'(예: 햇살이 내리쬐는 교외의 거리나 닭장)를 보고 나서 '이벤트 스트림'(예: 길을 달려가는 로봇이나 닭에게 먹이를 주는 여성)을 예측하도록 가르쳤습니다. 모델은 만약 로봇이 인도 위에 있다면, 차를 향해 달려가거나, 문을 열고 운전해서 떠날 수도 있다는 패턴을 학습했습니다. 만약 여성이 닭장에 있다면, 양동이로 걸어가서 먹이를 퍼 올릴 수도 있다는 것을 배웠습니다. 이러한 패턴을 학습함으로써, AI는 사물이 어떻게 타당하게 움직이고 변하는지에 대한 '세계 지식'을 구축합니다.
마법 같은 기술: 말하기와 행동하기를 동시에
그렇다면 이것이 실제로 어떤 역할을 할까요? 팀은 이 아이디어를 실시간 전이중(full-duplex) 오디오-비주얼 상호작용 테스트에 적용했습니다. '전이중(full-duplex)'이란 당신이 말을 끝낼 때까지 기다리지 않고, 실제 대화처럼 AI가 말하기와 듣기를 동시에 할 수 있다는 뜻의 멋진 표현입니다.
이 새로운 버전(v0.3)에서 AI 에이전트는 단순히 말하는 머리에 그치지 않습니다. 이제는 **자유로운 형태의 행동(free-form behavior)**을 수행할 수 있습니다.
- 기존 방식: AI는 말하는 동안 단순히 고개를 끄덕이거나 당신을 바라볼 수 있었습니다.
- 새로운 방식: AI는 "(커피잔을 집어 들고 한 모금 마시며) 알려줘서 고마워요," 또는 "(약간 미간을 찌푸리며) 무슨 뜻인가요?"라고 말할 수 있습니다.
논문에 따르면 AI는 특별한 '역할극' 형식으로 응답을 작성합니다. 말하는 단어와 괄호 안에 적힌 행동을 혼합하는 방식이죠. AI는 '월드'(배경과 캐릭터)를 학습했기 때문에, 만약 "(컵을 집는다)"라고 말한다면 비디오 생성기가 실제로 그 장면에 어울리는 컵을 집어 드는 모습을 보여줄 것임을 알고 있습니다. 이 과정은 실시간으로 일어나며, 음성과 행동, 그리고 비디오가 모두 완벽하게 동기화됩니다.
속도: 현실처럼 느껴질 만큼 빠른 속도
이 논문에서 가장 인상적인 부분 중 하나는 이러한 새로운 지능을 구현하면서도 속도를 희생하지 않았다는 점입니다. 저자들은 Wan-Streamer v0.3이 이전 버전(v0.2)과 동일한 번개 같은 성능을 유지함을 보여줍니다.
- 비디오 품질: 여전히 640×368 해상도로 비디오를 출력합니다.
- 부드러움: 25 FPS(초당 프레임 수)로 작동하여 자연스럽게 보일 만큼 부드럽습니다.
- 속도: AI가 스스로 생각하고 응답을 생성하는 데 약 **200밀리초(ms)**가 걸립니다. 여기에 인터넷이 데이터를 주고받는 시간(350ms의 예산)을 더하면, 당신이 답변을 기다리는 총 시간은 약 550밀리초입니다.
이를 체감해 보자면, 550밀리초는 1초도 채 되지 않는 시간입니다. 이는 대화가 로딩 바를 기다리는 로봇과의 대화가 아니라, 친구와 나누는 실제 채팅처럼 느껴질 만큼 충분히 빠릅니다.
이것이 의미하는 바 (그리고 그렇지 않은 것)
이 논문은 '월드'와 '이벤트'를 분리함으로써 우리가 더 유연한 AI를 만들 수 있음을 시사합니다. AI는 어떤 종류의 비디오로도 학습될 수 있으며, 방 안을 탐색하는 로봇이나 비디오 게임 속 캐릭터처럼 다양한 작업에 특화될 수 있습니다. 저자들은 이 접근 방식이 자신들의 특정 테스트 케이스, 즉 실시간으로 말하고 행동하는 디지털 캐릭터에 효과적임을 보여주었습니다.
하지만 논문은 이것이 특정 시연임을 명시하고 있습니다. 그들은 모델이 이 일을 할 수 있음을 보여주었고, 속도와 품질을 측정했습니다. 그들은 AI의 모든 문제를 해결했다고 주장하거나, 가능한 모든 미래의 용도를 나열한 것이 아닙니다. 그들은 단지 AI가 세상이 어떻게 돌아가는지에 대해 더 똑똑하게 이해하면서도, 지금 당장 당신과 대화할 수 있을 만큼 빠르게 유지하는 새로운 비디오 생성 방식에 대한 사고방식을 제시했을 뿐입니다.
요약하자면, Wan-Streamer v0.3은 디지털 배우에게 "여기는 무대이고, 여기는 당신의 의상이며, 여기는 이야기입니다. 자, 이제 연기하고, 말하고, 움직이세요. 내가 눈을 깜빡하기도 전에 말이죠"라고 적힌 대본을 주는 것과 같습니다. 그리고 이 새로운 '월드 + 이벤트' 기술 덕분에, 그들은 정확히 그 일을 해내고 있는 것으로 보입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.