← 최신 논문
🤖 machine learning

Vidu S1: A Real-Time Interactive Video Generation Model

Vidu S1은 사용자가 음성 명령을 통해 디지털 캐릭터를 제어하여 시각적 저하 없이 소비자용 GPU에서 최대 42 FPS로 무한한 길이의 고품질 540p 영상을 생성할 수 있게 하는 실시간 대화형 비디오 생성 모델입니다.

원저자: Jintao Zhang, Kai Jiang, Jintao Chen, Xu Wang, Yang Luo, Yuji Wang, Dechuang Chen, Jungang Li, Chengyang Ye, Marco Chen, Hongzhou Zhu, Min Zhao, Yuxuan Jiang, Zhengkun Huang, Chendong Xiang, Kaiwen Zh
게시일 2026-07-22
📖 3 분 읽기☕ 가벼운 읽기

원저자: Jintao Zhang, Kai Jiang, Jintao Chen, Xu Wang, Yang Luo, Yuji Wang, Dechuang Chen, Jungang Li, Chengyang Ye, Marco Chen, Hongzhou Zhu, Min Zhao, Yuxuan Jiang, Zhengkun Huang, Chendong Xiang, Kaiwen Zheng, Haoxu Wang, Xiaohang Wang, Qi Jia, Xin Chen, Yimin Chen, Youhe Jiang, Fangcheng Fu, Zhijie Deng, Fan Bao, Jianfei Chen, Jun Zhu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 영화를 보고 있는데, 당신이 화면을 향해 아무리 크게 소리쳐도 등장인물들이 당신의 말을 듣지 못하는 상황을 상상해 보세요. 당신은 그들에게 손을 흔들라고 하거나, 놀란 표정을 지으라고 하거나, 장면을 바꾸라고 말할 수 없습니다. 그저 감독이 편집을 모두 마칠 때까지 앉아서 결과를 기다려야 할 뿐입니다. 이것이 오늘날 대부분의 비디오 생성 AI가 작동하는 방식입니다. 요청을 입력하고, 긴 시간을 기다린 뒤, 완성된 클립을 얻는 것이죠. 하지만 만약 캐릭터가 생성되는 동안 당신과 대화를 할 수 있다면 어떨까요? 만약 당신이 "헤이, 엄지 척 해줘!"라고 말했을 때, 그들이 대화 도중에 즉시 그렇게 행동한다면 어떨까요? 이것이 바로 실시간 상호작용형 비디오 생성의 꿈입니다. 이 분야는 정적인 사전 제작 영화와 생생하고 즉각적인 라이브 대화 사이의 간극을 메우기 위해 노력하고 있습니다. 이를 위해 과학자들은 영상을 한 번에 통째로 "그리는" 것이 아니라, 마치 인간 배우가 감독의 즉각적인 신호에 따라 즉흥 연기를 하듯, 당신의 목소리에 반응하며 프레임 단위로 영상을 "스트리밍"하는 모델을 구축하고 있습니다.

여기에 Vidu S1이 등장합니다. 이 모델은 절대 박자를 놓치지 않는 초고속, 초응답 디지털 배우처럼 행동합니다. 이 프로젝트의 연구진은 결과물을 얻기 위해 몇 분 혹은 몇 시간씩 기다려야 하는 "오프라인" 비디오 생성 문제를 해결하고자 했습니다. 대신, 그들은 당신의 목소리로 디지털 캐릭터를 실시간으로 제어할 수 있는 시스템을 만들었습니다. 마치 미리 쓰인 대본을 따르는 것이 아니라, 당신의 음성 명령을 듣고 손을 흔들거나, 앉거나, 손으로 하트 모양을 만드는 등의 동작을 즉각적으로 수행하는 비디오 게임 캐릭터를 생각하면 됩니다. 멋진 점은 이것이 단 몇 초 동안만 작동하는 것이 아니라는 것입니다. 논문에 따르면 Vitu S1은 AI가 긴 영상을 만들 때 흔히 발생하는 문제인 캐릭터의 얼굴이 흐릿해지거나 움직임이 이상하고 끊기는 현상 없이 "무한한" 시간 동안 이 작업을 지속할 수 있다고 합니다.

Vidu S1 팀은 단순히 '두뇌'만을 만든 것이 아니라, 이를 빠르게 구동하기 위한 매우 효율적인 엔진도 함께 구축했습니다. 그들은 "TurboDiffusion"과 "TurboServe"라고 불리는 특별한 기술을 사용하여, 게이머들이 사용하는 일반적인 그래픽 카드에서도 비디오 생성을 압축하여 실행할 수 있도록 했습니다. 그 결과는 어떨까요? 이 모델은 540p 해상도로 42 FPS(초당 프레임 수)의 속도로 영상을 쏟아낼 수 있습니다. 이를 체감하기 위해 설명하자면, 표준 영상이 30 FPS로 재생된다는 점을 고려할 때, 이는 실제로 실시간보다 빠르다는 것을 의미합니다. 즉, AI가 지연 없이 라이브 대화를 따라갈 수 있다는 뜻입니다. 연구진은 사용자가 자신의 사진, 애니메이션 캐릭터, 심지어 반려동물의 사진을 업로드한 뒤 음성 지시를 내리는 방식으로 이를 테스트했습니다. 모델은 캐릭터가 다리를 들거나 엄지를 치켜세우는 등의 명령을 따르면서도, 업로드한 사진과 똑같은 얼굴을 유지하며 성공적으로 영상을 생성했습니다.

이 논문이 다루는 가장 큰 난관 중 하나는 "드리프트(drift)" 문제입니다. 사람의 그림을 그리는데, 새로운 세부 사항을 추가할 때마다 전체 그림이 서서히 왜곡되어 결국 사람이 괴물처럼 변해가는 상황을 상상해 보세요. 많은 AI 비디오 모델은 긴 영상을 만들려고 할 때 이러한 문제를 겪습니다. 영상이 길어질수록 캐릭터의 얼굴이나 배경이 일그러지게 됩니다. Vidu S1은 이를 방지하기 위해 "TwinCache"라는 영리한 메모리 시스템을 사용합니다. 이는 마치 과거 몇 초간의 "거친 스케치"를 보관하여 움직임을 부드럽게 유지하면서도, 동시에 "최종 완성본"을 유지하여 캐릭터의 얼굴이 선명하고 인지 가능한 상태를 유지하도록 돕는 사서와 같습니다. 덕분에 캐릭터가 무너지지 않고 영상이 영원히 계속될 수 있습니다.

또한 논문은 다른 모델들도 존재하지만, 대부분 상호작용하기에는 너무 느리거나, 음성 명령을 직접 이해하지 못하거나, 짧은 시간 후에 성능이 저하된다는 점을 지적합니다. Vidu S1은 정확히 그 반대의 기능을 하도록 설계되었습니다. 당신의 목소리를 직접적인 명령으로 받아들여 영상을 즉각 생성하고, 당신이 대화를 이어가는 동안 지속적으로 안정성을 유지합니다. 테스트에서 이 모델은 다른 최고 수준의 시스템들과 비교되었으며, 지시 이행 능력과 움직임의 자연스러움 측면에서 1위를 차지했습니다. 연구진은 이 기술을 통해 우리가 컴퓨터에서 즉석으로 생성된, 실제 사람처럼 보이고 움직이는 디지털 캐릭터와 실시간으로 개인화된 대화를 나누는 미래에 더 가까워지고 있다고 말합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →