← 최신 논문
💻 computer science

Vorch-Streamer: Extending Human Audio-Visual Generation to Real-Time Long-Form Streaming

Vorch-Streamer는 혼합 포싱 전략(mixed forcing strategies)으로 학습된 인과적 생성기(causal generator), 장기 안정성을 위한 DMD 증류(DMD distillation), 그리고 음성 계획을 위한 외부 언어 모델을 결합하여 고속의 동기화된 일관된 아바타 생성을 가능하게 함으로써 실시간 롱폼 텍스트-투-오디오-비디오 스트리밍을 지원하는 사후 학습 프레임워크이다.

원저자: Menglin Han, Yang Ding, Yulei Lu, Haoran Yu, Xin Ma, Junyi Chen, Zhangkai Ni, Lin Ma, Yaohui Wang

게시일 2026-08-07
📖 2 분 읽기☕ 가벼운 읽기

원저자: Menglin Han, Yang Ding, Yulei Lu, Haoran Yu, Xin Ma, Junyi Chen, Zhangkai Ni, Lin Ma, Yaohui Wang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 로봇에게 이야기를 들려주는 법을 가르치고 있다고 상상해 보세요. 당신은 로봇이 실제 사람처럼 말하고, 입술을 움직이고, 동시에 얼굴 표정을 바꾸기를 원합니다. 오랫동안 가장 뛰어난 로봇들은 5초 정도의 짧은 인사말 같은 아주 짧은 클립 동안만 이 작업을 수행할 수 있었습니다. 그 로봇들은 마치 장면을 촬영하기 전에 전체 대본을 미리 보고 다음 상황이 어떻게 전개될지 예측하는 감독처럼 작동했습니다. 하지만 현실 세계에서 우리는 이야기를 시작하기 전에 전체 이야기가 다 쓰여질 때까지 기다릴 시간이 없습니다. 우리는 로봇이 지금까지 말한 내용만을 바탕으로, 목소리와 얼굴이 완벽하게 일치하는 상태를 유지하면서 '지금 당장' 말하기를 원합니다. 이것이 바로 "실시간 스트리밍"의 과제입니다. 문제는 만약 로봇이 첫 1초에 아주 작은 실수라도 한다면, 그 실수가 시간이 흐름에 따라 쌓여서 결국 로봇의 얼굴이 이상해 보이거나 목소리가 주제에서 벗어나게 만들 수 있다는 점입니다. 과학자들은 디지털 아바타가 정신을 놓거나 리듬을 잃지 않고 몇 분 동안 계속해서 말할 수 있도록 만드는 방법을 알아내기 위해 노력해 왔습니다.

여기에, 매우 체계적인 실시간 스토리텔러 역할을 하는 새로운 시스템인 Vorch-Streamer가 등장했습니다. Vorch-Streamer는 말을 하기 전에 전체 대본을 암기하려고 노력하는 대신, 쇼를 멈추지 않고 이어가기 위해 영리한 두 단계 전략을 사용합니다. 이것은 마치 밴드가 긴 즉흥 연주 세션을 하는 것과 같습니다. 보통 음악가가 틀린 음을 연주하면 노래 전체가 엉망이 될 수 있습니다. 하지만 Vorch-Streamer에는 특별한 "리허설" 모드가 있습니다. 먼저, 이 시스템은 완벽하게 해내는 법을 아는 선생님(사전 훈련된 모델)으로부터 부드럽게 교정을 받으며 짧은 구간을 연주하는 연습을 합니다. 그다음에는 노래의 처음부터 끝까지 전체를 연주하는 연습을 하는데, 이때는 자신의 이전 실수들을 스스로 듣고 실시간으로 수정하는 법을 배우며, 동시에 "지휘자"(AI 플래너)가 다음에 어떤 단어를 말해야 할지 정확히 알려줍니다.

그 결과, 디지털 아바타는 **27.12 프레임(FPS)**의 속도로 비디오와 오디오를 동시에 생성할 수 있게 되었습니다. 이를 체감하기 위해 설명하자면, 표준 비디오는 24 FPS로 재생되는데, 이는 이 로봇이 실제 시간보다 더 빠르다는 것을 의미합니다! 이 로봇은 거의 2분 동안 연속적으로 얼굴의 정체성을 유지하고, 입술을 단어에 맞춰 완벽하게 움직이며, 명확하고 정확한 목소리를 낼 수 있습니다. 연구진은 다음에 무엇을 말할지 결정하는 특정 "플래닝(planning)" 단계가 없다면, 로봇이 혼란에 빠져 횡설수설하거나 말을 반복하게 된다는 것을 발견했습니다. 이 플래너를 추가함으로써, 시스템은 미래를 볼 필요 없이 어떻게 긴 대화를 매끄럽게 이어갈 것인가라는 퍼즐을 성공적으로 해결했습니다. 이는 이야기의 모든 것을 알고 있는 강력하지만 느린 로봇을, 한 번에 딱 1초만큼의 정보만으로도 쇼를 계속 이어갈 수 있는 빠르고 생생한 공연자로 바꿀 수 있음을 증명합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →