Live Avatar: Streaming Real-time Audio-Driven Avatar Generation with Infinite Length
이 논문은 증류된 인과적 확산 파이프라인(distilled causal diffusion pipeline)과 타임스텝 강제 파이프라인 병렬 처리(Timestep-forcing Pipeline Parallelism)를 결합하여 장기적 정체성 드리프트(long-horizon identity drift)를 제거함으로써 45 FPS를 달성하고, 140억 개의 파라미터를 가진 오디오 구동 아바타의 최초의 실용적인 실시간 무한 길이 스트리밍 생성을 가능하게 하는 공동 설계 알고리즘-시스템 프레임워크인 Live Avatar을 소개한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
로봇에게 이야기를 들려주는 법을 가르치고 싶다고 상상해 보세요. 당신은 로봇이 당신의 목소리에 완벽하게 맞춰서 말하고, 입을 움직이며, 얼굴 표정을 바꾸기를 원합니다. 그러면서도 실제 사람처럼 보여야 하죠. 이것이 바로 **오디오 기반 아바타 생성(audio-driven avatar generation)**의 세계입니다. 오랫동안 과학자들은 **확산 모델(diffusion model)**이라는 유형의 AI를 사용하여 "디지털 배우"를 만들어 왔습니다. 확산 모델을 노이즈가 가득한 정적 상태의 블록에서 노이즈를 조금씩 깎아내어 완벽한 조각상을 드러내는 조각가라고 생각해 보세요. 보통 이 조각가는 매우 엄격한 순서에 따라 작업합니다. 머리를 완성하기 전에는 몸을 시작할 수 없으며, 이를 단계별로 수행해야 하므로 시간이 오래 걸립니다.
큰 문제는 만약 이 로봇에게 한 시간 동안 이야기를 해달라고 요청한다면, 로봇이 혼란에 빠지기 쉽다는 점입니다. 캐릭터의 얼굴이 5분 전에는 어땠는지 잊어버릴 수도 있고, 목소리가 완전히 다른 사람처럼 들리기 시작할 수도 있습니다. 이를 "드리프트(drift, 편차)"라고 합니다. 게다가 조각가가 너무 느리게 작업하기 때문에, 실시간 대화를 나누는 것은 불가능합니다. 로봇이 문장을 마칠 때쯤이면 당신은 이미 자신이 무슨 말을 했는지 잊어버렸을 것입니다. 연구자들의 목표는 당신과 실시간으로 대화할 수 있을 만큼 빠르고, 몇 시간 동안 정체성을 유지할 수 있을 만큼 똑똑하며, 사진처럼 생생할 만큼 디테일한 디지털 배우를 구축하는 것이었습니다.
여기, 거대한 컴퓨터 칩 오케스트라의 마스터 지휘자 역할을 하는 새로운 프로젝트, **라이브 아바타(Live Avatar)**가 등장했습니다. 중국 과학기술대학교와 알리바바 팀이 이끄는 연구진은 140억 개의 파라미터를 가진 거대한 AI 모델(AI 세계에서는 매우 큰 규모인 "14B" 모델)이 정신을 잃지 않고 말하고, 움직이고, 비디오를 스트리밍하는 방법을 알아냈습니다.
보통 이렇게 길고 빠른 영상을 만드는 것은 모순적인 일입니다. 속도를 얻거나 품질을 얻거나, 둘 중 하나만 가능합니다. 라이브 아바타는 AI가 시간과 기억을 "생각하는" 방식을 바꿈으로써 이 문제를 해결합니다. 과거의 모든 완벽한 세부 사항을 기억하려고 노력하는 대신(이는 AI를 혼란스럽게 만들고 드리프트를 유발합니다), 시스템은 "노이즈가 섞인" 기억을 저장합니다. 노래를 기억할 때 모든 음표를 완벽하게 떠올리려 하기보다 멜로디를 대략적으로 흥얼거리는 것을 상상해 보세요. 이 "거친" 기억은 필터 역할을 하여 캐릭터의 얼굴을 안정적으로 유지하면서도 입의 움직임은 자연스럽게 만들어 줍니다.
연구진은 또한 **타임스텝 강제 파이프라인 병렬화(Timestep-forcing Pipeline Parallelism)**라는 영리한 가속 방법을 발명했습니다. 자동차를 만드는 모든 단계를 한 명의 작업자가 수행하는 대신, 여러 명의 작업자가 있는 공장의 조립 라인을 상상해 보세요. 일반적인 비디오 AI에서는 모든 작업자가 이전 작업자가 끝날 때까지 기다려야 합니다. 라이브 아바타는 규칙을 바꿉니다. 라인의 모든 작업자(또는 컴퓨터 칩, 즉 GPU)에게 특정 단계가 할당됩니다. 작업자 A가 바퀴를 광택 내는 동안, 작업자 B는 문을 칠하고, 작업자 C는 엔진을 설치하는 것처럼, 이 모든 일이 동시에 일러납니다. 이는 느리고 순차적인 과정을 빠르고 병렬적인 과정으로 바꿉니다.
결과는 인상적입니다. 5개의 강력한 H100 그래픽 카드가 있는 설정에서, 라이브 아바타는 인간의 시각 속도보다 빠른 **초당 45프레임(FPS)**으로 비디오를 생성할 수 있습니다. 당신이 말한 후 첫 프레임이 생성되기 시작할 때까지는 단 1.21초밖에 걸리지 않습니다. 가장 중요한 것은, 이것이 영원히 계속될 수 있다는 점입니다. 연구진은 아바타가 10,000초 이상(약 3시간 연속) 말하게 하여 테스트를 진행했는데, 캐릭터는 드리프트가 발생하지 않았고, 글리치가 생기지 않았으며, 정체성을 잃지도 않았습니다.
이것은 단순한 이론적 승리가 아닙니다. 팀은 다른 방식들이 긴 시간 동안 왜 실패하는지를 증명하기 위해 **젠벤치(GenBench)**라는 새로운 테스트 환경을 구축했습니다. 그들은 다른 시스템들이 몇 초 동안은 좋아 보일 수 있지만, 몇 분이 지나면 품질이 저하되거나 색상이 변하거나 얼굴을 잃어버리기 시작한다는 것을 발견했습니다. 반면 라이브 아바타는 일관성을 유지합니다. 이는 "노이즈 섞인 기억" 전략과 스마트한 "조립 라인" 시스템을 결합함으로써, 우리가 마침내 실시간의 무한한 대화가 가능한 디지털 인간을 가질 수 있음을 시사합니다.
시스템은 매우 빠르지만, 저자들은 여전히 작은 지연 시간이 존재한다고 언급합니다. 네트워크 이동 시간을 포함하여 당신이 말한 후 화면에 영상이 나타나기까지의 시간은 약 3초입니다. 이는 많은 상호작 작용에는 충분히 빠르지만, 매 밀리초가 중요한 매끄러운 대면 대화에는 아주 약간 부족할 수 있습니다. 그러나 스트리밍, 가상 비서, 디지털 스토리텔링 측면에서 볼 때 이는 엄청난 도약이며, 무한하고 실시간적인 디지털 아바타의 시대가 더 이상 꿈이 아님을 보여줍니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.