LiveAnimate: Stable Long-Form Streaming Human Animation in Real-Time
LiveAnimate는 2단계 학습 파이프라인과 특화된 Pose-Retrieval Sink Attention 메커니즘을 통해 일정한 지연 시간과 높은 지각적 품질을 유지하며 안정적인 장기 스트리밍 인간 애니메이션을 구현하는, 14B 파라미터 디퓨전 트랜스포머 기반의 혁신적인 실시간 십억 규모 비디오 생성 시스템입니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
로봇에게 춤을 가르치려고 한다고 상상해 보세요. 당신은 로봇에게 사람의 사진 한 장과 일련의 춤 동작 스트림을 줍니다. 그리고 로봇이 그 사람이 춤을 추는 영상을 즉각적으로 생성하기를 원합니다. 이것이 바로 "포즈 기반 인간 애니메이션(pose-driven human animation)"의 세계입니다. 오랫동안 뛰어난 로봇들은 이 작업을 오직 "오프라인 모드"로만 수행할 수 있었습니다. 복잡한 케이크를 굽는 과정에 비유해 봅시다. 재료를 섞고, 부풀어 오를 때까지 몇 시간을 기다리고, 구운 다음, 마침내 내놓는 식이죠. 만약 춤 동작을 바꾸고 싶다면, 전체 베이킹 과정을 처음부터 다시 시작해야 합니다. 이는 영화 제작에는 좋지만, 로봇이 지금 당장 반응해야 하는 라이브 스트리밍이나 비디오 게임에는 최악입니다. 큰 과제는 로봇이 매우 똑똑하면서도(실제처럼 보이고 일관성을 유지하기 위해), 동시에 매우 빨라서(라이브 스트림을 따라잡기 위해) 영상이 몇 분 만에 무너지지 않게 만드는 것이었습니다.
이 간극을 마침내 메우는 새로운 시스템, LiveAnimate가 등장했습니다. 연구진은 사람이 춤을 추는 영상을 블록 단위로 실시간 생성하면서, 스트리밍 내내 그 사람의 얼굴과 옷이 정확히 동일하게 보이도록 하는 "디지털 무용수"를 구축했습니다. 이는 지치지 않고, 인형이 어떻게 생겼는지 절대 잊지 않으며, 인형의 얼굴이 녹아내리거나 옷의 색이 변하는 일 없이 몇 시간 동안 쇼를 계속할 수 있는 숙련된 인형술사를 두는 것과 같습니다. 논문에 따르면 이 시스템은 강력한 컴퓨터에서 약 20fps(실시간 움직임처럼 느껴지는 속도)로 실행될 수 있으며, 이전 방식들이 실시간으로 구현하지 못했거나 생성하는 데 몇 시간이 걸렸던 것과 달리 최소 3분 동안 고품질을 유지할 수 있습니다.
마법의 기술: 작동 원리
LiveAnimate가 이 기술을 어떻게 구현했는지 이해하려면, 이들이 혼합한 세 가지 주요 재료를 살펴봐야 합니다. 바로 초지능적인 뇌, 특별한 훈련 루틴, 그리고 영리한 기억 기술입니다.
1. 뇌: 거대한 비디오 트랜스포머
시스템의 핵심은 140억 개의 파라미터를 가진 "디퓨전 트랜스포머(Diffusion Transformer, DiT)"라는 거대한 AI 모델입니다. 이것을 인간의 몸이 움직이고 보이는 모든 가능한 방식이 담긴 거대한 도서관이라고 상상해 보세요. 보통 이러한 도서관은 "양방향(bidirectional)"입니다. 즉, 장면을 이해하기 위해 미래와 과거를 모두 볼 수 있습니다. 하지만 라이브 스트리밍을 위해서는 미래를 볼 수 없으며, 오직 현재 일어나고 있는 일에만 반응할 수 있습니다. 연구진은 이 거대한 뇌가 인간이 실시간으로 춤을 관람하는 것처럼, 오직 과거와 현재만을 바라보도록 "인과적(causal)"으로 재학습시켜야 했습니다.
2. 훈련: 두 단계의 학습
140억 개의 파라미터를 가진 뇌에게 그냥 "라이브로 가!"라고 말한다고 해서 제대로 작동할 수는 없습니다. 논문은 이를 준비하기 위한 2단계 훈련 과정을 설명합니다.
- 1단계 (선생님): 먼저 "참조 고정 교사 강제 학습(Reference-Anchored Teacher-Forcing)"을 사용하여 모델을 가르칩니다. 선생님이 완벽한 대본(정답/ground truth)을 들고 학생(AI)을 블록 단위로 안내하며 춤을 따라 하게 하는 것을 상상해 보세요. 학생은 동작을 완벽하게 복사하는 법을 배우는 동시에, 댄서가 올바른 사람으로 보이도록 항상 참조 사진을 염두에 둡니다.
- 2단계 (스피드 런): 1단계는 여전히 실시간으로 하기에는 너무 느립니다. 그래서 2단계에서는 "블록 단위 자기 강제 증류(Block-wise Self-Forcing Distillation)"라는 기술을 사용합니다. 이는 학생에게 선생님 없이 스스로 춤을 연습하게 하고, 그 후 오직 현재 하고 있는 동작만을 교정해 주는 것과 같습니다. 이를 통해 모델은 전체 춤의 역사를 한꺼번에 기억할 필요 없이, 자신의 실수로부터 배울 수 있습니다. 결과는 어떨까요? 모델은 일반적인 50단계 대신 단 3단계만으로 고품질 영상을 생성하는 법을 배우며, 이를 통해 실시간 실행이 가능할 만큼 빨라집니다.
3. 기억 기술: 포즈 검색 싱크(Pose-Retrieval Sink)
이 부분이 가장 창의적인 부분입니다. 컴퓨터에게 3분짜리 영상을 기억하라고 요청하면, 보통 메모리가 부족해지거나 혼란에 빠집니다. 만약 댄서가 2분 전에 했던 포즈를 다시 취한다면, 일반적인 시스템은 그 당시의 모습이 어떻게 생겼었는지 잊어버려 기괴한 글리치(glitch)가 발생하거나 얼굴이 미세하게 달라질 수 있습니다.
Live-Animate는 **포즈 검색 싱크 어텐션(Pose-Retrieval Sink Attention, PR-Sink)**이라는 영리한 기억 시스템으로 이를 해결합니다. AI가 마지막 몇 초의 춤만을 담고 있는 작은 "포스트잇" 메모지(Rolling Window)를 가지고 있다고 상상해 보세요. 하지만 동시에 이 AI는 이전에 보았던 특정 포즈들의 스냅샷을 저장하는 특별한 "포즈 라이브러리(Memory Bank)"도 가지고 있습니다.
- 정적 싱크(Static Sink): 이것은 영구적인 닻입니다. 비디오의 첫 프레임을 메모리에 영원히 고정하여 댄서의 정체성이 변하지 않도록 합니다.
- 동적 싱크(Dynamic Sink): 이것이 마법입니다. 댄서가 "포즈 라이브러리"에 있는 포즈와 일치하는 자세를 취하면, 시스템은 즉시 그 과거 순간의 "포스트 It"을 가져와 현재 화면에 붙여넣습니다. 마치 댄서가 갑자기 "아, 내가 2분 전에 이 동작을 했었지, 그때 정말 멋졌어!"라고 기억해 내고, 그 당시의 모습을 즉시 복사해 오는 것과 같습니다. 이 과정은 시스템이 전체 3분 영상을 모두 기억할 필요 없이 이루어지므로, 스트림이 얼마나 길어지든 메모리 사용량을 일정하게 유지합니다.
결과: 빠르고, 안정적이며, 실제적이다
연구진은 3분 길이의 댄스 시퀀스로 LiveAnimate를 테스트했습니다. 결과는 놀라웠습니다. 다른 시스템들이 동일한 클립을 생성하는 데 2~5시간이 걸리거나, 1분이 지나면 품질이 저하(얼굴이 흐려지거나, 옷의 색이 변하거나, 정체성이 변함)되는 반면, LiveAnimate는 처음부터 끝까지 일정한 품질을 유지했습니다.
- 속도: 두 대의 고성능 NVIDIA H100 GPU에서 약 19.63fps로 실행됩니다. 이는 실시간 상호작용이 가능하다고 느낄 만큼 충분히 빠른 속도입니다.
- 일관성: 시스템은 전체 3분 동안 시각적 품질과 정체성 일관성에서 거의 완벽한 점수를 유지했습니다. 대조적으로, 다른 방법들은 영상이 길어짐에 따라 품질이 크게 떨어졌습니다.
- 효율성: 영리한 "포즈 라이브러리" 기술 덕분에 영상이 10초든 10분이든 메모리 사용량은 동일하게 유지됩니다.
아직 부족한 점
논문은 이 시스템이 하지 못하는 부분에 대해서도 주의 깊게 명시하고 있습니다. 현재 이 시스템은 480×480 픽셀 해상도로 영상을 생성하는데, 이는 화면용으로는 좋지만 할리우드 영화 수준의 퀄리티는 아닙니다. 또한 단일 인물 장면에 집중하고 있어, 여러 명이 함께 춤을 추거나 복잡한 카메라 움직임을 다루지는 못합니다. 저자들은 이러한 한계를 넘어 더 높은 해상도와 복잡한 장면으로 나아가는 것이 향촉 과제라고 제안합니다.
이것이 중요한 이유
LiveAnimate는 AI의 새로운 운영 지점을 나타냅니다. 우리는 "고품질"과 "실시간 속도" 중 하나를 선택할 필요가 없다는 것을 증证明합니다. 거대한 AI 뇌와 스마트한 제한적 메모리 시스템을 결합함으로써, 연구진은 디지털 휴먼이 자신의 정체성을 잊지 않고 즉각적으로 춤추고, 말하고, 상호작용할 수 있는 차세대 인터랙티브 아바타, 라이브 가상 콘서트, 텔레프레즌스 시스템을 구동할 수 있는 도구를 만들어냈습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.