← 최신 논문
💻 computer science

Avatar-Forever: Decoupled Parallel Training for High-Quality Real-Time Infinite Avatars

Avatar-Forever는 높은 시각적 품질을 위한 전체 파라미터 증류(full-parameter distillation)와 회복 지향 롤아웃 학습(Recovery-oriented Rollout Training)을 통해 학습된 경량 롱 호라이즌 어댑터를 결합한 디커플드 병렬 학습 프레임워크로, 단일 H100 GPU에서 안정적이고 실시간적인 무한 오디오 기반 아바타 생성을 가능하게 한다.

원저자: Ruibin Li, Tao Yang, Zhiyuan Ma, Fangzhou Ai, Shilei Wen, Lei Zhang

게시일 2026-08-13
📖 4 분 읽기☕ 가벼운 읽기

원저자: Ruibin Li, Tao Yang, Zhiyuan Ma, Fangzhou Ai, Shilei Wen, Lei Zhang

원본 논문은 CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/)에 따라 공공 도메인에 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 영원히 실제 사람처럼 보이고, 움직이고, 말하는 디지털 친구와 대화할 수 있는 세상을 상상해 보세요. 이것은 단순한 공상 과학 영화 속의 꿈이 아닙니다. 이것은 과학자들이 컴퓨터에게 움직이는 영상을 이해하고 생성하도록 가르치는 분야인 **비주얼 컴퓨팅(visual computing)**의 목표입니다. 이를 위해 연구자들은 수백만 개의 비디오를 통해 학습된 거대한 디지털 두뇌인 AI 모델을 사용합니다. 이 분야의 핵심 과제는 **스트리밍 비디오 생성(streaming video generation)**입니다. 이것을 계주 경기에 비유해 보세요. 컴퓨터가 몇 초 분량의 영상을 생성한 다음, 그 결과를 다음 몇 초를 위한 시작점으로 사용하는 방식입니다. 문제는 컴퓨터가 처음 몇 초 동안 아주 작은 실수를 저지르면, 그 실수가 전달 과정에서 점점 커지고 기괴해져서, 결국 디지털 사람이 녹아내리거나 정체성을 잃어버리게 된다는 점입니다. 이 논문은 디지털 인간이 몇 시간 동안 멈추지 않고 말하더라도 완벽한 모습과 자연스러운 동작을 유지하도록 만드는 골칫거리를 해결합니다.

Avatar-Forever를 개발한 연구진은 기존의 방식으로 이 "계주" 문제를 해결하려고 노력하는 것이, 마치 학생에게 한 번에 빠르고 결코 넘어지지 않는 법을 가르치기 위해 하나의 혼란스러운 수업 계획안을 사용하는 것과 같다는 점을 깨달았습니다. 기존 방식은 두 가지 매우 다른 목표를 하나의 학습 과정에 억지로 밀어 넣으려 했습니다. 바로 비디오 생성을 매우 빠르게 만드는 것(실시간처럼 느껴지도록)과 매우 견고하게 만드는 것(1분 이상 무너지지 않도록)입니다. 저자들은 이 두 목표가 실제로 서로 충돌한다고 주장합니다. 속도에 너무 집중하면 영상이 흔들리고, 오류를 수정하는 데 너무 집중하면 너무 느려집니다.

따라서, 컴퓨터가 두 가지 기술을 동시에 배우도록 강요하는 대신, Avatar-Forever는 학습을 두 개의 별도 병렬 클래스로 나눕니다. 디지털 체육관에 두 개의 서로 다른 트랙이 있다고 상상해 보세요. 첫 번째 트랙인 **효율성 브랜치(Efficiency Branch)**에서 AI는 단거리 달리기를 연습합니다. AI는 오로지 속도와 단기적인 미적 완성도에 집중하며 단 몇 단계 만에 고품질의 영상을 생성하는 법을 배웁니다. 두 번째 트랙인 **강건성 브랜치(Robustness Branch)**에서 AI는 다른 기술인 '회복'을 연습합니다. 여기서 연구자들은 의도적으로 AI의 시작점을 망가뜨립니다. 이미지를 흐리게 하거나, 노이즈를 추가하거나, 얼굴의 일부를 가리는 식입니다. 그러고 나서 AI에게 그럼에도 불구하고 다음 몇 초의 영상을 생성하라고 요구합니다. 이것을 **회복 지향 롤아웃 훈련(Recovery-oriented Rollout Training, RRT)**이라고 부릅니다. 이는 체조 선수에게 첫 발을 헛디디더라도 완벽한 뒤공중제비를 하는 법을 가르치는 것과 같습니다. AI는 단순히 실수가 발생하지 않기를 바라는 것이 아니라, 발생하는 대로 스스로 실수를 바로잡는 법을 배웁니다.

AI가 두 트랙 모두에서 훈련을 마치면, 연구자들은 이 두 기술을 결합합니다. 그들은 빠른 주자와 회복 전문가를 하나로 합쳐 하나의 슈퍼 운동선가를 만듭니다. 이 새로운 아바타는 실시간으로 영상을 생성할 수 있으면서도, 정체성을 잃거나 평정심을 잃지 않고 몇 시간 동안 대화할 수 있을 만큼 강인합니다. 더욱 빠르게 만들기 위해, 그들은 ForeverCache라는 영리한 기술을 도입했습니다. 보통 AI가 새로운 영상 덩어리를 생성할 때마다, 방금 만든 전체 기록을 다시 읽어야 하는데, 이는 매 문장을 쓸 때마다 책 전체를 다시 읽는 것과 같습니다. ForeverCache는 스마트한 책갈피와 같습니다. 그것은 안정적인 부분(배경, 사람의 얼굴 등)을 기억하여 AI가 매번 다시 계산할 필요가 없도록 합니다. AI는 오직 지금 쓰여지고 있는 새로운 단어들에만 집중합니다.

결과는 인상적입니다. 220억 개의 파라미터를 가진 거대한 비디오 파운데이션 모델을 기반으로 구축된 Avatar-Forever는, 강력한 H100 그래픽 카드 한 장에서 **초당 27.2 프레임(27.2 fps)**의 속도로 고해상도 영상(768 × 512 픽셀)을 생성할 수 있습니다. 이는 실시간 상호작용이 가능한 속도입니다. 테스트 결과, 이 시스템은 얼굴이 녹아내리거나, 목소리가 어긋나거나, 움직임이 로봇처럼 변하는 현상 없이 11분 이상 디지털 아바타가 자연스럽게 말하도록 유지했습니다. 다른 방법들이 시간이 지나면서 "정체성 표류(identity drift, 사람이 다른 사람처럼 보이는 현상)"나 반복적이고 딱딱한 제스처를 보였던 반면, Avatar-Forever는 캐릭터의 일관성을 유지하고 움직임을 유연하게 유지했습니다. 연구팀은 모델을 훈련하기 위해 완전한 합성 데이터셋을 만들었는데, 이는 실제 인터넷 영상의 무질서함을 피하고 완벽한 품질과 정렬을 보장하기 위해 AI를 사용하여 직접 훈련 영상을 생성했음을 의미합니다.

이 논문은 이러한 "분리 트랙" 접근 방식이 기존의 엉킨 방식보다 오래 지속되는 디지털 인간을 구축하는 더 나은 방법임을 시사합니다. 속도의 필요성과 안정성의 필요성을 분리함으로써, 연구자들은 디지털 글리치(glitch)로 인해 환상이 깨지는 일 없이 우리가 필요할 때마다 언제든 대화, 교육 또는 엔터테인먼트를 제공할 수 있는 디지털 동반자를 만드는 실질적인 경로를 찾아냈습니다. 현재 이 시스템은 강력한 서버에 최적화되어 있어 아직 가정용 컴퓨터에서는 사용할 수 없지만, 우리의 디지털 동반자가 우리가 원하는 만큼 오랫동안 함께할 수 있는 미래를 향한 문을 열어줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →