← 최신 논문
💻 computer science

DynaForcing: Overcoming Dynamic Collapse in Self-Forcing Distillation for Streaming Avatar Generation

이 논문은 하이브리드 포싱(hybrid forcing), 역동성 인식 보상 정규화(dynamics-aware reward regularization), 그리고 참조 섭동(reference perturbation)을 결다는 결합하여 시간적 움직임을 복원하고 시각적 품질을 향상시키는 동시에 계산 비용을 크게 절감함으로써, 스트리밍 아바타 생성을 위한 셀프 포싱 증류(self-forcing distillation)에서의 "동적 붕괴(dynamic collapse)" 문제를 해결하는 훈련 프레임워크인 DynaForcing을 소개한다.

원저자: Yubo Huang, Sirui Zhao, Xinchen Yao, Zhengye Zhang, Jinyang Huang, Fengqi Cui, Shiwei Wu, Enhong Chen

게시일 2026-08-19
📖 4 분 읽기☕ 가벼운 읽기

원저자: Yubo Huang, Sirui Zhao, Xinchen Yao, Zhengye Zhang, Jinyang Huang, Fengqi Cui, Shiwei Wu, Enhong Chen

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

인공지능의 세계에서, 실시간으로 말하고 움직일 수 있는 디지털 휴먼을 만드는 것은 가장 야심 찬 목표 중 하나입니다. 이 기술은 컴퓨터가 수천 시간의 비디오로 학습된 거대한 시스템인 스승 모델(teacher model)을 모방하도록 학습하여, 실시간 스트리밍이 가능한 더 작고 빠른 버전을 만들어내는 과정에 의존합니다. 이 더 작은 모델은 목소리의 리듬에 맞춰 입술과 얼굴 근육을 자연스럽고 정밀하게 움직이며 말하는 머리(talking head)를 생성하도록 설계되었습니다. 수년간 연구자들은 좌절스러운 역설과 싸워왔습니다. 디지털 아바타를 더 빠르고 효율적으로 만들수록, 아바타들이 기묘할 정도로 움직임이 없어지는 현상이 자주 발생했기 때문입니다. 얼굴은 선명하고 사실적이었지만, 움직임을 잃어버려 마치 정지된 가면처럼 변해버렸고, 마땅히 말해야 할 소리에 맞춰 움직이지 못했습니다. 디지털 캐릭터가 숨을 쉬거나 눈을 깜빡이는 동작을 멈추는 이러한 움직임의 상실은, 진정으로 상호작용 가능한 가상 동반자를 만드는 데 있어 지속적인 장벽이 되어왔습니다.

한 연구팀이 이제 왜 이런 현상이 발생하는지 정확히 파악하고, 이를 해결하기 위한 새로운 시스템을 구축했습니다. 그들은 이 아바타들을 빠르게 만드는 바로 그 방법이 정지 상태의 원인이기도 했다는 것을 발견했습니다. 컴퓨터에게 이전의 출력값으로부터 스스로 학습하여 속도를 높이도록 요구하는 학습 과정은 피드백 루프를 생성합니다. 만약 컴퓨터가 입을 마땅히 벌려야 할 것보다 약간 덜 벌린 단 하나의 프레임을 생성하면, 시스템은 그 약간 잘못된 프레임을 바탕으로 다음 프레임을 예측하게 됩니다. 시스템은 정적인 얼굴 이미지를 맞추려고 노력하기 때문에, 복잡하고 빠른 움직임을 구현하는 것보다 입을 다문 상태를 유지하는 것이 더 쉽다고 판단합니다. 시간이 흐르면서 이 작은 오류는 누적되고, 모델은 움직임이 거의 제로에 가까운 상태로 붕ًا(collapse)되어, 움직임이 없는 고품질 이미지만을 생산하게 됩니다. 연구진은 이것이 비디오 품질 자체의 결함이 아니라, 모델이 시간과 변화를 처리하는 방식에서의 근본적인 실패라는 것을 발견했습니다.

이를 해결하기 위해 연구진은 '다이나포싱(DynaForcing)'이라 불리는 새로운 학습 프레임워크를 개발했는데, 이는 학습 과정의 세 가지 다른 단계에서 교정력을 행사합니다. 첫째, 그들은 학습의 시작점을 변경했습니다. 컴퓨터가 순수한 무작위성으로부터 비디오 시퀀스의 시작을 추측하게 하는 대신, 가끔씩 실제 비디오의 약간 흐릿한 버전을 입력값으로 제공했습니다. 이는 모델에게 실제 움직임이 어떤 모습인지 상기시켜 주는 견고한 닻 역할을 하여, 모델이 정적인 상태로 표류하는 것을 방지했습니다. 둘째, 특정 보상 시스템을 추가했습니다. 마치 학생이 추가적인 과제를 수행했을 때 금메달을 받는 것처럼, 컴퓨터가 정확한 입 모양과 자연스러운 얼굴 표정을 생성할 때마다 디지털 보상을 받도록 했습니다. 이 보상은 모델이 정지해 있는 쉬운 길을 벗어나, 올바르게 움직이는 어려운 길을 향하도록 유도하는 가이드 역할을 했습니다. 마지막으로, 그들은 컴퓨터가 안내를 위해 사용하는 참조 이미지(reference images)를 수정했습니다. 표준 학습에서는 컴퓨터가 음성을 무시한 채 참조 사진의 배경과 포즈를 너무 밀접하게 복제하는 경우가 많습니다. 연구진은 사람의 얼굴은 그대로 유지하면서 배경과 조명을 변경하도록 이 사진들을 수정했습니다. 이를 통해 컴퓨터가 정적인 세부 사항을 복제하는 것을 멈추고, 오직 오디오에만 의존하여 필요한 움직임을 생성하도록 강제했습니다.

이러한 접근 방식의 결과는 즉각적이고 상당했습니다. 약 10초 정도의 짧은 영상과 5분이 넘는 긴 영상을 테스트했을 때, 새로운 시스템은 원래의 훨씬 더 큰 스승 모델과 대등한 수준의 자연스러움으로 움직이는 아바타를 생성했습니다. 디지털 얼굴은 더 이상 굳어 있지 않았습니다. 단어에 맞춰 입을 열고 닫았으며, 목소리의 톤에 따라 표정이 자연스럽게 변했습니다. 연구진은 입술 동기화와 표정 다양성을 측정하는 특정 점수를 사용하여 이 개선 사항을 측정했으며, 그들의 방법이 이전의 빠른 시스템들이 잃어버렸던 역동적인 움직임을 복구했음을 발견했습니다. 예를 들어, 얼굴 움직임의 다양성을 측정하는 지표는 매우 낮은 점수에서 높은 점수로 급증하며 최고의 비실시간 모델들의 성능과 일치하는 모습을 보였습니다. 결정적으로, 이 시스템은 초당 45프레임의 속도로 영상을 생성할 수 있는 속도를 유지하여, 실시간 상호작용이 가능한 수준을 갖추었습니다.

움직임을 해결하는 것 외에도, 연구진은 학습 과정 자체를 훨씬 더 효율적으로 만들었습니다. 기존 방식은 비디오 생성의 모든 단계를 추적하기 위해 엄청난 양의 컴퓨터 메모리를 필요로 했으며, 단 하나의 모델을 학습시키기 위해 수백 대의 강력한 그래픽 카드가 필요하기도 했습니다. 하지만 새로운 방식은 컴퓨터가 이러한 단계들을 처리하는 방식을 재구성하고 불필요한 데이터를 폐기함으로써, 하드웨어 요구 사항을 10배 이상 줄였습니다. 이는 고품질의 움직이는 아바타를 만드는 일이 이제 슈퍼컴퓨터에 접근할 수 있는 사람들뿐만 아니라 훨씬 더 많은 연구자와 개발자들에게도 가능하다는 것을 의미합니다. 이 연구는 속도와 움직임이라는 두 마리 토끼를 잡는 것이 가능하며, 오랫동안 피할 수 없는 트레이드오프(trade-off)로 여겨졌던 문제를 해결할 수 있음을 보여줍니다. 이 시스템이 생성하는 디지털 아바타는 더 이상 굳어 있는 조각상이 아닙니다. 그들은 역동적이고 반응적이며, 말할 준비가 되어 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →