← 최신 논문
💻 computer science

DiscoForcing: A Unified Framework for Real-Time Audio-Driven Character Control with Diffusion Forcing

DiscoForcing는 엄격한 지연 시간 제약과 비정상적인 오디오 조건 하에서 안정적이고 장기적이며 반응성이 뛰어난 전체 신체 캐릭터 모션 제어를 달성하기 위해 인과적 음악 인코더와 하이브리드 시간 스케줄을 갖춘 확산 강제 시퀀스 모델을 활용하는 통합 실시간 프레임워크입니다.

원저자: Kaiyang Ji, Bingsheng Qian, Binghuan Wu, Kangyi Chen, Ye Shi, Jingya Wang

게시일 2026-05-28
📖 3 분 읽기☕ 가벼운 읽기

원저자: Kaiyang Ji, Bingsheng Qian, Binghuan Wu, Kangyi Chen, Ye Shi, Jingya Wang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

라디오에서 실시간으로 재생되는 음악에 맞춰 로봇이 춤을 추도록 가르친다고 상상해 보세요. 어려운 점은 음악이 실시간으로 스트리밍된다는 것입니다. 비트가 갑자기 빨라지거나, 곡이 장르를 바꾸거나, DJ가 레코드를 스크래치할 수 있습니다. 로봇은 이러한 변화에 즉각적으로 반응해야 하지만, 동시에 자신의 발에 걸려 넘어지거나 몇 초 전의 리듬을 잊지 않고 부드럽게 춤을 추어야 합니다.

이것이 DiscoForcing이 해결하는 문제입니다. 이는 디지털 캐릭터 (또는 실제 로봇) 가 라이브 음악을 실시간으로 추면서도 모든 비트 드롭과 템포 변화에 지연 없이 반응하도록 하는 새로운 시스템입니다.

다음은 이를 단순한 개념으로 분해한 작동 원리입니다:

1. 문제: "오프라인"과 "라이브" 간의 격차

대부분의 이전 춤 추기 AI 시스템은 영화 감독과 같습니다. 캐릭터가 어떻게 움직일지 결정하기 전에 전체 곡을 처음부터 끝까지 감상합니다. 후렴구가 다가온다는 것을 알기 때문에 미리 준비할 수 있습니다.

하지만 실제 인터랙티브 게임이나 라이브 쇼에서는 곡 전체를 기다릴 수 없습니다. 재즈 즉흥 연주자처럼 행동해야 합니다. 한 음을 들으면 즉시 반응하고, 음악이 예상치 않게 변하더라도 계속 연주해야 합니다. AI 가 "앞을 내다보려" 기다리면 느리게 느껴집니다. 반면 뒤를 돌아보지 않고 너무 빠르게 반응하면 떨림이 생기고 리듬을 잃게 됩니다.

2. 해결책: "디퓨전 포싱 (Diffusion Forcing)" 엔진

DiscoForcing 은 디퓨전 포싱이라는 교묘한 트릭을 사용합니다. 이는 비디오 스트림에서 작업하는 스마트 편집자와 같습니다.

  • 옛 방식: 전체 그림을 한 번에 보며 흐릿한 사진을 수정하려고 한다고 상상해 보세요. (음악이 아직 재생 중이어서) 그림의 절반만 있다면 혼란을 겪게 됩니다.
  • DiscoForcing 방식: AI 가 방금 만든 춤 동작을 지속적으로 "정리"하지만 특별한 방식으로 수행합니다. 최근 과거 (최근 몇 초간의 음악) 는 매우 명확하고 중요하게 취급하지만, 먼 과거는 약간 "흐릿"하거나 노이즈가 있는 것으로 취급합니다.
    • 이를 통해 AI 는 갑작스러운 비트 드롭에 빠르게 반응하기 위해 최근 음악을 신뢰할 수 있습니다.
    • 동시에 먼 과거의 기록을 충분히 안정적으로 유지하여 춤추는 사람이 통제 불능 상태로 빙글빙글 도는 것을 방지합니다.

자동차를 운전하는 것과 같습니다: 도로의 앞쪽을 날카롭게 바라보며 구덩이를 피합니다 (새로운 음악에 반응). 하지만 지난 1 분간 운전했던 위치를 기반으로 핸들을 안정적으로 잡습니다 (흐름 유지).

3. 두 부분으로 구성된 뇌

이 시스템은 함께 작동하는 두 가지 주요 부분으로 구성됩니다:

  • 귀 (인과적 음악 인코더): 이 부분은 음악이 일어나는 대로만 듣습니다. 미래를 엿보지 않습니다. 음악을 두 가지 요소로 분해합니다:
    1. 비트: 춤추는 사람이 언제 발을 내딛어야 하는지 알려주는 디지털 "탭".
    2. 흐름: 춤추는 사람이 얼마나 빠르거나 느리게 움직여야 하는지 알려주는 부드러운 신호.
  • 몸 (모션 생성기): 이 부분은 "비트"와 "흐름" 신호를 받아 춤 동작으로 변환합니다. 복잡한 3D 신체 움직임을 단순하고 압축된 코드로 변환하기 위해 잠재 VAE(압축 도구) 를 사용합니다. 이로 인해 컴퓨터가 멈추지 않고 실시간으로 실행될 만큼 수학 연산이 빨라집니다.

4. "하이브리드" 전략

이 논문은 "하이브리드 시간 스케줄"을 소개합니다. 이는 AI 의 기억을 조절하는 디머 스위치와 같습니다.

  • 음악이 안정적일 때, AI 는 몇 초 전의 행동을 기억하여 춤을 부드럽게 유지하기 위해 기억에 더 의존합니다.
  • 음악이 갑자기 변할 때 (예: 곡의 갑작스러운 드롭), AI 는 과거의 기억을 "어둡게" 하고 새로운 음악에 초점을 "밝게" 하여 즉시 새로운 리듬에 맞춰질 수 있게 합니다.

5. 실제 세계 테스트: 화면에서 로봇까지

저자들은 이를 컴퓨터 화면에서만 테스트한 것이 아니라, 실제 세계에서 작동함을 증명하기 위해 전체 시스템을 구축했습니다.

  • 가상 아바타: 시스템을 게임 엔진 (Unity) 에 연결하여 디지털 캐릭터가 재생하는 음악에 맞춰 실시간으로 춤을 추도록 했습니다.
  • 실제 로봇: 또한 Unitree G1 휴머노이드와 같은 실제 로봇으로 춤 동작을 전송했습니다. 로봇은 AI 의 춤 지시를 성공적으로 받아 음악이 변함에 따라 균형과 발걸음을 조정하며 실제로 수행했습니다.

요약

DiscoForcing은 새로운 비트에 빠르게 반응하고 춤이 경직되지 않도록 부드럽게 유지하는 두 가지 상충되는 요구 사항을 균형 있게 조절하여 캐릭터가 라이브 음악에 맞춰 춤추도록 가르치는 시스템입니다. 이는 AI 가 곡의 전체적인 흐름을 기억하면서도 현재 순간에 집중할 수 있게 해주는 특별한 "흐릿한 기억" 기법을 사용하며, 라이브 라디오 스트림에 맞춰 빠르게 실행될 수 있도록 합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →