← 최신 논문
💻 computer science

GestureFM : Compact Latent Flow Matching for Low-Latency Co-Speech Body-Motion Generation

GestureFM은 SMPL-X 포즈를 잠재 공간으로 압축하고 청크 경계의 불연속성을 해결하기 위해 경량화된 스무더(smoother)를 채택함으로써, 최소한의 첫 번째 청크 지연 시간으로 경쟁력 있는 모션 품질을 달성하며 저지연 고품질의 코스피치(co-speech) 바디 모션 생성을 가능하게 하는 콤팩트한 잠재 플로우 매칭(latent Flow Matching) 프레임워크입니다.

원저자: Jie Liu, Tianmei Sun, Zian Liu

게시일 2026-08-14
📖 4 분 읽기☕ 가벼운 읽기

원저자: Jie Liu, Tianmei Sun, Zian Liu

원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

친구와 대화를 나누고 있다고 상상해 보세요. 대화를 하는 동안 당신의 손, 팔, 그리고 몸이 자연스럽게 말에 맞춰 춤을 춥니다. 이것을 "언어 동반 제스처(co-speech gesture)"라고 부르며, 이는 인간이 소통하는 방식의 매우 큰 부분입니다. 이제, 똑같이 행동하고 싶어 하는 비디오 게임 캐릭터나 가상 비서가 있다고 상상해 보세요. 문제는 컴퓨터가 당신의 목소리를 듣고, 당신이 무엇을 말하는지 파악한 다음, 즉각적으로 캐릭터의 몸을 그에 맞춰 움직여야 한다는 것입니다. 하지만 여기 함정이 있습니다. 만약 컴퓨터가 당신이 문장을 완전히 마칠 때까지 기다렸다가 움직이기 시작한다면, 캐릭터는 항상 한 발짝 뒤처지는 로봇처럼 보일 것입니다. 실감 나게 느껴지려면, 캐릭터는 당신이 여전히 말하고 있는 동안에도 움직이기 시작해야 합니다. 이것이 바로 "저지연 스트리밍 생성(low-latency streaming generation)"의 세계, 즉 디지털 휴먼이 지연 없이 실시간으로 움직이게 만드는 기술입니다.

이를 위해 과학자들은 특별한 수학적 기법을 사용합니다. 한 가지 기법은 "변이형 오토인코더(Variational Autoencoder, VAE)"인데, 이는 매우 효율적인 압축 앱과 같습니다. 이 기술은 거대하고 복잡한 3D 신체 움직임을 훨씬 다루기 쉬운 작고 단순한 코드("잠재 공간", latent space)로 압축합니다. 또 다른 기법인 "플로우 매칭(Flow Matching)"은 무작위한 낙서로부터 완벽한 그림을 향해 곧고 매끄러운 선을 그리는 것과 같습니다. 단계별로 그림을 추측하는 흐릿한 화가처럼 작동하는 대신, 플로우 매칭은 정확한 경로를 학습하여 컴퓨터가 최종 이미지를 매우 빠르게 그려낼 수 있게 합니다. 연구자들이 풀고자 하는 핵심 질문은 이것입니다: 이 도구들을 결합하여 우리가 말하는 동안에도 디지털 휴먼이 매우 빠르고 매끄럽게 움직여서 마치 실제로 그곳에 있는 것처럼 느끼게 만들 수 있을까?

바로 이 질문에 답하기 위해 등장한 것이 새로운 연구인 GestureFM입니다. 연구진인 류지에(Jie Liu), 쑨티엔메이(Tianmei Sun), 리우지안(Zian Liu)은 지연 시간이 거의 없는 방식으로 음성으로부터 신체 움직임을 생성하도록 설계된 시스템을 구축했습니다. 그들은 이 시스템이 "잠재(latent)" 공간 내부에서 "플로 매칭" 마법을 사용하기 때문에 "GestureFM"이라고 부릅니다.

이 시스템이 어떻게 작동하는지 간단한 비유를 통해 설명하겠습니다. 전화 통화로 친구에게 춤을 설명하려고 하는데, 한 번에 1초 분량의 짧은 음성 클립만 보낼 수 있다고 상상해 보세요. 당신의 친구는 지금까지 들은 내용을 바탕으로 즉시 춤을 추기 시작해야 합니다. GestureFM은 이 일에 매우 능숙한 "친구"입니다. 먼저, "Gesture VAE"를 사용하여 인간의 신체 움직임(예: 모든 관절의 각도)을 나타내는 복잡한 168차원의 움직임을 작은 44개 토큰 코드로 변환합니다. 이는 전체 길이의 영화를 몇 개의 빠른 스케치 노트로 바꾸는 것과 같습니다. 그다음, "오디오 조건부 플로우 매칭 트랜스포머(audio-conditioned Flow Matching Transformer)"는 당신의 목소리(구체적으로는 로그 멜 특징(Log-Mel features)이라 불리는 소리의 패턴)를 듣고, 그 스케치 노트를 사용하여 다음 1초간의 움직임을 그려냅니다.

그들의 발견 중 가장 흥러운 부분은 이 과정이 얼마나 빠르고 효율적인가 하는 점입니다. 연구팀은 첫 번째 움직임 덩어리(chunk)를 생성하는 데 단 **22밀리초(ms)**밖에 걸리지 않는다는 것을 발견했습니다. 이를 체감할 수 있도록 비교하자면, 이는 실시간 속도의 0.022배입니다. 즉, 컴퓨터가 실제 현실보다 약 45배 더 빠르게 작동하고 있다는 뜻이며, 이는 당신이 말하는 동안 움직임이 즉각적으로 일어날 수 있는 충분한 여유를 남겨줍니다.

또한 그들은 컴퓨터가 움직임을 그리기 위해 몇 번의 "단계(steps)"를 거쳐야 하는지도 테스트했습니다. 많은 AI 시스템에서는 단계를 더 많이 거칠수록 더 좋은 그림을 얻지만 속도는 느려집니다. 그러나 GestureFM은 놀라운 사실을 발견했습니다: 단계를 더 많이 거친다고 해서 움직임이 실제로 훨씬 더 좋아지지는 않았습니다. 단계를 2단계로 하든 32단계로 하든, 움직임의 품질(FGD 또는 프레셰 제스처 거리로 측정됨)은 거의 동일하게 유지되었습니다. 이 때문에 그들은 품질 저하 없이 가장 빠른 속도를 얻기 위해 단 2단계(K=2)를 사용하는 것을 권장합니다.

하지만 한 가지 작은 결함이 있었습니다. 시스템이 움직임을 1초 단위의 덩어리로 생성하기 때문에, 한 덩어리와 다음 덩어리 사이의 전환이 때때로 영상이 끊기는 것처럼 약간 끊기는 느낌을 줄 수 있었습니다. 이를 해결하기 위해 그들은 "7프레임 로컬 스무더(7-frame local smoother)"를 추가했습니다. 이것은 한 초의 움직임 끝부분과 다음 초의 시작 부분을 부드럽게 블렌딩하는 아주 작은 편집자와 같습니다. 이 간단한 처방은 음악의 리듬에 맞춘 춤의 타이밍을 해치지 않으면서도 "속도 급변(velocity jump)"(갑작스러운 끊김 현상)을 85% 감소시켜 움직임을 훨씬 더 매끄럽게 만들었습니다.

연구진은 더 개선할 수 있는지 확인하기 위해 다른 아이디어들도 테스트해 보았지만, 몇 가지는 제외했습니다. 예를 들어, 이전 움직임 덩어리의 끝을 다음 덩어리로 전달함으로써 시스템에 "기억력"을 부여하는 방법을 시도했습니다. 불행히도, 이 방법은 움직임의 품질을 훨씬 더 악화시켰습니다(FGD 점수가 0.253에서 1.740으로 급증했습니다). 그들은 시스템이 완벽한 실제 세계의 움직임 데이터로 학습되었는데, 테스트 중에 자신의 "기억"을 사용하려고 할 때 스스로의 실수에 혼란을 겪었기 때문이라는 것을 깨달았습니다. 따라서 그들은 당분간 각 덩어리를 독립적으로 유지하고 가장자리 문제를 해결하기 위해 스무딩 기법을 사용하는 것이 더 낫다고 결정했습니다.

결론적으로, GestureFM은 문장이 끝날 때까지 기다릴 필요 없이 가상 인간을 위한 고품질의 저지연 신체 움직임을 생성할 수 있음을 보여줍니다. 데이터를 압축하고, 플로우 매칭을 사용하며, 간단한 스무딩 필터를 추가함으로써, 그들은 매우 빠르고(22ms 지연 시간) 정확하며, 말의 리듬과 완벽하게 일치하는 시스템을 달성했습니다. 이는 디지털 휴먼이 단순히 말을 하는 것을 넘어, 실시간으로 우리와 함께 움직이게 만드는 큰 진전입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →