← 최신 논문
💻 computer science

GestureLSM: Latent Shortcut based Co-Speech Gesture Generation with Spatial-Temporal Modeling

GestureLSM은 신체 부위 간의 시공간적 상호작용을 모델링하고 잠재적 지름길 학습(latent shortcut learning)을 도입하여 기존 방식보다 추론 속도를 크게 가속화함으로써 고품질의 일관된 전신 코스피치 제스처를 생성하는 새로운 플로우 매칭 기반 프레임워크이다.

원저자: Pinxin Liu, Luchuan Song, Junhua Huang, Haiyang Liu, Junfan Zhu, Chenliang Xu

게시일 2026-08-18
📖 4 분 읽기☕ 가벼운 읽기

원저자: Pinxin Liu, Luchuan Song, Junhua Huang, Haiyang Liu, Junfan Zhu, Chenliang Xu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

대화의 고요한 순간, 말만으로는 불충분하다고 느껴질 때 인간의 몸은 자신만의 언어로 말합니다. 어깨를 으쓱하거나, 손을 휘두르거나, 자세를 바꾸는 등의 동작은 종종 발화되는 문장만큼이나 많은 무게를 담아냅니다. 이러한 움직임은 무작위적인 것이 아닙니다. 그것은 손, 팔, 그리고 몸통이 감정과 의미를 전달하기 위해 통일된 리듬 속에서 움직이는, 정교하게 짜인 타이밍과 협응의 태피스트리입니다. 수십 년 동안 과학자들과 엔지니어들은 컴퓨터가 이 침묵의 대화를 재현하도록 가르치려 노력해 왔으며, 이를 통해 디지털 아바타에 실제 사람에게서 발견되는 것과 같은 자연스러운 유동성을 부여하고자 했습니다. 도전 과제는 항상 두 가지였습니다. 진정으로 인간처럼 보이는 움직임을 만드는 것, 그리고 이를 실시간으로 일어날 만큼 빠르게 수행하는 것이었습니다. 이전의 시도들은 종 often 신체를 별개의 부분들의 집합체로 취급하여, 다리를 고려하지 않은 채 팔을 움직이거나 얼굴을 고려하지 않은 채 손을 움직이는 식이었고, 그 결과 제스처가 조각나고 기계적으로 느껴지게 만들었습니다. 더욱이, 이러한 동작을 생성하는 데 필요한 복잡한 수학적 계산은 대개 실시간 상호작용에 사용하기에는 너무 오래 걸렸고, 이는 기술이 할 수 있는 것과 사람들이 필요로 하는 것 사이의 간극을 남겼습니다.

이제 한 연구팀이 GestureLSM이라 불리는 새로운 시스템을 통해 이 간극을 메웠습니다. 이 시스템은 음성과 텍text 스크립트로부터 전신 인간 제스처를 높은 품질과 실시간 속도로 생성하도록 설계되었습니다. 이들의 혁신의 핵심은 인체를 바라보는 관점에 있습니다. 시스템은 인체를 하나의 거대한 덩어리나 격리된 사지들의 집합으로 보는 대신, 손과 몸통의 관계와 같이 서로 다른 영역 간의 상호작용을 명시적으로 모델링합니다. 컴퓨터에게 제스처란 신체 부위들 간의 대화라는 점을 가르침으로써, 시스템은 일관성 있고 자연스러운 움직임을 만들어냅니다. 사람이 "전적으로 동의합니다"라고 말할 때, 시스템은 손가락이 가리키거나, 팔이 뻗어지거나, 몸통이 약간 움직이는 등 이 모든 요소가 메시지를 강화하기 위해 함께 작동해야 함을 이해합니다. 이러한 접근 방식은 신체 부위들이 서로 독립적으로 움직이는 것처럼 보였던 이전 방식들의 어색하고 비협응적인 움직임을 방지합니다.

이러한 수준의 협응을 달enc하기 위해, 연구진은 두 가지 뚜렷한 관계에 주목하는 모델을 구축했습니다. 첫째, 시스템은 단일 시점 내에서 신체 전체를 한꺼번에 살펴봄으로써 왼쪽 손의 위치가 오른쪽 손 및 머리와 비교했을 때 타당한지를 확인합니다. 그다음, 시스템은 시간이 흐름에 따라 신체가 어떻게 움직이는지를 추적하며 동작의 흐름을 살핍니다. 이러한 이중 초점 덕분에 시스템은 포즈의 구조적 균형과 제스처의 역동적인 진행 과정을 모두 학습할 수 있습니다. 그 결과, 미세한 기울임부터 크고 강조된 휘두름에 이르기까지, 말하는 단어와 완벽하게 동기화된 미묘한 뉘언스를 포착하는 디지털 퍼포먼스를 구현해 냅니다.

속도는 연구팀이 극복해야 했던 또 다른 주요 장애물이었습니다. 기존의 많은 시스템은 단 하나의 움직임을 정교화하기 위해 수십 번의 반복 계산을 요구하는 방식에 의존하는데, 이는 실제 사용 환경에는 너무 느린 과정입니다. 새로운 시스템은 움직임의 속도와 방향을 직접 모델링하는 다른 수학적 접근 방식을 사용하여 훨씬 적은 단계만으로 최종 결과에 도달할 수 있게 합니다. 그러나 연구진은 이 빠른 방식이 이론적으로는 유망하지만, 때때로 품질이 낮아지거나 여전히 시간이 너무 오래 걸린다는 것을 발견했습니다. 이를 해결하기 위해 연구진은 모델이 동작을 생성하는 과정에서 '지름길'을 학습할 수 있는 기술을 도입했습니다. 긴 경로를 따라 모든 작은 단계를 밟는 대신, 시스템은 여로의 매끄러움과 정확성을 유지하면서도 움직임의 목적지를 더 직접적으로 예측하는 법을 배웁니다. 또한, 시스템이 시간이 지남에 따라 학습하는 방식을 조정하여, 오류를 범할 가능성이 가장 높은 순간에 집중하도록 함으로써 출력의 품질을 더욱 향상시켰습니다.

이 새로운 접근 방식의 효과는 기록된 인간 제스처의 대규모 데이터셋을 사용하여 광범-한 기존 방식들과 비교 테스트되었습니다. 결과에 따르면, 새로운 시스템은 이전의 어떤 방식보다도 훨씬 더 현실적이고 음성과 잘 동기화된 제스처를 생성했습니다. 속도 측면에서 이 시스템은 문장 하나 분량의 제스처를 1초 미만에 생성할 수 있었는데, 이는 다른 기술들이 소요하는 몇 초 또는 몇 분의 시간과 비교했을 때 획기적인 개선입니다. 이 속도는 인터랙티브 디지털 아바타나 사용자에게 즉각적으로 반응할 수 있는 가상 비서와 같은 실시간 애플리케이션을 지원하기에 충분히 빠릅니다. 연구진은 또한 인간 참여자를 대상으로 연구를 진행하였으며, 참가자들은 일관되게 이 새로운 시스템의 제스처가 기존의 선도적인 기술들이 만들어낸 것보다 더 자연스럽고, 부드러우며, 타이밍이 잘 맞다고 평가했습니다.

이 연구의 함의는 단순히 디지털 캐릭터를 더 멋지게 만드는 것에 그치지 않습니다. 컴퓨터가 고품질의 실시간 제스처를 생성할 수 있게 함으로써, 이 기술은 가상 환경에서의 더욱 몰입감 있고 매력적인 상호작용을 위한 문을 열어줍니다. 엔터테인먼트, 교육, 혹은 커뮤니케이션을 막론하고, 인간과 같은 자연스러운 우아함으로 움직일 수 있는 아바타를 갖는 것은 우리가 디지털 공간을 경험하는 방식을 변화시킵니다. 연구진은 이 시스템을 사용하여 3D 신체 포즈를 생성한 후 이를 2D 영상에 투영함으로써, 특정 이야기나 애플리케이션에 맞춰 커스터마이징할 수 있는 애니메이션 캐릭터를 만드는 방식으로 그 잠재력을 입증했습니다. 음성을 실시간으로 유동적이고 표현력 있는 움직임으로 전환하는 이 능력은 인간-컴퓨터 상호작용 분야의 중요한 진전이며, 디지털 존재가 단지 언어를 통해서뿐만 아니라 신체의 완전하고 자연스러운 언어를 통해 우리와 소통할 수 있는 미래에 한 걸음 더 다가가게 합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →