← 최신 논문
💻 computer science

InteractGesture: Progressive Chunk Guidance for Continuous Streaming Co-Speech Gesture Control

이 논문은 경계 불일치 문제를 해결하기 위해 청크 경계를 가로질러 제어 그래디언트를 전파함으로써, 연속적인 스트리밍 시나리오에서 미세하고 공간적으로 제어 가능한 동시 발화 제스처 생성을 가능하게 하는 점진적 청크 가이드(Progressive Chunk Guidance)를 사용하는 모델 불가지론적 추론 시점 방법인 InteractGesture를 소개한다.

원저자: Ekkasit Pinyoanuntapong, Ajinkya Deogade, Paul Streli, Wenjing Zhang, Joanna Materzynska, Pu Wang, Vittorio Ferrari, Jie Shen

게시일 2026-08-27
📖 3 분 읽기☕ 가벼운 읽기

원저자: Ekkasit Pinyoanuntapong, Ajinkya Deogade, Paul Streli, Wenjing Zhang, Joanna Materzynska, Pu Wang, Vittorio Ferrari, Jie Shen

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

디지털 휴먼이 당신에게 말을 걸고 있다고 상상해 보십시오. 그 입술은 말하는 단어에 맞춰 완벽하게 움직이고, 손은 강조점을 두기 위해 자연스럽게 몸짓을 합니다. 수년 동안 과학자들은 컴퓨터가 오디오를 듣고 이러한 움직임을 생성하도록 가르쳐 왔으며, 그 결과 놀라울 정도로 사실적인 움직임과 대화가 가능한 캐릭터를 만들어냈습니다. 하지만 중대한 한계가 지속되어 왔습니다. 컴퓨터가 캐릭터를 흔들거나 어깨를 으쓱하게 하는 방법은 알고 있지만, 그 손이 공간의 정확히 어디에 닿아야 하는지는 지시받을 수 없다는 점입니다. 만약 애니메이터가 캐릭터의 오른손목이 탁자 위의 특정 물체에 닿게 하거나, 팔꿈치가 장애물을 피하기 위해 정밀한 경로를 따라가도록 하고 싶다면, 기존 기술은 이를 따를 수 없었습니다. 움직임은 전체로서 생성되었기에, 개별 신체 부위의 구체적인 위치는 명령이 아닌 우연에 맡겨졌습니다. 자연스러운 음성 기반 동작과 정밀한 공간 제어 사이의 이러한 간극은 진정으로 상호작나적인 가상 에이전트를 만드는 데 있어 주요한 장애물이었습니다.

Meta와 노스캐롤라이나 대학교 샬럿 캠퍼스의 연구진이 도입한 새로운 접근 방식인 InteractGesture는 이러한 간극을 메웁니다. 이 시스템은 컴퓨터가 음성에 기반하여 캐릭터의 제스처를 생성하는 동시에, 손목이나 팔꿈치와 같은 특정 관절이 반드시 가야 할 위치에 대한 엄격한 지시를 준수할 수 있게 해줍니다. 연구진은 컴퓨터의 움직임 생성기를 부드럽게 조종할 수 있는 '블랙박스'로 취급했습니다. 시스템 전체를 다시 훈련시키거나 내부의 '두뇌'를 변경하는 대신, 연구진은 실시간으로 컴퓨터의 예측치를 조정했습니다. 시스템이 움직임을 계획하면, 연구진은 그 계획을 3D 골격으로 디코딩하고, 손이 올바른 위치에 있는지 확인한 뒤, 만약 그렇지 않다면 계획을 원하는 위치 쪽으로 밀어 넣어 최종 확정하기 전까지 수정했습니다. 이 과정은 매우 빠르게 일어나기 때문에, 컴퓨터는 음성의 자연스러운 리듬과 사용자의 공간적 지시라는 엄격한 요구 사이에서 균형을 잡는 법을 배웁니다.

음성이 짧은 클립이 아니라 긴 대화처럼 연속적인 경우, 도전 과제는 훨씬 더 어려워집니다. 컴퓨터는 일반적으로 긴 오디오를 작고 겹치는 세그먼트(chunk) 단위로 처리합니다. 과거에는 한 세그먼트가 생성되면 그것은 고정되었습니다. 만약 사용자가 캐릭터의 손이 다음 세그먼트에서 특정 목표물에 도달하기를 원하더라도, 컴퓨터는 이전 세그먼트의 움직임을 조정하여 전환을 매끄럽게 만들 수 없었습니다. 이는 종-종 손이 갑자기 위치로 툭 튀어 오르는 듯한 부자연스럽고 끊기는 현상을 초래했습니다. 연구진은 이러한 과거 움직임의 경직된 고정이 오류의 주요 원인임을 파악했습니다. 이를 해결하기 위해 그들은 '점진적 청크 가이드(Progressive Chunk Guidance)'라고 불리는 전략을 개발했습니다. 과거를 고정하는 대신, 이 방식은 최근의 움직임들을 편집 가능한 작은 창(window)으로 유지합니다. 새로운 오디오가 들어옴에 따라, 시스템은 이전 세그먼트의 맥락을 지속적으로 업데이트하여, 미래의 지시가 과거의 움직임을 더 매끄러운 정렬을 향해 부드럽게 밀어낼 수 있도록 합니다. 이는 마치 영화를 촬영하면서 동시에 편집하는 것과 같습니다. 감독은 전체 영화가 완성될 때까지 기다릴 필요 없이, 다음 단계가 완벽하게 착지할 수 있도록 배우의 이전 발걸음을 조정할 수 있습니다.

이 접근 방식의 결과는 기록된 인간의 음성과 움직임이 담긴 대규모 데이터셋을 통해 테스트되었습니다. 연구팀은 이들의 새로운 방식을 기존의 기술들과 비교했습니다. 기존 기술에는 움직임이 이미 생성된 후에 관절을 강제로 위치시키려는 일반적인 방식과, 각 세그먼트를 독립적으로 제어하려는 방식이 포함되었습니다. 기존 방식들은 움직임이 뻣뻣하거나 부자연스러워 보이거나, 목표 위치에 정확히 도달하지 못해 때로는 거의 20센티미터 가까이 오차가 발생하기도 했습니다. 반면, 새로운 방식은 원래의 음성 기반 제스처가 가진 유동적이고 자연스러운 특성을 유지하면서도 평균 6센티미터 남짓한 오차만을 기록했습니다. 시스템은 캐릭터의 손을 특정 지점으로 안내하고, 팔의 복잡한 경로를 추적하며, 심지어 캐릭터가 특정 방향을 가리키도록 방향을 설정하는 데 성공하면서도, 움직임의 타이밍을 목소리와 완벽하게 동기화했습니다.

이 연구는 음성 기반 애니메이션의 자연스러운 흐름과 인간 애니메이터의 정밀한 제어를 동시에 갖추는 것이 가능하다는 것을 보여줍니다. 컴퓨터가 생성하는 과정에서 스스로 계획을 다듬게 하고, 미래의 지시에 적응할 수 있도록 최근의 과거를 유연하게 유지함으로써, 연구진은 움직임의 생생한 품질을 희생하지 않으면서도 사용자의 공간 명령을 존중하는 시스템을 만들어냈습니다. 이러한 발견은 디지털 휴먼이 곧 실제 배우와 같은 수준의 세밀한 지시를 받을 수 있으며, 이전에는 도달하기 어려웠던 정밀도로 가상 물체와 상호작용하고 복잡한 환경을 탐색할 수 있음을 시사합니다. 연구진은 자신들의 도구를 다른 이들도 사용할 수 있도록 공개하였으며, 이는 향에 더욱 상호작용적이고 반응적인 가상 비서와 캐릭터를 위한 문을 열어주었습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →