← 최신 논문
💻 computer science

Mitigating Error Accumulation in Co-Speech Motion Generation via Global Rotation Diffusion and Multi-Level Constraints

본 논문은 전역 관절 회전 공간에서 직접 작동하고 구조적 무결성과 시간적 일관성을 보장하기 위해 다단계 제약 체계를 채택함으로써, 장기 호라이즌의 코스피치 제스처 생성에서 발생하는 오차 누적을 완화하는 새로운 확산 기반 프레임워크인 GlobalDiff를 소개한다.

원저자: Xiangyue Zhang, Jianfang Li, Jianqiang Ren, Jiaxu Zhang

게시일 2026-08-18
📖 3 분 읽기☕ 가벼운 읽기

원저자: Xiangyue Zhang, Jianfang Li, Jianqiang Ren, Jiaxu Zhang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

가상의 캐릭터가 당신에게 말을 건다고 상상해 보십시오. 대화가 실감 나게 느껴지려면 캐릭터는 단순히 입만 움직여서는 안 됩니다. 어깨가 움직이고, 손이 제스처를 취하며, 목소리의 리듬과 감정에 맞춰 자세가 변해야 합니다. 이것이 바로 코스피치 모션 생성(co-speech motion generation)의 목표입니다. 즉, 컴퓨터가 말하는 단어와 자연스럽게 동기화되는 전신 움직임을 만들도록 가르치는 것입니다. 수년 동안 연구자들은 디지털 골격을 구축함으로써 이 문제를 해결하려고 노력해 왔습니다. 여기서 손의 움직임은 어깨, 팔꿈치, 손목의 회전값을 더하여 계산됩니다. 이 방식은 뼈가 어떻게 연결되어 있는지를 모방하지만, 숨겨진 결함이 있습니다. 긴 줄을 선 사람들이 메시지를 전달할 때 작은 실수 하나가 결국 완전히 잘못된 메시지로 이어질 수 있는 것처럼, 어깨의 회전을 계산할 때 발생하는 아주 작은 오차는 팔을 따라 내려가면서 점점 더 커질 수 있습니다. 컴퓨터가 손가락 끝의 위치를 계산할 때쯤이면, 그 오차가 너무 커져서 손이 뒤틀리거나, 부러지거나, 불가능한 방식으로 공중에 떠 있는 것처럼 보일 수 있습니다.

알리바바 그룹(Alibaba Group)과 난양공과대학교(Nanyang Technological University)의 연구팀은 이 문제를 해결하기 위해 기존의 연쇄 반응 방식에서 완전히 벗어난 새로운 방법을 제안했습니다. 각 관절이 이전 관절에 대해 어떻게 회전하는지를 계산하는 대신, 그들의 새로운 시스템인 '글로벌디프(GlobalDiff)'는 방 안의 모든 단일 관절이 향할 최종 방향을 동시에 결정합니다. 이는 팔꿈치에게 어깨를 기준으로 어디를 향할지 알려주는 것이 아니라, 모든 관절에게 세상의 어느 지점을 향할지 정확히 알려주는 것과 같습니다. 이러한 접근 방식은 작은 오류들이 쌓이는 것을 막아주어, 길고 표현력이 풍선 대화 중에도 손과 발이 안정적이고 정확하게 유지되도록 합니다. 하지만 모든 관절에 완전한 자유를 주는 것은 새로운 위험을 초am합니다. 캐릭터가 인간의 신체가 물리적으로 도달할 수 없는 모양으로 팔다리를 뒤틀 수 있기 때문입니다. 이를 해결하기 위해 연구진은 뼈의 길이를 적절하게 유지하고, 사지 사이의 각도가 타당하며, 움직임이 시간이 흐름에 따라 매끄럽게 이어지도록 확인하는 가이드 역할을 하는 일련의 보이지 않는 규칙들을 추가했습니다.

연구진은 1,700개 이상의 대화 시퀀스를 포함하는 대규모 기록 대화 모음집을 통해 이 새로운 시스템을 테스트했습니다. 그들은 관절의 글로벌 방향을 직접 예측함으로써, 컴퓨터가 기존 방식보다 훨씬 더 안정적인 움직임을 생성할 수 있다는 것을 발견했습니다. 테스트 결과, 이 새로운 시스템은 기존의 가장 우수한 도구들과 비교했을 때 최종 동작의 오류를 46% 감소시켰습니다. 결과를 자세히 살펴보면 차이는 명확했습니다. 기존 시스템에서는 손가락이 뒤집히거나 손이 몸에서 멀어지는 경우가 빈번했습니다. 반면 새로운 방식에서는 손이 자연스러운 위치를 유지했으며, 제스처가 화자의 목소리와 정밀하게 일치하여 인간다운 느낌을 주었습니다. 또한 이 시스템은 화자가 남성이든 여성인지, 혹은 원어민인지 아니면 다른 억양을 가진 사람인지에 관계없이 높은 품질을 유지하며 다양한 화자를 처리하는 법을 학습했습니다.

움직임이 단순히 안정적인 것을 넘어 물리적으로도 가능하도록 하기 위해, 팀은 세 가지 단계의 점검 체계를 도입했습니다. 첫째, 각 관절 주변에 가상의 마커를 배치하여 회전이 정밀하게 이루어지도록 함으로써 사지가 부자연스럽게 뒤틀리는 것을 방지했습니다. 둘째, 모든 뼈 사이의 각도를 측정하여 골격이 온전하게 유지되도록 했으며, 이를 통해 캐릭터가 척추나 사지를 불가능한 방향으로 굽히는 것을 방지했습니다. 셋째, 움직임의 타이밍을 분석하여 제스처가 대사의 리듬과 함께 흐르도록 하여, 동작이 끊기거나 불규칙해지는 것을 피했습니다. 연구진이 이 점검 단계들을 하나씩 제거했을 때 움직임의 품질이 현저히 떨어졌으며, 이는 세 가지 층위의 점검이 설득력 있는 결과를 만드는 데 모두 필요하다는 것을 증명했습니다.

이 연구는 오랫동안 이 분야를 괴롭혀온 오류의 누적 없이도 가상 캐릭터를 위한 사실적인 장기 바디랭귀지를 생성하는 것이 가능하다는 것을 보여줍니다. 전체 신체를 엄격한 물리적 규칙에 의해 유도되는 독립적인 부분들의 집합으로 다룸으로써, 연구진은 매끄럽고 해부학적으로 정확하며 표현력이 풍부한 동작을 만들어내는 시스템을 구축했습니다. 이 작업은 가상 아바타의 미래가 실패하기 쉬운 복잡한 계산 체인에 의존하는 것이 아니라, 신체의 각 부분이 공간에서 어떻게 움직여야 하는지에 대한 직접적이고 글로벌한 이해에 달려 있을 수 있음을 시사합니다. 그 결과, 인간과 기계 사이의 원활한 상호작용에 한 걸음 더 다가가는 자연스러운 움직임과 언어를 갖춘 디지털 존재가 탄생했습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →