← 최신 논문
💻 computer science

EchoMask: Speech-Queried Attention-based Mask Modeling for Holistic Co-Speech Motion Generation

본 논문은 모션-오디오 정렬 모듈과 음성 쿼리 어텐션 메커니즘을 사용하여 음성 특징을 기반으로 의미론적으로 중요한 모션 프레임을 선택적으로 마스킹함으로써 기존의 최첨단 방식들을 능가하는 새로운 홀리스틱 코스피치 제스처 생성 프레임워크인 EchoMask를 제시한다.

원저자: Xiangyue Zhang, Jianfang Li, Jiaxu Zhang, Jianqiang Ren, Liefeng Bo, Zhigang Tu

게시일 2026-08-18
📖 4 분 읽기☕ 가벼운 읽기

원저자: Xiangyue Zhang, Jianfang Li, Jiaxu Zhang, Jianqiang Ren, Liefeng Bo, Zhigang Tu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

컴퓨터 비전의 세계에서 연구자들은 기계가 인간의 움직임을 이해하고 재현하도록 가르치기 위해 끊임없이 노력하고 있습니다. 특히 도전적인 목표는 디지털 캐릭터가 말하는 단어와 완벽하게 조화를 이루며 몸, 손, 얼굴을 움직이는 '코스피치 모션(co-speech motion)'을 생성하는 것입니다. 이는 단순히 로봇이 손을 흔드는 것 이상의 문제입니다. 화가 났을 때 손에 힘이 들어가거나, 확신이 없을 때 어깨를 으쓱하는 것과 같이 사람들이 대화할 때 하는 미묘하고 무의식적인 몸짓을 포착하는 것에 관한 것입니다. 수년 동안 과학자들은 컴퓨터에게 이 기술을 가르치기 위해 '마스크 모델링(masked modeling)'이라 불리는 학습 기법에 의존해 왔습니다. 어떤 학생이 특정 단어들이 가려진 텍-스트를 읽으며 언어를 배우려고 노력하는 모습을 상상해 보십시오. 학생은 주변 문장의 맥락을 바탕으로 누락된 단어를 추측해야 합니다. 디지털 영역에서도 컴퓨터는 사람의 움직임이 담긴 영상을 보여주되, 그 움직임의 일부를 숨깁니다. 그러면 기계는 숨겨진 부분들이 원래 어떠했는지를 예측해야 하며, 이 과정을 통해 빈칸을 채우는 법을 익힘으로써 인간 움직임의 규칙을 배웁니다.

하지만 이 접근 방식에는 심각한 문제 하나가 발목을 잡고 있었습니다. 바로 컴퓨터가 움직임의 어느 부분을 숨기는 것이 중요한지 알지 못한다는 점입니다. 기존 방식들은 종종 무작위로 프레임을 숨기거나, 혹은 수학적으로 재구성하기 가장 어려운 부분을 숨기는데, 이는 어려움이 곧 중요성을 의미한다고 가정하기 때문입니다. 이는 결함이 있는 전략입니다. 인간의 언어에서 가장 의미 있는 몸짓은 반드시 수학적으로 재구성하기 까다로운 순간이 아니라, 단어의 리듬 및 의미와 일치하는 특정 순간에 발생합니다. 만약 컴퓨터가 잘못된 프레임을 숨긴다면, 컴퓨터는 잘못된 교훈을 얻게 되며, 그 결과 디지털 캐릭터는 뻣뻣하게 움직이거나 엉뚱한 타이밍에 몸짓을 하게 됩니다. 연구자들이 직면한 핵심 질문은, 움직임의 어떤 순간이 가장 중요한지를 식별하기 위해 '언어(speech)' 자체를 가이드로 사용할 수 있는가 하는 것이었습니다.

한 연구팀은 '에코마스크(EchoMask)'라는 새로운 프레임워크를 통해 이 과제를 해결했습니다. 이 시스템은 어떤 프레임을 숨길지 추측하는 대신, 음성을 사용하여 직접적인 질문을 던집니다. "이 움직임의 어느 부분이 말하는 내용과 가장 밀접하게 연결되어 있는가?" 이를 위해 연구진은 먼저 소리와 움직임 사이의 가교를 구축했습니다. 그들은 원시 오디오 데이터와 원시 움직임 데이터를 가져와 직접 비교할 수 있는 공유된 정신적 공간(shared mental space)으로 투영하는 시스템을 만들었습니다. 이 공간에서 컴퓨터는 단어의 소리를 그에 수반되는 특정 제스처와 정렬하는 법을 배우며, 목소리와 신체가 하나의 통합된 사건으로서 이해되는 통일된 표현을 만들어냅니다.

이러한 정렬이 확립되면, 시스템은 스포트라이트처럼 작동하는 메커니즘을 사용합니다. 시스템은 음성과 움직임 사이의 연결성을 분석하여 비디오의 모든 개별 프레임에 중요도 점수를 부여합니다. 핵심 단어를 강조하는 손짓과 같이 강력한 의미론적 의미를 담고 있는 프레임은 높은 점수를 받습니다. 시스템은 이 점수를 사용하여 학습 중에 무엇을 숨길지 결정합니다. 무작위로 프레임을 숨기는 대신, 가장 의미 있는 프레임을 선택적으로 숨김으로써 컴퓨터가 음성을 바탕으로 가장 중요한 제스처를 재구성하는 법을 강제로 학습하게 만듭니다. 이 과정은 시간이 지남에 따라 정교해집니다. 시스템은 처음에는 다소 느슨하게 프레임을 숨기다가 점차 더 정밀해지며, 표현의 결정적인 순간들에 집중하는 법을 확실히 배우도록 합니다.

이러한 접근 방식의 결과는 놀랍습니다. 기존 방식들과 비교 테스트했을 때, 새로운 시스템은 훨씬 더 현실적이고 오디오와 더 잘 동기화된 움직임을 생성했습니다. 시각적 비교에서 기존 모델들은 손이 힘없이 늘어져 있거나 화자의 의도와 상충하는 방향으로 움직이는 등 어색하거나 뻣뻣한 제스처를 생성하곤 했습니다. 반면, 새 시스템은 유연하고 표현력이 풍부한 동작을 생성하며 음성의 감정적 톤과 일치했습니다. 예를 들어, 화자가 "never(결코 ~않다)"라는 단어를 말할 때, 시스템은 생각에 잠긴 듯한 어조를 반영하여 양손을 몸통 근처에 차분하고 의도적인 자세로 정확히 위치시켰습니다. "drum(드럼)"이라는 단어가 나올 때는, 다른 모델들이 놓쳤던 디테일인 팔을 역동적인 호를 그리며 휘두르는 동작을 통해 단어의 리드미컬한 특성을 포착했습니다. 또한 시스템은 입술과 턱의 정밀한 움직임을 포착하여 특정 소리에 대응하는 뛰어난 얼굴 표정을 보여주었으며, 기존 방식에서 흔히 나타나는 뻣뻣하거나 타이밍이 맞지 않는 표정을 피했습니다.

단순히 보기 좋아진 것을 넘어, 이 시스템은 소리와 움직임 사이의 관계에 대한 더 깊은 이해를 보여주었습니다. 시스템의 내부 어텐션 맵(attention maps) 분석 결과, 시스템이 단어의 길게 늘어지는 음절이나 특정 명사에 가해지는 강조점과 같이 음성과 제스처가 일치하는 정확한 순간을 성공적으로 식별하고 집중했다는 것이 밝혀졌습니다. 이러한 고가치 프레임을 학습 중에 숨김으로써, 모델은 단순히 패턴을 암기하는 것이 아니라 인간 커뮤니케이션의 근본적인 논리를 학습하도록 강제되었습니다. 연구진은 광범위한 테스트를 통해 자신들의 방법이 사실성, 다양성, 타이밍 측면에서 기존의 최고 기술들을 능가한다는 것을 확인했습니다. 이 연구는 음성 자체가 학습 과정을 안내하게 함으로써, 컴퓨터가 마침내 자신들이 모방하고자 하는 인간과 같은 자연스럽고 표현력 있는 유창함으로 움직일 수 있음을 시사합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →