← 최신 논문
💻 computer science

OmniMotion-X: Versatile Multimodal Whole-Body Motion Generation

OmniMotion-X는 텍스트-투-모션(text-to-motion), 뮤직-투-댄스(music-to-dance), 스피치-투-제스처(speech-to-gesture)와 같은 다양한 작업에 걸쳐 사실적이고 일관되며 제어 가능한 전신 인간 동작을 생성하기 위해, 최대 규모의 통합 모션 데이터셋(OmniMoCap-X)으로 학습된 자기회귀 확산 트랜스포머(autoregressive diffusion transformer)와 새로운 참조 모션 컨디셔닝 전략을 활용하는 최첨단의 다재다능한 멀티모달 프레임워크입니다.

원저자: Guowei Xu, Yuxuan Bian, Ailing Zeng, Zhuo Chen, Mingyi Shi, Shaoli Huang, Wen Li, Lixin Duan, Qiang Xu

게시일 2026-07-21
📖 4 분 읽기☕ 가벼운 읽기

원저자: Guowei Xu, Yuxuan Bian, Ailing Zeng, Zhuo Chen, Mingyi Shi, Shaoli Huang, Wen Li, Lixin Duan, Qiang Xu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

로봇에게 춤을 가르치려 한다고 상상해 보세요. "왼팔을 움직여"라고 말할 수도 있고, 노래를 틀어주며 "이 비트에 맞춰 춤춰봐"라고 할 수도 있습니다. 하지만 만약 당신이 로봇이 이 모든 것을 한꺼번에 수행하기를 원한다면 어떻게 될까요? 노래를 듣고, 구전되는 이야기를 따라가며, 바닥의 특정 경로에 반응하면서도, 동시에 실제 사람처럼 자연스럽게 움직이는 모습을 보고 싶다면 어떨까요? 이것이 바로 컴퓨터 과학자들이 기계에게 기초부터 인간의 움직임을 창조하도록 가르치려는 분야인 '모션 생성(motion generation)'의 성배입니다. 오랫동안 이 로봇들은 서툰 초보자와 같았습니다. 음악에 맞춰 춤을 추거나 텍텍스트 프롬프트에 따라 연기할 수는 있었지만, 이 기술들을 혼합할 수는 없었습니다. 또한 이들은 마치 실제 수영 선수의 깨끗한 영상을 보는 대신, 사람들이 물에서 첨벙거리는 흐릿한 영상을 보며 수영을 배우는 것처럼, 지저받은 데이터로 학습되는 경우가 많았습니다. 연구자들이 던지는 핵심 질문은 이것입니다: "우리는 이 모든 다양한 지시를 한 번에 이해하고, 고품질의 데이터로부터 학습하며, 자신의 발에 걸려 넘어지지 않고 매끄럽고 현실적이며 지속적인 인간의 움직임을 만들어낼 수 있는 단 하나의 '두뇌'를 구축할 수 있을까?"

여기 OmniMotion-X가 등장합니다. 이 프로젝트는 디지털 움직임의 오케스트라를 지휘하는 초강력 지휘자 역할을 합니다. 이전의 모션 생성 AI 모델들을 하나의 악기만을 완벽하게 연주할 수 있는 솔로 연주자라고 생각해 보세요. 바이올린 솔로가 필요하면 하나의 모델을 부르고, 드럼 솔로가 필요하면 다른 모델을 불렀습니다. 그들은 함께 합주할 수 없었습니다. 그러나 OmniMotion-X는 통합된 "시퀀스 투 시퀀스(sequence-to-sequence)" 모델입니다. 이것을 단순히 대본(텍스트)을 읽거나 비트(음악)를 듣는 것뿐만 아니라, 이전 장면(참조 모션)을 보고 "좋아, 저들이 방금 어떻게 움직였는지에 기반하여, 다음에 어떻게 움직여야 하는지 정확히 알겠어"라고 말할 수 있는 숙련된 스토리텔러라고 상상해 보세요. 이 모델은 '디퓨전 트랜스포머(Diffusion Transformer)'라는 영리한 기술을 사용하는데, 이는 마치 노이즈와 정전기로 가득 찬 점토 블록에서 시작하여 완벽하고 유연한 춤이 나타날 때까지 천천히 노이즈를 깎아내는 조각가와 같습니다.

여기서의 비결은 연구자들이 모델을 가르친 방식에 있습니다. 로봇에게 모든 가능한 지시를 한꺼번에 던져주는 대신(그것은 마치 개에게 앉아, 기다려, 물어와, 굴러를 동시에 가르치는 것과 같습니다), 그들은 "이 이야기에 따라 몸을 움직여라"와 같은 단순한 개념부터 가르쳤습니다. 로봇이 기초를 익히고 나면, 그들은 "이제 이 특정 리듬에 맞춰라" 또는 "이제 이 정확한 경로를 따라라"와 같이 더 어려운 제약 조건들을 천천히 추가했습니다. 이러한 단계별 접근 방식은 로봇이 혼란에 빠지거나 압도당하는 것을 방지했습니다.

하지만 똑똑한 두뇌에는 좋은 데이터가 필요하며, 바로 이 지점에서 이 논문의 두 번째 절반이 빛을 발합니다. 연구진은 기존의 모션 데이터셋들이 서로 다른 상자에서 나온 뒤섞인 퍼즐 조각들과 같다는 점을 깨달았습니다. 어떤 것은 저품질의 추정치이고, 어떤 것은 일관되지 않은 설명이며, 그 중 어느 것도 서로 맞물리지 않았습니다. 이를 해결하기 위해 그들은 역대 가장 거대한 통합 모션 데이터셋인 OmniMoCap-X를 구축했습니다. 그들은 28개의 서로 다른 고품질 모션 캡처 소스(생각해 보세요, 이는 고성공 슈트를 입고 기록된 28개의 서로 다른 전문 무용단과 배우들입니다)를 모아 하나의 거대하고 완벽하게 조직된 라이브러리로 합쳤습니다. 그들은 로봇이 모든 움직임에 대해 동일한 "언어"(SMPL-X라고 불림)를 사용하도록 모든 것을 표준화했습니다. 심지어 고급 AI를 사용하여 이 움직임의 비디오를 관찰하고, 그 안에서 무슨 일이 일어나고 있는지에 대한 상세하고 구조화된 이야기를 작성함으로써, 로봇이 단순히 사람이 움직였다는 사실뿐만 아니라 '왜' 그리고 '어떻게' 움직였는지까지 이해하도록 했습니다.

결과는 인상적입니다. 텍스트를 춤으로 바꾸거나, 음성을 제스처로 바꾸거나, 사람이 다음에 무엇을 할지 예측하는 작업에서 테스트했을 때, OmniMotion-X는 이전의 모든 방법보다 뛰어난 성능을 보였습니다. 그것은 단순히 무작위로 팔다리를 휘두르는 것이 아니라, 비트에 맞춰 스텝을 맞추는 등 일관되고 현실적이며 오랫동안 무너지지 않고 지속되는 동작을 만들어냈습니다. 예를 들어, 노래에 기반하여 춤을 생성하라고 요청하면 단순히 무작위로 움직이는 것이 아니라 비트에 맞춰 스텝을 맞췄습니다. 만약 "참조 모션"(예: 걷는 사람의 클립)을 준다면, 그것은 그 걷기를 매끄럽게 이어가거나 새로운 지시에 따라 스타일과 흐름을 유지하면서 변화시킬 수 있었습니다.

하지만 제작자들은 자신들의 로봇이 여전히 할 수 없는 부분에 대해서도 솔직합니다. 단일 인물의 움직임에는 뛰어나지만, 그 사람이 복잡한 사물이나 다른 사람과 현실적으로 상호작용해야 할 때(예: 컵을 떨어뜨리지 않고 집어 들거나, 친구와 하이파이브를 하는 것 등)는 어려움을 겪습니다. 또한 다소 느려서, 단일 샘플을 생성하는 데 약 2.14초가 걸리는데, 이는 일부 더 단순한 모델들보다 느린 편입니다. 그러나 이 논문은 서로 다른 유형의 데이터를 통합하고 모델을 스마트한 단계별 방식으로 가르침으로써, 우리가 디지털 휴먼이 실제 인간처럼 우아하고 복잡하게 움직이도록 만드는 것에 훨씬 더 가까워질 수 있다는 것을 증명합니다. 아직 해결된 문제는 아니지만, 이는 기계에게 춤추고, 제스처를 취하고, 우리와 함께 움직이는 법을 가르치는 데 있어 거대한 도약입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →