← 최신 논문
💻 computer science

OMG: Omni-Modal Motion Generation for Generalist Humanoid Control

이 논문은 언어, 오디오 및 참조 동작을 조건으로 하여 최첨단 수준의 옴니 모달 전신 동작 생성을 가능하게 하는, 계층적 구조와 세심하게 큐레이션된 데이터셋을 결합한 범용 휴머노이드 제어를 위한 확장 가능한 확산 기반 프레임워크인 OMG를 제시한다.

원저자: Siqiao Huang, Kun-Ying Lee, Dongming Qiao, Guanqi He, Zhenyu Wang, Yitang Li, Shaoting Zhu, Hang Zhao

게시일 2026-06-10
📖 4 분 읽기☕ 가벼운 읽기

원저자: Siqiao Huang, Kun-Ying Lee, Dongming Qiao, Guanqi He, Zhenyu Wang, Yitang Li, Shaoting Zhu, Hang Zhao

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. ✨ 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

핵심 아이디어: 로봇을 위한 뇌와 소뇌

휴머노이드 로봇(이 연구에서 사용된 Unitree G1과 같은)이 춤을 추거나, 걷거나, 손을 흔드는 법을 배우려고 한다고 상상해 보세요. 전통적으로 엔지니어들은 개에게 '앉아'나 '기다려'를 가르치는 것처럼, 한 번에 하나의 특정 기술을 로봇에게 가르쳐야 했습니다. 만약 로봇이 새로운 동작을 수행하게 하고 싶다면, 대개 처음부터 다시 시작하거나 복잡한 규칙을 작성해야 했습니다.

이 논문의 저자들은 인간의 몸이 작동하는 방식에서 영감을 얻어 다른 접근 방식을 제안합니다. 그들은 로봇의 제어 시스템을 두 부분으로 나눕니다:

  1. 뇌 (OMG-DiT): 이것은 "설계자(planner)"입니다. 높은 수준의 아이디어(예: "손을 흔들어라" 또는 음악 재생)를 받아들여 로봇이 다음에 무엇을 해야 할지 결정합니다.
  2. 소뇌 (Motion Tracker): 이것은 "근육 기억(muscle memory)"입니다. 뇌로부터 받은 계획을 바탕으로 로봇의 관절이 실제로 부드럽게 움직이고 넘어지지 않도록 조절합니다.

이 논문은 동시에 다양한 유형의 명령을 이해할 수 있는 훨씬 더 똑똑한 "뇌"를 구축하는 데 중점을 둡니다.

문제점: 너무 많은 방언, 부족한 데이터

이 논문 이전의 로봇 동작 데이터는 마치 페이지가 누락되었거나 낙서가 되어 있는, 서로 다른 언어로 쓰인 책들이 가득한 도서관과 같았습니다.

  • 어떤 데이터에는 텍스트 설명이 있었습니다.
  • 어떤 데이터에는 음악이 있었습니다.
  • 어떤 데이터에는 인간이 춤추는 영상이 있었습니다.
  • 하지만 그 어떤 것도 로봇이 실제로 사용할 수 있는 형식으로 되어 있지 않았습니다.

이를 해결하기 위해 팀은 OMG-Data를 만들었습니다. 이것은 거대한 번역 및 편집 프로젝트라고 생각하면 됩니다. 그들은 다양한 출처로부터 1,000시간 이상의 동작 데이터를 수집하고, 이를 정제했으며, 모든 것을 특정 로봇(Unitree G1)의 "언어"로 번역했습니다. 심지어 물리 시뮬레이터를 사용하여 로봇이 동작을 수행하는 동안 넘어지거나 자신의 관절을 망가뜨리지 않는지 모든 움직임을 하나하나 확인했습니다.

해결책: "옴니 모달(Omni-Modal)" 생성기

그들의 시스템의 핵심은 OMG-DiT라고 불립니다. 이것은 범용 번역기이자 창의적인 디렉터가 결합된 형태라고 볼 수 있습니다.

작동 방식:
당신이 파티에 있다고 상상해 보세요.

  • 텍스트 입력: 누군가 "앞으로 걸어!"라고 외칩니다. 뇌는 이를 이해하고 걷는 경로를 계획합니다.
  • 오디오 입력: 누군가 힙합 비트를 틉니다. 뇌는 리듬을 듣고 그 비트에 맞는 춤을 계획합니다.
  • 시각적 입력: 누군가 팔을 흔듭니다. 뇌는 그 움직임을 보고 따라 하는 계획을 세웁니다.
  • 결합 입력: 누군가 음악을 틀면서 "이 비트에 맞춰 춤춰!"라고 말합니다. 뇌는 단어의 의미와 음악의 리듬을 결합하여 독특한 춤을 만들어냅니다.

OMG의 마법은 새로운 유형의 명령이 나올 때마다 매번 다시 학습할 필요가 없다는 점에 있습니다. 이 모델은 이미 로봇의 움직임에 대한 일반적인 규칙을 학습한 "공통 백본(shared backbone, 중앙 신경망)"을 사용합니다. 새로운 유형의 명령(예: 새로운 센서나 새로운 언어)이 들어오면, 그 새로운 입력을 기존의 뇌와 연결하기 위해 작고 가벼운 "어댑터(adapter)"를 추가하기만 하면 됩니다.

주요 성과 (증명된 내용)

  1. "파운데이션 모델(Foundation Model)"입니다: 거대 언어 모델(LLM)이 방대한 양의 텍스트를 학습하여 에세이, 코드, 시를 쓸 수 있는 것처럼, 이 모델은 방대한 양의 동작 데이터를 학습했습니다. 이 덕분에 아주 적은 추가 학습만으로도 새로운 작업을 처리할 수 있습니다.

    • 비유: 만약 사람이 자전거 타는 법을 배웠다면, 자전거를 한 번도 타본 적 없는 사람보다 스케이트보드를 훨씬 빠르게 배울 수 있습니다. 이 로봇도 마찬가지입니다.
  2. 제로샷 조합 (Zero-Shot Composition): 이 모델은 이전에 함께 본 적 없는 명령들을 서로 섞고 조합할 수 있습니다.

    • 예시: 만약 텍스트 명령에 따라 걷는 법과 음악에 맞춰 춤추는 법을 각각 따로 학습했다면, 모델은 "앞으로 걸으면서" 특정 노래에 맞춰 춤을 추라는 명령을 받았을 때, 비록 훈련 과정에서 그 정확한 조합을 본 적이 없더라도 성공적으로 수행할 수 있습니다.
  3. 실제 환경에서의 실행: 그들은 단순히 컴퓨터 시뮬레이션에 그치지 않았습니다. 이 시스템을 실제 Unitree G1 로봇에 적용했습니다. 로봇은 오디오를 듣고, 텍스트를 읽고, 인간을 관찰하여 즉시 실시간으로 넘어지지 않고 움직이기 시작했습니다.

결과를 쉬운 언어로 설명하자면

  • 더 나은 품질: 텍스트나 음악을 기반으로 움직이라고 요청했을 때, 그들의 로봇은 기존 방식보다 더 자연스럽고 정확하게 움직였습니다.
  • 빠른 적응력: 로봇에게 새로운 기술(예: "Pico"라는 특정 핸드 트래킹 센서 따르기)을 가르치려 했을 때, 사전 학습된 모델은 매우 적은 데이터만으로 몇 분 만에 이를 학습했지만, 처음부터 학습한 모델은 어려움을 겪으며 훨씬 더 많은 데이터를 필요로 했습니다.
  • 확장성: 그들은 "뇌"를 더 크게 만들수록(더 많은 컴퓨팅 파워를 추가할수록) 로봇이 더 잘 움직인다는 것을 발견했습니다. 이는 데이터와 성능을 추가함에 따라 이 접근 방식이 계속해서 더 똑똑해질 수 있음을 시사합니다.

요약

이 논문은 휴머노이드 로봇에게 "범용적인 뇌"를 부여하는 시스템인 OMG를 제시합니다. 모든 동작을 일일이 코딩하는 대신, 로봇은 1,000시간 이상의 데이터를 통해 움직임의 보편적인 언어를 학습합니다. 이를 통해 로봇은 텍스트, 오디오 또는 인간의 움직임을 통해 명령을 받고, 이를 조합하여 실제 로봇이 실행할 수 있는 안전한 물리적 동작을 즉각적으로 생성할 수 있습니다. 이는 로봇이 인간만큼 유연하게 세상에 반응하고 이해할 수 있는 단계로 나아가는 발걸음입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →