← 최신 논문
💻 computer science

MotionMERGE: A Multi-granular Framework for Human Motion Editing, Reasoning, Generation, and Explanation

MotionMERGE는 정밀한 모션 편집, 생성 및 인간과 유사한 추론을 가능하게 하기 위해 세밀한 언어 기반 제어, 추론 인지형 사전 학습 전략, 대규모 세밀한 데이터셋을 도입함으로써 인간 모션 처리의 세분성 격차를 해소하는 통합 프레임워크입니다.

원저자: Bizhu Wu, Jinheng Xie, Wenting Chen, Zhe Kong, Jianfeng Ren, Linlin Shen, Ruibin Bai, Rong Qu

게시일 2026-05-20
📖 4 분 읽기☕ 가벼운 읽기

원저자: Bizhu Wu, Jinheng Xie, Wenting Chen, Zhe Kong, Jianfeng Ren, Linlin Shen, Ruibin Bai, Rong Qu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 춤을 추는 로봇을 가지고 있다고 상상해 보세요. 하지만 지금 이 로봇은 매우 포괄적이고 모호한 지시만 이해할 수 있습니다. "기분 좋게 춤을 춰"라고 말하면 일반적인 지그 춤을 추겠지만, "3 초 시점에 왼쪽 팔을 천천히 들어 올린 다음 오른발을 회전시켜"라고 말하면 로봇은 혼란을 겪고 실패합니다. 이는 특정 시간에 특정 신체 부위를 이해하는 '미세한 (fine-grained)' 능력이 부족하기 때문입니다.

이 논문인 "MotionMERGE" 는 이러한 문제를 해결하기 위해 고안된 새로운 시스템을 소개합니다. 이를 로봇의 두뇌를 큰 그림만 보는 '총괄 관리자'에서 각 댄서의 움직임을 정밀하게 지시할 수 있는 '안무가'로 업그레이드하는 것이라고 생각하세요.

다음은 이를 세 가지 간단한 부분으로 나누어 설명한 방법입니다:

1. 문제: "흐린 렌즈"

현재 인간 동작을 위한 AI 모델은 안개 낀 창문을 통해 영화를 보는 것과 같습니다. 전체 장면을 "사람이 걷고 있다"고 알려줄 수는 있지만, "사람이 왼쪽 다리를 절뚝이며 걷고 있다"와 같은 세부 사항에 초점을 맞출 수는 없습니다. 이러한 이유로 한 사람의 팔 움직임만 편집하거나 동작이 발생한 이유를 단계별로 설명하는 것과 같은 복잡한 작업을 수행할 수 없습니다.

2. 해결책: 세 부분으로 이루어진 업그레이드

연구진은 동작을 위한 스위스 아미 나이프처럼 작동하는 MotionMERGE 를 구축했습니다. 이는 세 가지 강력한 도구를 결합합니다:

  • 보편적 번역기 (프레임워크):
    "인간 언어 (영어)"와 "로봇 언어 (수학적 동작 데이터)"를 모두 구사하는 번역기를 상상해 보세요. 이전 번역기들은 어색하여 전체 춤 루틴을 하나의 큰 텍스트 블록으로 취급했습니다. MotionMERGE 는 춤을 작은 개별적인 '토큰'(개별 레고 블록과 같은) 으로 분해합니다. 이를 통해 AI 는 "오른쪽 팔 움직이기"가 "왼쪽 다리 움직이기"와 구별되는 특정 블록임을 이해할 수 있습니다. 이는 동작을 언어처럼 취급하여 텍스트와 동일한 유연성으로 읽고, 쓰고, 편집할 수 있게 합니다.

  • "사고하는" 교사 (RAGS 사전 학습):
    로봇에게 완성된 공연을 보여주기만 해서 춤을 추게 할 수는 없습니다. 동작 뒤에 숨겨진 논리를 배워야 합니다. 연구진은 RAGS(Reasoning-Ang Granularity-Synergy, 논리 인식 세분화 시너지) 라는 훈련 방법을 고안했습니다.

    • 비유: 학생에게 요리를 가르친다고 상상해 보세요. 단순히 레시피와 완성된 요리를 주는 대신, 당근보다 먼저 양파를 썰어야 하는 이유를 설명하고 정확히 2 분 후에 냄비를 확인하라고 강요합니다.
    • 작동 방식: AI 는 단순히 동작을 모방하는 것이 아니라 다음을 학습하도록 훈련됩니다:
      1. 시간 기반화: "5 초에"라는 말이 "춤을 추는 동안 어딘가"가 아니라 정확히 그 시간을 의미함을 이해합니다.
      2. 국소적 초점: "오른손"이 전체 몸이 아닌 특정 부위를 지칭함을 학습합니다.
      3. 사고의 연쇄 (CoT): 이것이 핵심입니다. AI 는 복잡한 요청을 단계별 이야기로 분해하는 법을 배웁니다. "멈춘 다음 점프하라"고 요청하면 단순히 추측하는 것이 아니라, *"1 단계: 몸 고정. 2 단계: 다리 준비. 3 단계: 점프"*라고 생각합니다. 이는 편집 과정을 논리적이고 설명 가능하게 만듭니다.
  • 방대한 연습 교재 (MotionFineEdit 데이터셋):
    이 새로운 기술을 가르치기 위해 연구진은 너무 모호했던 기존 교과서는 사용할 수 없었습니다. 대신 MotionFineEdit이라는 완전히 새로운 대규모 데이터셋을 만들었습니다.

    • 비유: 이는 837,000 개의 작은 '전후 (before and after)' 예제를 포함한 도서관과 같습니다. 각 예제는 특정 동작, 이를 변경하기 위한 구체적인 지시 (예: "첫 번째 초를 삭제하고 오른쪽 무릎을 낮추기"), 그리고 그 결과로 나타나는 동작을 보여줍니다.
    • 결정적으로 이 데이터셋에는 사고의 연쇄 (Chain-of-Thought) 주석이 포함되어 있습니다. 시작과 끝만 보여주는 것이 아니라, 로봇이 A 지점에서 B 지점으로 어떻게 이동했는지 보여주는 만화책처럼 중간 단계를 보여줍니다. 이는 AI 에게 편집 뒤에 숨겨진 '추론'을 가르칩니다.

3. 결과: "그럭저럭"에서 "정밀한"으로

MotionMERGE 를 테스트했을 때, 결과는 흐릿한 스케치와 고해상도 사진을 비교하는 것과 같았습니다.

  • 정밀도: "시작에서 2 초간 멈춘 다음 왼쪽 다리를 움직여"와 같은 지시를 높은 정확도로 따를 수 있었으며, 이전 모델들은 실패하거나 타이밍을 잘못 잡았습니다.
  • 제로샷 추론: AI 가 단순한 패턴을 암기한 것이 아니라 동작의 논리를 학습했기 때문에, 이전에 본 적 없는 복잡하고 새로운 지시도 처리할 수 있었습니다. 추가 훈련 없이 복잡한 요청을 단계로 분해하여 정확하게 실행할 수 있었습니다.
  • 다용도성: 편집 능력만 향상된 것이 아니라 새로운 춤을 생성하고 기존 춤을 설명하는 능력도 향상되어, '세부 사항'을 학습하는 것이 실제로 AI 가 '큰 그림'을 이해하는 데도 도움이 됨을 입증했습니다.

요약

간단히 말해, MotionMERGE는 인간 편집자와 동일한 정밀도로 인간 움직임의 언어를 배우는 새로운 AI 시스템입니다. 단계별 사고 (사고의 연쇄) 를 가르치고 구체적이고 상세한 예제의 방대한 도서관을 제공함으로써, 이제 AI 는 일반적인 분위기를 추측하는 것이 아니라 우리가 움직이는 방식의 작고 정교한 세부 사항을 이해하고 통제할 수 있게 되었습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →