← 최신 논문
💻 computer science

Superman: Unifying Skeleton and Vision for Human Motion Perception and Generation

이 논문은 시각적 인지와 시간적 스켈레톤 기반 동작 생성을 연결하는 비전 가이드 모션 토크나이저(Vision-Guided Motion Tokenizer)와 단일 MLLM 아키텍처를 통해 다양한 인간 동작 분석 작업 전반에서 최첨단 성능을 달성하는 통합 프레임워크인 "Superman"을 소개한다.

원저자: Xinshun Wang, Peiming Li, Ziyi Wang, Zhongbin Fang, Zhichao Deng, Songtao Wu, Jason Li, Mengyuan Liu

게시일 2026-07-08
📖 3 분 읽기☕ 가벼운 읽기

원저자: Xinshun Wang, Peiming Li, Ziyi Wang, Zhongbin Fang, Zhichao Deng, Songtao Wu, Jason Li, Mengyuan Liu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

상상해 보세요. 당신에게 두 가지 일을 아주 잘하지만, 동시에 두 가지를 할 수는 없는 로봇이 하나 있습니다.

  • 로봇 A (관찰자): 사람이 춤추는 영상을 보고 그 동작을 정확하게 설명할 수 있습니다. 하지만 새로운 춤을 만들어내라고 요청하면 얼어붙어 버립니다. 마치 완벽한 리뷰를 쓸 줄은 알지만 직접 연기는 못 하는 영화 평론가와 같습니다.
  • 로봇 B (창조자): "점프하는 사람"과 같은 텍어 설명을 입력받아 완벽한 3D 애니메이션을 생성할 수 있습니다. 하지만 실제 사람의 영상을 보여주면 무엇을 보고 있는지조차 이해하지 못합니다. 마치 대본은 쓸 줄 알지만 영화를 볼 줄은 모르는 감독과 같습니다.

오랫동안 컴퓨터 비전의 세계는 이 두 개의 분리된 로봇 상태에 머물러 있었습니다. 이 새로운 논문은 '관찰자'와 '창조자' 역할을 동시에 수행하는 단일 통합 시스템인 **"Superman"**을 소개합니다.

이 시스템이 어떻게 작동하는지 쉬운 개념으로 나누어 설명하겠습니다.

1. 문제점: 깨진 언어

현재 컴퓨터들은 움직임에 대해 두 가지 서로 다른 언어를 사용합니다:

  • 시각적 언어: 카메라가 보는 것 (픽셀, 색상, 모양).
  • 골격 언어: 관절(엉덩이, 팔꿈치, 무릎 등)의 수학적 좌표.

기존 모델들은 보통 이 중 한 가지 언어만을 구사합니다. 만약 모델이 영상으로부터 학습하면, 골격의 수학적 구조를 잊어버립니다. 반대로 골격의 수학적 구조로부터 학습하면, 시각적인 현실을 잊어버립니다. 이것이 바로 "단절"을 만듭니다.

2. 해결책: "이중 언어 사전" (Vision-Guided Motion Tokenizer)

이를 해결하기 위해 저자들은 **비전 가이드 모션 토크나이저(Vision-Guided Motion Tokenizer)**라는 특별한 번역기를 만들었습니다.

이것은 모든 단어에 두 가지 정의가 동시에 붙어 있는 이중 언어 사전과 같습니다:

  • 정의 A: 움직임이 영상에서 어떻게 보이는가 (시각적 외형).
  • 정의 B: 움직임이 수학적으로 무엇인가 (3D 골격 형태).

단순히 숫자 기반의 "포즈" 목록을 학습하는 대신, Superman은 영상의 모습과 3D 골격 기하학 모두에 기반을 둔 "모션 토큰" 목록을 학습합니다. 이를 통해 "점프"가 특정 방식으로 보이면서도 수학적으로는 특정한 느낌을 갖는다는 것을 이해하는 "범용 모션 어휘"를 만들어냅니다.

3. 두뇌: 모든 것을 다스리는 하나의 모델

이 사전을 구축한 후, 이들을 거대한 AI 두뇌(멀티모달 대규모 언어 모델, MLLM)에 연결합니다. 이 두뇌는 이 새로운 "이중 언어"를 구사하기 때문에, 동일한 엔진을 사용하여 세 가지 매우 다른 작업을 처리할 수 있습니다.

  • 작업 1: 탐정 (포즈 추정 - Pose Estimation)

    • 입력: 사람의 영상.
    • 동작: 모델이 영상을 보고 이를 일련의 골격 토큰으로 번역합니다.
    • 결-과: 프레임별로 정확한 3D 골격 움직임을 출력합니다.
  • 작업 2: 점술가 (모션 예측 - Motion Prediction)

    • 입력: 골격 움직임의 처음 몇 초.
    • 동작: 모델이 패턴을 보고 다음 토큰 시퀀스를 예측합니다.
    • 결-과: 실제 일어나기 전의 미래 움직임을 생성합니다.
  • 작업 3: 다리 건설자 (모션 인비트위닝 - Motion In-betweening)

    • 입력: 시작 포즈와 종료 포즈 (예: "서 있는 상태"와 "앉아 있는 상태").
    • 동작: 모델이 그 사이의 빠진 중간 단계들을 채워 넣습니다.
    • 결-과: 사람이 앉는 과정을 보여주는 매끄러운 애니메이션을 생성합니다.

4. 왜 더 나은가 (결과)

논문에서는 Superman을 최고의 "관찰자" 모델 및 최고의 "창조자" 모델과 비교 테스트했습니다.

  • 전문가를 이겼습니다: 단일 모델이 세 가지 일을 수행함에도 불구하고, 오직 한 가지 일만을 하도록 설계된 전문 모델들보다 더 뛰어난 성능을 보였습니다.
  • 훌륭한 추론 능력을 갖췄습니다: 학습 데이터(Human3.6M)로 훈련하고 완전히 다른 미지의 데이터셋(3DPW)으로 테스트했을 때, 놀라운 일반화 능력을 보여주었습니다. 단순히 훈련 데이터를 암기한 것이 아니라, 인간 움직임의 "규칙"을 학습한 것입니다.
  • 효율적입니다: 두뇌가 영상과 골격 데이터를 더 잘 연결하도록 돕는 작은 "보조 모듈"(MAFT라고 불림)을 추가했지만, 이는 계산 능력을 아주 미미한 수준으로만 추가할 뿐입니다.

핵심 요약

Superman은 인간의 움직임을 "보는 것"과 "만드는 것"을 통합한 최초의 시스템입니다. 움직임이 어떻게 보이는지와 그것이 무엇인지(수학적 실체)를 연결하는 사전을 만듦으로써, 단일 AI가 영상을 관찰하고, 미래를 예측하며, 빈틈을 채울 수 있게 했습니다. 이 모든 과정은 최첨단 정확도로 이루어집니다. 이는 파편화되어 있던 움직임 분석의 세계를 하나의 응집된 언어로 탈바꿈시켰습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →