← 최신 논문
💻 computer science

DiMo: Discrete Diffusion Modeling for Motion Generation and Understanding

DiMo는 마스크드 모델링을 양방향 텍스트-모션 이해 및 생성으로 확장하여, 반복적인 토큰 정제, 잔차 벡터 양자화 및 그룹 상대 정책 최적화를 통해 유연한 품질-지연 시간 트레이드오프와 다양한 모션 작업을 가능하게 하는 통합 이산 확산 프레임워크를 도입한다.

원저자: Ning Zhang, Zhengyu Li, Kwong Weng Loh, Mingxi Xu, Qi Wang, Zhengyu Wen, Xiaoyu He, Wei Zhao, Kehong Gong, Mingyuan Zhang

게시일 2026-02-09
📖 4 분 읽기☕ 가벼운 읽기

원저자: Ning Zhang, Zhengyu Li, Kwong Weng Loh, Mingxi Xu, Qi Wang, Zhengyu Wen, Xiaoyu He, Wei Zhao, Kehong Gong, Mingyuan Zhang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신에게 거대하고 마법 같은 스케치북이 있다고 상상해 보세요. 과거에는 설명에 기반해 춤추는 사람을 그리거나, 댄스 영상에 기반해 이야기를 쓰고 싶다면 두 개의 서로 다른 스케치북을 사용해야 했거나, 혹은 왼쪽에서 오른쪽으로 한 번에 한 획씩만 그릴 수 있는 매우 경직된 스케치북을 사용해야 했습니다. 만약 첫 번째 획에서 실수를 했다면, 전체 그림은 망가진 것이나 다름없었으며, 처음부터 다시 시작하지 않고는 쉽게 돌아가서 수정할 수 없었습니다.

DiMo는 규칙을 바꾸는 새로운 종류의 "스마트 스케치북"입니다. 이 시스템은 두 가지 일을 동시에 수행할 수 있는 단일 시스템입니다:

  1. 설명을 읽고 동작을 그립니다 (Text-to-Motion).
  2. 동작을 보고 설명을 씁니다 (Motion-to-Text).

이것이 어떻게 작동하는지 일상적인 비유를 통해 알아보겠습니다:

1. "흐릿한 사진" 게임 (생성 방식)

대부분의 기존 방식은 사람이 한 번에 한 단어씩 문장을 쓰는 것과 비슷하게 작동합니다. 일단 단어를 쓰면, 그것을 바꿀 수 없습니다. 만약 "강아지가 달린다"라고 썼다면, 전체를 다시 쓰지 않고는 "달린다"를 "점프한다"로 쉽게 바꿀 수 없습니다.

DiMo는 다르게 작동합니다. 당신이 무용수의 사진을 가지고 있지만, 그 사진이 정적 노이즈(마치 흐릿한 TV 화면처럼)로 완전히 뒤덮여 있다고 상상해 보세요.

  • 과정: DiMo는 무용수를 한 획씩 그리는 것이 아닙니다. 대신, 전체적으로 흐릿한 이미지를 한꺼번에 봅니다. 무용수가 어떻게 보일지 추측한 다음, 그다음 버전은 어떤 모습이어야 하는지 추측하고, 이 과정을 반복하며 계속해서 정교하게 다듬어 나갑니다.
  • 마법: DiMo는 이미지의 어느 곳에서든 즉각적으로 실수를 바로잡을 수 있습니다. 만약 왼쪽 팔이 이상해 보인다면, 오른쪽 다리를 망가뜨리지 않고도 왼쪽 팔만 고칠 수 있습니다. 이는 마치 흐릿한 사진을 아주 선명하게 만들 때까지 계속해서 "디노이징(denoising, 노이즈 제거)"을 하는 것처럼, 병렬적인 단계들을 통해 이미지를 정교화함으로써 가능해집니다.

2. "속도 vs 품질" 다이얼

DiMo는 이미지를 여러 단계에 걸쳐 정교하게 다듬기 때문에, 당신은 결과물의 속도를 선택할 수 있습니다.

  • 빠른 결과가 필요한가요? 프로세스를 일찍 멈출 수 있습니다 (예: 5단계 후). 무용수의 모습이 다소 거칠 수는 있지만, 즉시 결과를 얻을 수 있습니다.
  • 완벽한 품질이 필요한가요? 더 많은 단계(예: 30단계)를 실행하도록 둡니다. 무용수는 믿기 힘들 정도로 사실적이고 매끄럽게 보일 것입니다.
    이는 마치 "속도 vs 품질" 조절 다이얼이 달린 카메라와 같습니다. 원하는 순간에 딱 맞게 다이얼을 돌릴 수 있습니다.

3. "고해상도" 번역기 (RVQ)

무용수를 실감 나게 만들기 위해, DiMo는 **잔차 벡터 양자화(Residual Vector Quantization, RVQ)**라는 특별한 도구를 사용합니다.

  • 비유: 복잡한 그림을 단 10가지 색상만 사용하여 묘사하려고 한다고 상상해 보세요. 그러면 투박하고 보기 흉할 것입니다. 이제 1,000가지 색상의 팔레트를 가지고 있지만, 이를 레이어(층)별로 사용하는 것을 상상해 보세요. 먼저 큰 형태(몸통)를 배치하고, 그다음 근육을 추가하며, 마지막으로 머리카락 한 올 같은 미세한 디테일을 추가합니다.
  • 결과: DiMo는 동작을 이러한 레이어로 분해합니다. 이를 통해 DiMo는 "거친" 움직임(예: 걷기)과 "미세한" 디테일(예: 손가락의 떨림)을 각각 별도로 포착할 수 있으며, 그 결과 훨씬 더 부드럽고 사실적인 애니메이션을 만들어냅니다.

4. "스마트 코치" (GRPO)

때로는 동작이 좋아 보이더라도, 그것이 당신이 말한 이야기와 일치하지 않을 수도 있습니다 (예: 텍스트에는 "점프"라고 되어 있는데, 캐릭터는 "걷고" 있는 경우).

  • 비유: DiMo에는 내장된 "코치"(GRPO라고 불림)가 있습니다. DiMo가 동작을 수행하면, 코치가 확인합니다: "이것이 텍스트와 일치하는가?" 만약 일치하지 않는다면, 코치는 시스템이 다시 시도하도록 부드럽게 유도합니다. 시간이 흐르면서 DiMo는 코치의 말을 더 잘 듣는 법을 배우며, 이를 통해 춤이 이야기와 완벽하게 일치하도록 보장합니다.

이것으로 실제로 무엇을 할 수 있나요?

논문에 따르면, DiMo는 동작과 텍스트를 위한 스위스 아미 나이프(다목적 도구)와 같습니다:

  • Text to Motion: "사람이 백플립을 하고 있다"라고 입력하면, 비디오를 생성합니다.
  • Motion to Text: 댄스 영상을 업로드하면, "무용수가 회전하며 점프한다"와 같은 캡션을 작성합니다.
  • 실수 수정: 영상의 중간 부분이 끊겨 있는 경우(예: 중간에 컷이 있는 경우), DiMo는 새로운 지시 없이도 그 간극을 채울 수 있습니다.
  • 캡션 교정: 영상과 캡션이 서로 잘 맞지 않는 경우, DiMo는 실제로 일어나고 있는 일을 설명하도록 캡션을 수정할 수 있습니다.

요약하자면

이 논문은 DiMo가 이전 방식들보다 뛰어난 이유가 처음에 저지른 실수에 갇히지 않기 때문이라고 주장합니다. DiMo는 전체 그림을 볼 수 있고, 어디에서든 오류를 수정할 수 있으며, 결과의 속도나 품질을 직접 선택할 수 있습니다. DiMo는 HumanML3D 및 KIT-ML과 같은 표준 데이터셋을 통해 테스트되었으며, 하나의 통합된 프레임워크 내에서 고품질의 댄스를 생성하고 정확한 설명을 작성할 수 있음을 보여주었습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →