← 최신 논문
💻 computer science

Next-Scale Autoregressive Models for Text-to-Motion Generation

본 논문은 교차 스케일 및 인-스케일 정제 메커니즘을 통해 거친 해상도에서 정밀한 해상도로 계층적으로 텍스트-모션 생성을 수행하는 차세대 자기회귀 프레임워크인 MoScale 을 소개하며, 이는 최첨단 성능, 높은 학습 효율성, 그리고 강력한 제로샷 일반화를 달성합니다.

원저자: Zhiwei Zheng, Shibo Jin, Lingjie Liu, Mingmin Zhao

게시일 2026-05-28
📖 3 분 읽기☕ 가벼운 읽기

원저자: Zhiwei Zheng, Shibo Jin, Lingjie Liu, Mingmin Zhao

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

로봇에게 글로 된 설명을 바탕으로 춤을 추는 법을 가르치려 한다고 상상해 보세요. 만약 로봇에게 "점핑잭을 두 번 하고, 돌아서 무언가를 집어 들고, 다시 돌아서라"고 말한다면, 표준 AI 는 개별 동작은 올바르게 수행할 수 있지만 순서나 횟수를 잘못할 수 있습니다. 점핑잭을 세 번 하거나, 마지막에 돌아서는 동작을 잊어버릴 수도 있습니다.

이 논문은 이러한 문제를 해결하는 새로운 AI 모델인 MoScale을 소개합니다. 간단한 비유를 통해 그 작동 원리를 설명해 보겠습니다.

문제: "한 번에 한 걸음씩"의 함정

현재 대부분의 동작 생성 AI 모델은 한 단어씩 책을 읽는 사람처럼 작동합니다. 바로 직전 동작 하나만을 기반으로 다음 동작을 예측합니다.

  • 비유: 방금 만든 작은 붓질만 바라보며 거대한 풍경을 그려보라고 상상해 보세요. 그 한 부분의 색은 정확히 맞출 수 있지만, 전체 그림은 잃게 됩니다. 산이 왼쪽에 있어야 하거나 강이 특정 방향으로 흘러야 한다는 사실을 잊을 수 있습니다.
  • 결과: 로봇의 움직임은 국소적으로는 매끄럽습니다 (무릎이 올바르게 구부러지는 등). 하지만 전체적인 이야기는 잘못되었습니다 (요청한 두 번의 점핑잭을 하지 않는 등).

해결책: "건축가에서 인테리어 디자이너로" 접근법

MoScale 은 전략을 바꿉니다. 한 번에 작은 움직임 하나를 예측하는 대신, **대략적 (큰 그림)**에서 **세부적 (작은 디테일)**로 움직임을 층층이 구축합니다.

  1. 대략적 스케일 (건축가): 먼저 모델은 청사진을 스케치하는 건축가처럼 행동합니다. 낮은 해상도에서 춤의 전체 구조를 결정합니다. "좋아, 전체 순서는 점프, 점프, 회전, 집기, 회전이다"라고 말합니다. 손가락이 어떻게 움직일지 걱정하기 전에 전역적인 이야기를 먼저 확정합니다.
  2. 세부적 스케일 (인테리어 디자이너): 청사진이 설정되면 모델은 확대합니다. 그 대략적인 스케치를 가져와 점프 높이나 회전 속도처럼 세부 사항을 추가합니다. 단계별로 움직임을 정교하게 다듬지만, 건축가가 이미 결정한 주요 이야기는 결코 바꾸지 않습니다.

비법: 두 가지 "정제" 기법

저자들은 이 과정을 더욱 개선하기 위해 두 가지 특별한 기능을 추가했습니다. 특히 춤 데이터를 대량으로 학습할 수 없는 상황에서 효과적입니다.

1. "실수와 함께 연습하기" 기법 (교차 스케일 계층적 정제)

  • 문제: 완벽한 지시사항으로만 연습한다면, 실수를 했을 때 당황하게 됩니다.
  • 비유: 운전 배우는 학생을 상상해 보세요. 강사가 오직 완벽하고 차 없는 도로에서만 운전하게 한다면, 함정 구덩이를 만나자마자 사고를 낼 것입니다.
  • MoScale 의 해결책: 학습 과정에서 모델은 고의적으로 "손상된" 또는 불완전한 청사진을 받습니다. "건축가"가 저지른 실수를 수정하고 여전히 좋은 춤을 만들어내야 합니다. 이는 모델이 오류에 강인해지고 회복할 수 있도록 가르쳐, 초기 단계가 약간 빗나갔더라도 최종 움직임이 텍스트에 충실하도록 보장합니다.

2. "두 번째 확인" 기법 (동일 스케일 시간적 정제)

  • 문제: 큰 그림을 결정했더라도 모델이 손이 잘못된 방향으로 떨리는 것처럼 특정 세부 사항을 잘못 파악할 수 있습니다.
  • 비유: 에세이를 쓴다고 상상해 보세요. 초고를 쓴 후 다시 돌아가서 읽습니다. 오타나 어색한 문장을 발견하고 수정합니다.
  • MoScale 의 해결책: 모델이 특정 층에 대한 예측을 한 후, 방금 쓴 내용을 "다시 돌아보게" 됩니다. 자신이 불확실한 부분을 식별하고 다시 예측합니다. 이는 전체 이야기를 해치지 않으면서 움직임을 더 매끄럽고 현실적으로 다듬는 두 번째 초고와 같습니다.

왜 이것이 중요한가

이 논문은 MoScale 이 "다음 토큰" 모델의 속도와 길고 복잡한 이야기를 이해하는 능력을 성공적으로 결합한 첫 번째 모델이라고 주장합니다.

  • 더 나은 스토리텔링: "점핑잭 두 번"이나 "돌아서서 집고 다시 돌아서기"와 같은 지시를 이전 모델들보다 훨씬 잘 따릅니다.
  • 효율성: 서서히 노이즈를 지워가며 노이즈 덩어리를 이미지로 만드는 것과 같은 인기 있는 "확산 (Diffusion)" 모델보다 학습 속도가 빠릅니다.
  • 다용도성: 구조를 매우 잘 이해하기 때문에, 춤의 일부만 변경하고 싶을 때 (예: 걷기를 뛰기로 변경) 변경하고 싶지 않은 부분을 깨뜨리지 않고 기존 춤을 편집할 수도 있습니다.

요약하자면, MoScale 은 AI 가 세부 사항에 빠져 길을 잃지 않도록 막고, 먼저 전체 춤을 계획하도록 강제하여 로봇이 실제로 요청한 대로 행동하도록 보장합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →