← 최신 논문
💻 computer science

Iterative Closed-Loop Motion Synthesis for Scaling the Capabilities of Humanoid Control

본 논문은 고품질이고 다양한 모션 데이터를 자동으로 생성하며 작업 난이도를 점진적으로 높이는 반복적 폐루프 프레임워크를 제안하여, 인간형 로봇 제어 정책이 훨씬 적은 학습 데이터로도 베이스라인을 크게 능가할 수 있도록 합니다.

원저자: Weisheng Xu, Qiwei Wu, Jiaxi Zhang, Tan Jing, Yangfan Li, Yuetong Fang, Jiaqi Xiong, Kai Wu, Rong Ou, Renjing Xu

게시일 2026-03-10
📖 3 분 읽기☕ 가벼운 읽기

원저자: Weisheng Xu, Qiwei Wu, Jiaxi Zhang, Tan Jing, Yangfan Li, Yuetong Fang, Jiaqi Xiong, Kai Wu, Rong Ou, Renjing Xu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

로봇에게 춤을 추거나, 싸우거나, 체조를 시키려 한다고 상상해 보세요. 보통은 인간이 이러한 동작들을 수행하는 수천 개의 영상을 보여줌으로써 이를 가르칩니다. 하지만 이 접근법에는 두 가지 큰 문제가 있습니다:

  1. "쉬운 모드" 함정: 우리가 보유한 영상 대부분은 사람들이 걷거나, 손을 흔들거나, 간단한 일상 업무를 수행하는 장면들입니다. 로봇은 이러한 동작들에 매우 능숙해지지만, 뒤집기나 복잡한 무술 발차기 같은 동작을 요구하면 훈련 중에 본 적이 없기 때문에 넘어집니다.
  2. "비싼 코치" 문제: 전문가들이 멋진 고난이도 동작을 수행하는 영상을 얻으려면 고가의 모션 캡처 의상과 전문 스튜디오가 필요합니다. 이를 수백만 시간 분량으로 촬영할 수는 없습니다. 비용과 시간이 너무 많이 들기 때문입니다.

해결책: 자기 개선형 "비디오 게임" 루프

이 논문의 저자 CLAIMS 는 로봇과 게임 레벨이 함께 진화하는 비디오 게임 같은 시스템을 구축했습니다.

간단한 비유를 들어 작동 원리를 설명해 보겠습니다:

1. 로봇 (플레이어)

로봇을 비디오 게임 캐릭터라고 생각하세요. 로봇의 임무는 특정 동작을 완벽하게 모방하는 것입니다.

2. AI 디렉터 (게임 디자이너)

새로운 동작을 인간이 촬영하는 대신, 팀은 AI "디렉터"(모션 생성 모델) 를 사용합니다. 이 디렉터는 텍스트 설명 (예: "고속으로 세 번 회전하는 피루에트") 만 읽으면 새로운 춤 동작, 무술 콤보, 또는 체조 루틴을 발명할 수 있습니다.

3. "코치" (피드백 루프)

이 부분이 마법과 같습니다. 시스템은 루프 형태로 실행됩니다:

  • 1 단계: 디렉터가 약간 까다로운 새로운 동작을 생성합니다.
  • 2 단계: 로봇이 이를 모방해 보려고 시도합니다.
  • 3 단계: "코치"(영상과 비디오를 보고 이해할 수 있는 똑똑한 AI) 가 로봇을 관찰합니다. "로봇이 넘어졌는가? 동작이 너무 쉬웠는가? 설명과 닮았는가?"라고 묻습니다.
  • 4 단계: 코치의 보고서에 따라 디렉터는 새로운 지시를 받습니다. "로봇이 쉬운 점프를 마스터했다. 이제 20% 더 어렵고 회전 동작이 포함된 동작을 생성하라."

4. 결과: "레벨 업" 시스템

비디오 게임에서 레벨을 클리어하면 다음 레벨이 더 어려워지는 것처럼, 이 시스템은 로봇을 계속 밀어붙입니다.

  • 반복 1: 로봇은 걷기와 간단한 회전 동작을 배웁니다.
  • 반복 2: 시스템이 로봇이 이에 능숙하다는 것을 알아차리면, 손바닥 뒤집기 (카트휠) 와 같은 더 어려운 동작을 생성합니다.
  • 반복 3: 로봇이 카트휠을 마스터하면, 시스템은 "비틀기 동작이 포함된 뒤집기"를 생성합니다.

시스템이 스스로 "더 어려운 레벨"을 자동으로 만들어내기 때문에, 고가의 인간 코치나 방대한 양의 사전 녹화 영상 라이브러리가 필요하지 않습니다. 로봇은 스스로 훈련 커리큘럼을 구축합니다.

그들이 달성한 것은 무엇입니까?

팀은 처음부터 배우는 로봇을 대상으로 이 시스템을 테스트했습니다.

  • 효율성: 표준 데이터셋 (AMASS 등) 에 비해 일반적으로 필요한 데이터 크기의 1/10 만 사용했습니다.
  • 성능: "게임"이 끝날 무렵, 전통적인 방법으로 훈련된 로봇들에 비해 난이도가 높고 전문적인 동작 (쿵푸나 복잡한 춤 등) 에서 실패율이 45% 감소했습니다.
  • 다용도성: 무술, 춤, 전투, 스포츠, 체조를 포함한 다양한 유형의 어려운 동작들에 대해 이 방법이 작동함을 보여주었습니다.

결론

모든 가능한 어려운 동작을 라이브러리에서 찾아내는 것 (이는 불가능하고 비용이 많이 듭니다) 대신, 이 논문은 자가 주행 훈련 루프를 제안합니다. 로봇이 배워야 할 어려운 동작을 생성하고, 로봇을 테스트한 뒤, 로봇이 방금 배운 내용을 바탕으로 즉시 더 어려운 동작을 만들어냅니다. 이는 스타디움 가득 찬 인간 전문가들이 없어도 로봇을 프로 운동선수로 가르치는 방법입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →