← 최신 논문
🤖 AI

Stubborn: A Streamlined and Unified Reinforcement Learning Framework for Robust Motion Tracking and Fall Recovery for Humanoids

이 논문은 요(yaw) 정렬 표현, 불안정한 상태에서의 탐색을 장려하기 위한 베르누이 기반 확률적 종료 메커니즘, 그리고 훈련 효율성을 높이기 위한 적응형 샘플링 전략을 채택함으로써 휴머노이드의 강건한 동작 추적과 낙상 회복을 통합하는 통합 강화 학습 프레임워크인 "Stubborn"을 제안한다.

원저자: Xiao Ren, Yuhui Yang, Zongbiao Weng, Zhijie Liu, He Kong

게시일 2026-06-12
📖 3 분 읽기☕ 가벼운 읽기

원저자: Xiao Ren, Yuhui Yang, Zongbiao Weng, Zhijie Liu, He Kong

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

로봇에게 춤을 가르치는 상황을 상상해 보세요. 보통 로봇이 발을 헛디뎌 넘어지면, 선생님(컴퓨터 프로그램)은 즉시 수업을 중단하고 "게임 오버"라고 말한 뒤 로봇을 시작 위치로 되돌려 놓습니다. 로봇은 어떻게 다시 일어날 수 있는지 배울 기회를 전혀 갖지 못하는데, 왜냐하면 다시 일어서는 법을 알아낼 수 있을 만큼 충분히 바닥에 머물도록 허용되지 않기 때문입니다.

이 논문은 이러한 접근 방식의 변화를 주는 Stubborn이라는 새로운 시스템을 소개합니다. 로봇이 비틀거릴 때 포기하는 대신, Stubborn은 로봇에게 "고집스럽게(stubborn)" 행동하도록 가르칩니다. 즉, 완벽하게 춤을 추는 법을 배우는 동시에, 넘어졌을 때도 다시 일어서려고 계속 노력하도록 만드는 것입니다.

작동 원리는 다음과 같이 간단한 개념들로 나누어 볼 수 있습니다.

1. "머리 중심"의 관점 (Yaw 정렬 추적)

당신이 춤 파트너를 따라가고 있다고 상상해 보세요. 만약 어지러워서 어느 쪽이 "북쪽"인지 놓치게 된다면, 방향을 바로잡기 위해 몸 전체를 돌리려 할 것이고, 이는 에너지를 낭비하고 스텝을 망치게 될 것입니다.

Stubborn은 로봇이 "북쪽" 방향을 무시하고 오직 자신의 몸과 지면에만 집중하도록 가르칩니다. 로봇의 시야를 자신의 머리(yaw)에 맞추는 것입니다. 이렇게 하면 로봇이 밀리거나 회전하더라도 방 안의 어디에 있는지에 대해 당황하지 않고, 오직 자신의 균형을 유지하고 자신을 기준으로 춤 동작을 따라가는 데 집중할 수 있습니다. 이 방식은 로봇이 "어지러움"을 느끼는 것에 덜 민감하게 만듭니다.

2. "그럴 수도 있고, 아닐 수도 있는" 규칙 (확률적 종료)

기존의 훈련 방식에서는 로봇이 큰 실수(예: 넘어짐)를 하면 훈련 세션이 즉시 종료되었습니다. 이것은 마치 학생이 수학 시험을 망쳤을 때, 문제를 다시 풀어볼 기회를 주기도 전에 선생님이 즉시 교실 밖으로 쫓아내는 것과 같습니다.

Stubborn은 **확률적 종료(Probabilistic Termination)**라는 영리한 기술을 사용합니다. 로봇이 큰 실수를 했을 때, 즉시 수업을 끝내는 대신 컴퓨터는 가상의 동전을 던집니다.

  • 앞면: 수업이 종료됩니다.
  • 뒷면: 수업이 계속됩니다!

이것은 로봇에게 일종의 "유예 기간"을 주어 바닥에 머물며 실험해 볼 수 있게 합니다. 이를 통해 로봇은 넘어졌을 때도 다시 일어서는 법을 스스로 알아낼 기회가 있다는 것을 배웁니다. 로봇은 즉각적인 "게임 오버"라는 벌을 받지 않기 때문에, 특별한 선생님이 어떻게 일어서라고 알려주지 않아도 스스로 회복하는 법을 자연스럽게 터득하게 됩니다.

3. "어려운 부분에 집중하기" 전략 (적응형 샘플링)

피아노 곡을 연습하고 있다고 상상해 보세요. 당신은 쉬운 부분은 완벽하게 연주하지만, 특정 어렵고 까다로운 화음에서 계속 실수를 합니다. 일반적인 선생님은 매번 곡의 처음부터 끝까지 통째로 연주하게 할 수도 있는데, 그러면 그 어려운 화음을 아주 조금밖에 연습하지 못하게 됩니다.

Stubborn은 당신의 연주를 지켜보는 똑똑한 코치처럼 행동합니다. 만약 당신이 그 어려운 화음에서 비틀거리는 것을 본다면, 코치는 "좋아, 그 어려운 부분 바로 직전부터 다시 시작하자"라고 말합니다. 이 방식은 로봇이 어려운 순간(비틀거리는 순간)에는 더 많은 시간을 할애하고, 쉽고 매끄러운 부분에는 적은 시간을 쓰도록 확률을 조정합니다. 이를 통해 로봇은 에너지가 정확히 필요한 곳에 집중함으로써 훨씬 빠르게 학습합니다.

4. 결과: 하나의 로봇, 두 가지 기술

Stubborn의 가장 놀라운 점은 춤을 위한 선생님과 넘어지는 법을 위한 선생님, 두 명의 선생님이 필요하지 않다는 것입니다. 이 시스템은 단 하나의 뇌(단일 정책)를 사용하여 두 가지를 모두 수행합니다.

  • 복잡하고 빠른 움직임(춤이나 무술 등)을 추적하는 법을 배웁니다.
  • 강한 충격이나 넘어짐으로부터 회복하는 법을 배웁니다.

연구진은 이를 실제 로봇(Unit-tree G1)과 컴퓨터 시뮬레이션에서 테스트했습니다. 결과에 따르면, Stubborn은 다른 방식들에 비해 움직임을 추적하는 능력이 뛰어났으며, 넘어짐으로부터 회복하는 능력 또한 훨씬 우수했습니다. 로봇은 단순히 넘어짐을 견뎌낸 것이 아니라, 별도의 회복 교육 없이도 스스로 일어서서 다시 춤을 추는 법을 배웠습니다.

요약하자면: Stubborn은 로봇이 넘어졌을 때 포기하도록 내버려 두지 않는 훈련 방식입니다. 로봇이 "엉망인 순간"에 조금 더 오래 머물 수 있게 하고, 가장 어려운 부분에 집중하게 함으로써, 훌륭한 무용수인 동시에 강인한 생존자가 되도록 만듭니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →