← 최신 논문
⚡ electrical engineering

Guided Reinforcement Learning for Omnidirectional 3D Jumping in Quadruped Robots

본 논문은 기존 엔드투엔드 접근법의 샘플 비효율성과 안전성 인증 과제를 극복하여 사족 로봇의 효율적이고 설명 가능하며 견고한 전방향 3D 점프를 가능하게 하기 위해 베지어 곡선과 등가속도 직선 운동 모델을 통합한 새로운 유도 강화 학습 프레임워크를 제안한다.

원저자: Riccardo Bussola, Michele Focchi, Giulio Turrisi, Claudio Semini, Luigi Palopoli

게시일 2026-05-19
📖 4 분 읽기☕ 가벼운 읽기

원저자: Riccardo Bussola, Michele Focchi, Giulio Turrisi, Claudio Semini, Luigi Palopoli

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

네 발 로봇이 갭을 뛰어넘거나 높은 선반 위로 점프하려고 한다고 상상해 보세요. 인간에게 점프는 자연스러운 일이지만, 로봇에게는 마라톤을 뛰면서 복잡한 물리 퍼즐을 풀려고 하는 것과 같습니다. 로봇이 너무 세게 밀면 다리가 부러질 수 있고, 너무 부드럽게 밀면 도달하지 못하며, 잘못된 각도로 밀면 머리를 하고 떨어집니다.

이 논문은 가이드 강화 학습 (Guided Reinforcement Learning, GRL) 이라는 방법을 사용하여 이러한 로봇들에게 점프하는 법을 가르치는 새로운 방식을 제시합니다. 간단한 비유를 통해 작동 원리를 살펴보겠습니다.

문제: "시행착오"의 함정

전통적으로 로봇에게 점프를 가르치는 것은 절벽에서 아이를 던져 비행하는 법을 배우게 하려는 것과 같습니다.

  • 기존 방식 (최적화): 엔지니어들은 모든 수학 방정식을 완벽하게 계산하려고 시도합니다. 이는 시간이 제한된 상태에서 스도쿠 퍼즐을 풀려고 하는 것과 같습니다. 시간이 너무 오래 걸리며, 바닥이 미끄럽거나 로봇이 예상보다 약간 무거울 경우 종종 실패합니다.
  • 표준 AI 방식 (종단간 강화 학습): 로봇이 비디오 게임에서 수백만 번 점프를 시도하게 합니다. 대부분의 경우 넘어집니다. 결국 수백만 번의 시도 끝에 아마도 해결책을 찾을지도 모릅니다. 이는 극도로 느리며, 로봇은 종종 신뢰하기 어려운 기이하고 예측 불가능한 동작을 학습합니다.

해결책: "GPS 와 물리" 접근법

저자들은 "학습을 시작하기 전에 로봇에 약간의 상식을 부여하자"고 말합니다. 로봇이 맹목적으로 추측하게 하는 대신 물리적 직관을 통해 이를 안내합니다.

다음과 같이 생각해보세요:

  1. 베지어 곡선 (로드맵): 로봇에게 "왼쪽 다리를 5 도 움직인 다음 오른쪽 다리를 3 도 움직여라"라고 지시하는 대신, 로봇은 베지어 곡선이라는 수학적 도구를 사용하여 공중에 매끄러운 보이지 않는 도로를 그리도록 요청받습니다. 펜으로 매끄러운 호를 그리는 것을 상상해 보세요. 로봇은 그 호의 시작점과 끝점이 어디인지 결정하기만 하면 되며, 수학이 그 사이의 매끄러운 경로를 채워줍니다. 이로 인해 학습 작업이 훨씬 작고 쉬워집니다.
  2. "폭발적" 부스트 (UARM): 때로는 매끄러운 호만 그리는 것만으로는 높이 점프하기에 충분하지 않습니다. 로봇은 "킥"이 필요합니다. 저자들은 계획에 두 번째 부분을 추가했습니다. 로봇이 지면을 떠나는 직전에 속도가 균일하게 가속되는 직선 폭발 (Uniformly Accelerated Rectilinear Motion) 입니다. 이는 출발 블록에서 몸을 앞으로 기울이고 폭발하듯 달리는 단거리 주주와 같습니다. 이를 통해 로봇이 배가 땅에 닿을 정도로 다리를 너무 많이 구부리지 않고도 높이 점프할 수 있습니다.
  3. 안전 필터 (바텐더): 로봇이 실제 물리 방정식을 사용하여 점프를 계획하기 때문에, 컴퓨터는 로봇이 실제로 움직이기 전에 계획을 확인할 수 있습니다. 이는 클럽 입구에서 바텐더가 신분증을 확인하는 것과 같습니다. 계획이 "이렇게 점프하면 머리를 다칠 것이다"라고 말하면, 컴퓨터는 "아니요, 그것은 허용되지 않습니다"라고 말하며 로봇이 시도하는 것을 막습니다. 이로 인해 시스템은 안전하고 예측 가능해집니다.

학습이 일어나는 방식

로봇은 "교사"(AI) 와 "학생"(로봇) 을 사용합니다.

  • 교사는 점프 계획 (호의 모양과 속도) 을 제안합니다.
  • 학생은 그 계획을 따르려고 노력합니다.
  • 로봇이 목표 지점에 가깝게 착지하고 아무것도 부수지 않으면 "하이파이브"(보상) 를 받습니다.
  • 나쁘게 착지하거나 안전 규칙 (예: 관절을 너무 빠르게 움직이는 것) 을 위반하면 "시간 정지"(페널티) 를 받습니다.

로봇이 베지어 곡선의 물리와 "폭발적" 부스트에 의해 안내받기 때문에 수백만 번 시도할 필요가 없습니다. 다른 방법들이 수백만 번이 필요할 때, 로봇은 단 2,000 번의 시도만으로 학습합니다. 깊은 물에 던져져 수영을 배우는 것과 코치와 구명 조끼를 입고 배우는 것의 차이와 같습니다.

결과: 로봇이 할 수 있는 일

이 팀은 두 대의 실제 로봇 (Unitree Go1 과 Aliengo) 과 시뮬레이션에서 이를 테스트했습니다.

  • 360 도 점프: 로봇은 앞으로, 뒤로, 옆으로 점프할 수 있으며 점프하는 동안 공중에서 회전할 수도 있습니다.
  • 상하 점프: 높은 상자 위로 점프하거나 가장자리에서 아래로 점프할 수 있습니다.
  • 제로샷 전이: 그들은 작은 로봇 (Go1) 에서 AI 를 훈련시킨 후, 더 크고 무거운 로봇 (Aliengo) 에게 완전히 동일한 지시를 사용하여 점프하도록 했습니다. 더 큰 로봇은 처음부터 모든 것을 다시 학습할 필요 없이 성공했습니다. 이는 아이에게 자전거 타는 법을 가르친 후, 그 아이가 오토바이에 올라타자마자 균형을 잡는 법을 즉시 아는 것과 같습니다.

왜 이것이 중요한가

이 논문은 이 방법이 이전 방법들보다 훈련이 더 빠르고, 안전하며, 정확하다고 주장합니다. 이는 단순히 추측하는 것이 아니라, 추측을 안내하기 위해 물리 법칙을 사용합니다. 이는 로봇이 "잘못 추측했다"는 이유로 갑자기 뒤집히겠다고 결정할까 봐 걱정하지 않고도 (수색 및 구조와 같은) 실제 상황에서 로봇이 점프하는 것을 신뢰할 수 있음을 의미합니다.

요약하자면, 저자들은 로봇에게 점프하는 법을 가르치는 것을 넘어, 물리 법칙을 사용하여 점프하는 법을 어떻게 생각하는지 가르쳤으며, 이로 인해 로봇은 훨씬 더 똑똑하고 안전한 학습자가 되었습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →