Skill Composition for Legged Robot Reinforcement Learning
이 논문은 독립적이고 특화된 하위 정책들의 신뢰할 수 있는 구성을 별개의 연구 문제로 다루는 것이, 파편화된 로봇 기술을 상위 수준의 플래너에 의해 효과적으로 관리될 수 있는 검증 가능하고 확장 가능하며 안전한 레퍼토리로 변모시키는 데 필수적이라고 주장한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
걷거나 뛰거나 기어오르는 로봇은 더 이상 이론적인 꿈이 아닙니다. 이들은 심층 강화 학습(deep reinforcement learning)이라 불리는 방법을 통해 현실이 되어가고 있습니다. 이 방식에서 컴퓨터 프로그램은 시뮬레이션 내부에서 시행착오를 거치며 로봇을 제어하는 법을 배우고, 결국 파쿠르나 험난한 지형 탐색과 같은 복잡한 움직임을 숙달하게 됩니다. 이러한 성공의 핵심은 로봇에게 앞으로 걷기나 공 차기와 같이 한 번에 하나의 특정 작업만을 수행하도록 훈련시키는 것이었습니다. 이러한 특화된 컨트롤러들은 좁은 문제에 집중하기 때문에 훈련 속도가 빠르고 매우 신뢰할 수 있습니다. 그러나 큰 장애물이 하나 남아 있습니다. 바로 이러한 개별 기술들을 어떻게 매끄럽게 함께 작동시키느냐 하는 것입니다. 만약 로봇이 걷다가 점프를 해야 한다면, 단순히 '걷기' 컨트롤러에서 '점프' 컨트롤러로 전환하는 것만으로는 실패하는 경우가 많습니다. 로봇이 가던 길을 멈춰 서 버려 쌓아온 모든 운동량을 잃어버리거나, 점프 컨트롤러가 움직이는 상태가 아닌 정지 상태를 가정하고 설계되었기 때문에 넘어질 수도 있기 때문입니다. 과제는 단순히 기술의 라이브러리를 갖추는 것이 아니라, 로-봇의 균형을 깨뜨리거나 에너지를 낭비하지 않으면서 한 기술에서 다른 기술로 제어권을 넘겨주는 방법을 찾아내는 것입니다.
로마 사피엔차 대학교(Sapienza University of Rome)의 연구진은 이 핸드오버(handover) 과정을 단순히 발생할 때마다 해결해야 할 기술적 세부 사항이 아니라, 그 자체로 진지한 과학적 문제로 다루어야 한다고 주장합니다. 그들은 하나의 거대한 뇌가 모든 것을 한꺼번에 하도록 훈련시키거나, 단순히 작업을 바꾸기 위해 로봇을 멈추는 대신, 독립적인 전문가들이 안전하게 결합될 수 있는 시스템을 구축해야 한다고 제안합니다. 그들은 이를 위한 두 가지 주요 방법을 제시합니다. 첫 번째는 '블렌딩(blending)'으로, 로봇의 동작이 걷기 전문가와 차기 전문가가 함께 일하는 것처럼 두 가지 기술이 동시에 일어나는 부드러운 혼합이 되는 방식입니다. 두 번째는 '브릿징(bridging)'으로, 다음 기술을 준비하기 위해 아주 짧은 순간 동안 특화된 임시 컨트롤러가 제어권을 넘겨받는 방식입니다. 이 브릿지는 설령 로봇이 전환이 필요한 시점에 혼란스러운 상태에 있더라도, 다음 기술을 성공적으로 이어받을 수 있는 위치로 로봇을 안내합니다.
이 아이디어들을 테스트하기 위해 연구팀은 휴머노이드 로봇이 멈추지 않고 복도를 따라 걷다가 점프할 수 있는 시스템을 구축했습니다. 걷기 기술은 로봇을 앞으로 이동시키도록 훈련되었고, 점프 기술은 정지 상태에서 훈련되었습니다. 전통적인 설정에서는 로봇이 달리면서 점프를 시도하면, 점프 컨트롤러가 움직이는 로봇을 본 적이 없기 때문에 실패하게 됩니다. 연구진은 이 문제를 해결하기 위해 '브릿지'를 만들었습니다. 이 브릿지는 점프를 하기로 결정한 순간 활성화되는 단기적인 컨트롤러입니다. 이 브릿지의 유일한 임무는 현재 움직이고 있는 로봇을 받아, 점프 기술이 처리할 수 있는 낮은 자세(crouching position)로 유도하면서도 로봇이 쌓아온 전진 속도를 유지하는 것입니다. 그 결과, 로봇은 걷기에서 점프 단계로 직접 전환하며, 먼저 멈추는 대신 자신의 운동량을 활용해 점프를 수행합니다. 이는 시뮬레이션에서 로봇이 걷기에서 점프 단계로 전환할 때, 전환 과정 내내 속도와 균형을 유지하며 성공적으로 전환하는 모습으로 입증되었습니다.
연구진은 또한 공을 차는 다른 과제를 사용하여 블렌딩 접근 방식을 탐구했습니다. 여기서 그들은 걷기 기술과 차기 기술을 결합했습니다. 두 기술 사이를 전환하는 대신, 두 동작을 함께 섞어주는 작은 네트워크를 사용했습니다. 시스템은 로봇이 공에서 멀리 있을 때는 주로 걷기 기술에 의존하다가, 공에 가까워질수록 점차 차기 기술으로 전환하도록 학습했습니다. 이를 통해 로봇은 공을 차기 위해 멈추는 대신, 공에 접근함에 따라 자연스럽게 보폭과 몸의 위치를 조절할 수 있었습니다. 연구진은 기존의 걷기와 점프 기술을 변경 없이 고정된 상태로 유지하면서, 이들을 섞거나 전환하는 결정을 내리는 작은 네트워크만을 훈련시킴으로써, 로봇 전체를 처음부터 다시 훈련시키지 않고도 복잡한 행동을 만들어낼 수 있다는 것을 발견했습니다.
그들의 연구에서 중요한 부분은 기술을 전환하라는 결정이 예측 불가능한 선택을 하는 블랙박스 형태의 신경망이 아니라, 플래너(planner)나 단순한 규칙 기반 시스템과 같이 이해 가능한 별도의 구성 요소에 의해 내려져야 한다는 아이디어입니다. 결정권자와 실행자를 분리하고 브릿지를 사용하여 복잡한 전환을 처리함으로써, 연구진은 로봇을 더 안전하고 신뢰할 수 있게 만들 수 있다고 믿습니다. 만약 플래너가 로봇에게 점프하라고 결정한다면, 그 플래너는 로봇을 점프하기 적합한 자세로 만드는 복잡한 물리 법칙을 알 필요 없이, 단지 점프를 요청하기만 하면 됩니다. 브릿지가 로봇을 준비시키는 어려운 부분을 처리할 것이기 때문입니다. 이러한 접근 방식은 새로운 기술을 추가하더라도 기존의 기술을 망가뜨리지 않으면서, 시간이 지남에 따라 확장될 수 있는 기술 라이브러리를 가능하게 합니다. 현재의 결과는 시뮬레이션과 특정 테스트 케이스를 바탕으로 하고 있지만, 이 연구는 모든 것을 한 번에 배우려 하기보다 단순하고 신뢰할 수 있는 기술들을 사슬처럼 엮음으로써 로봇이 길고 복잡한 작업을 수행할 수 있도록 만드는 경로를 제시합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.