What Matters for Simulation to Online Reinforcement Learning on Real Robots
세 가지 로봇 플랫폼에 걸친 100회의 실제 환경 훈련 실행을 포함하는 대규모 실증 연구를 통해, 본 논문은 물리적 로봇에서 안정적인 온라인 강화 학습을 가능하게 하는 구체적이고 견고한 설계 선택지를 식별하는 동시에 널리 사용되는 특정 기본 설정값들의 효과성을 반박한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
로봇에게 걷기, 컵 집기, 또는 자동차 운전하기를 가르친다고 상상해 보십시오. 오랫동안 과학자들은 로봇이 완벽한 디지털 시뮬레이터인 비디오 게임 세계 안에서 수백만 번 연습하게 함으로써 이 작업을 수행하려 노력해 왔습니다. 이는 조종사가 비행 시뮬레이터에서 훈련하는 것과 같습니다. 안전하고, 빠르고, 비용이 저렴합니다. 하지만 함정이 있습니다. 현실 세계는 무질서합니다. 바닥은 완벽하게 매끄럽지 않고, 타이어는 컴퓨터가 예측하지 못한 방식으로 미끄러지며, 카메라는 디지털 렌더러와는 다르게 사물을 인식합니다. 완벽한 비디오 게임에서 훈련받은 로봇을 실제 바닥에 가져다 놓으면, 로봇은 종종 발을 헛디디거나, 물건을 떨어뜨리거나, 충돌하곤 합니다. 이 '완벽한' 게임과 '무질서한' 현실 사이의 간극이 로봇 공학의 가장 큰 장애물입니다.
이를 해결하기 위해 연구자들은 강화 학습(Reinforcement Learning, RL)이라는 기법을 사용합니다. RL을 시행착오를 통해 배우는 매우 의욕적인 학생이라고 생각해 보십시오. 로봇은 어떤 행동을 시도하고, 성공하면 '보상'(점수와 같은 것)을 받거나, 충돌하면 '처벌'(벌점과 같은 것)을 받으며, 다음번에 더 잘할 수 있도록 자신의 뇌를 조정합니다. 여기서 핵심적인 질문은 이것입니다. 이 로봇이 게임 속에서만이 아니라, 실제로 움직이는 실제 바닥 위에서도 배울 수 있을까요? 이를 "온라인 학습(online learning)"이라고 부릅니다. 이것이 바로 '성배(holy grail)'인 이유는, 로봇이 마치 사람이 매끄러운 길에서 연습한 후 울퉁불퉁한 길에서 자전거를 타는 법을 배우는 것처럼, 새로운 상황에 즉각적으로 적응할 수 있음을 의미하기 때문입니다. 하지만 지금까지 실제 하드웨어에서 이런 방식으로 로봇을 가르치는 것은 위험하고, 불안정하며, 시간과 비용의 낭비인 경우가 많았습니다.
ETH 취리히와 구글 딥마인드(Google DeepMind)의 연구진이 작성한 이 논문은 매우 실질적인 질문을 던집니다. "이미 시뮬레이터에서 학습한 로봇이 있다면, 실제 세계에서 안전하고 성공적으로 학습하기 위해 우리가 조정해야 할 구체적인 설정은 무엇인가?" 그들은 새로운 마법 같은 알고리즘을 발명한 것이 아닙니다. 대신, 그들은 표준적인 기성 학습 도구들을 가져와 세 가지 매우 다른 로봇(로봇 팔 Franka Emika Panda, 4족 보행 로봇 Unitree Go1, 원격 제어 레이싱 카)을 대상으로 100회 이상의 다양한 훈련 과정을 테스트하며 마치 정비공처럼 행동했습니다.
그들은 학습용 로봇의 일반적인 "기본(default)" 설정들이 시뮬레이션에서 현실로 넘어올 때 실제로 위험하다는 것을 발견했습니다. 만약 시뮬레이터에서 훈련된 뇌를 실제 로봇에 그대로 꽂고 즉시 학습을 시작한다면, 로봇은 알고 있던 모든 것을 잊어버리고 혼돈 속으로 빠져들게 됩니다. 저자들은 이것이 로봇의 '비평가(critic, 행동이 얼마나 좋은지 판단하는 부분)'가 갑작스러운 물리적 변화로 인해 혼란을 겪기 때문에 발생한다는 것을 발견했습니다. 이를 막기 위해 그들은 간단하고 신뢰할 수 있는 레시피를 개발했습니다.
첫째, 새로운 실제 데이터를 다룰 때도 기존의 시뮬레이션 데이터를 섞어서 '기억'을 유지해야 한다는 것을 발견했습니다. 이는 숙제를 하는 동안 교과서를 펼쳐두는 것과 같습니다. 숙제를 시작하자마자 교과서를 던져버린다면, 기본적인 규칙들을 잊어버릴 수도 있기 때문입니다. 둘-째, 로봇이 자신의 생각을 바꾸기 전에 기존의 시뮬레이션 뇌를 가지고 몇 번 연습하는 '예열(warm-up)' 기간이 필요하다는 것을 발견했습니다. 마지막으로, 가장 중요한 점은 로봇의 '뇌'(무엇을 할지 결정하는 부분)가 '판단'(실수로부터 배우는 부분)보다 훨씬 더 느리게 업데이트되어야 한다는 것입니다. 뇌가 너무 빨리 변하면 무질서한 현실 세계 때문에 혼란에 빠지게 됩니다. 뇌의 업데이트 속도를 늦추고 판단력을 안정적으로 유지함으로써, 로봇은 단 몇 분의 실제 훈련만으로 큐브를 잡고, 넘어지지 않고 걷고, 레이싱 카를 정밀하게 주차하는 법을 배울 수 있었습니다.
이 논문은 이러한 구체적이고 세심한 조정을 거치면 표준적인 학습 방법들이 실제 하드웨어에서 안정적으로 작동할 수 있음을 보여줍니다. 그들은 단순히 시뮬레이션만 한 것이 아니라, 실제 기계에서 실행하여 새로운 슈퍼 알고리즘이 없더라도, 데이터를 어떻게 입력하고 얼마나 빠르게 생각을 바꾸게 할지를 더 똑똑하게 결정하는 것만으로도 로봇이 현실 세계에서 학습하게 만들 수 있음을 증명했습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.