Reinforcement Learning on Cost-Constrained Quadrupedal Hardware
이 논문은 평균 지연에 대한 순방향 모델과 이를 결합한 시간 인지 신경망을 사용하여, 강건하고 생물학적 영감을 받은 중추 패턴 생성기를 자율적으로 학습함으로써 액추에이터 지연으로 인해 발생하는 상당한 심투리얼(sim-to-real) 격차를 극복하여 저가형 사족 보행 하드웨어에 강화 학습을 배포할 수 있음을 입증한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
아주 긴, 엉클어진 전화선으로 연결된 먼 방에서 소리를 지르며 강아지에게 걷는 법을 가르치려 한다고 상상해 보십시오. 당신의 목소리가 강아지의 귀에 도달할 때쯤이면, 강아지는 이미 자신의 발에 걸려 넘어졌을 것입니다. 강아지가 당신의 새로운 외침에 따라 발걸음을 바로잡으려 노력할 때쯤이면, 이미 다시 넘어졌을 것입니다. 이것이 바로 과학자들이 완벽하고 즉각적인 비디오 게임 세상에서 로봇을 훈련시킨 뒤, 이를 무질서하고 느리며 소음이 많은 실제 세상으로 내보내는 분야인 '심투리얼(Sim-to-Real)' 로봇 공학의 일상적인 고충입니다.
핵심 문제는 '지연 시간(latency)', 즉 명령과 동작 사이의 간격입니다. 값비싸고 첨단 기술이 집약된 로봇에서 이 지연은 매우 작아서 거의 보이지 않을 정도입니다. 하지만 저렴하고 구하기 쉬운 로봇의 경우, 마치 느린 인터넷 연결로 비디오를 불러오는 것처럼 지연이 매우 클 수 있습니다. 이 지연이 너무 커지면 로봇은 지금 당장 보이는 것에 반응할 수 없습니다. 대신 다음에 무슨 일이 일어날지 추측해야 합니다. 이는 로봇의 두뇌를 하나의 퍼즐로 만듭니다. 로봇은 다리가 '지금 당장' 어디에 있는지 정확히 알지 못하고, 오직 잠시 전에는 어디에 있었는지만을 알면서 어떻게 걸어야 할지를 알아내야 합니다. 여기서 큰 질문이 생깁니다. 우리는 문제를 해결하기 위해 비싸고 초고속인 로봇을 만들어야 할까요, 아니면 저렴한 로봇이 지연을 처리할 수 있을 만큼 똑똑해지도록 가르칠 수 있을까요?
이 논문은 두 번째 옵션을 시도하기로 결정한 한 팀의 이야기를 들려줍니다. 그들은 76밀리초라는 엄청난 모터 지연을 겪고 있는 300달러짜리 매우 저렴한 4족 보행 로봇인 미니 퍼퍼 2(Mini Pupper 2)를 가져왔습니다. 연구진은 하드웨어를 고치거나 로봇의 위치를 추측하기 위한 복잡한 수학적 가교를 구축하는 대신, 자연에서 영감을 얻기로 했습니다. 그들은 동물들이 신경 전달이 느릴 때 어떻게 걷는지 물었습니다. 그 답은 척수에 있었습니다. 척수는 뇌가 느리게 반응하더라도 다리가 계속 움직일 수 있도록 유지해 주는 특별한 리듬 생성기를 사용합니다.
연구진은 이 저렴한 로봇을 제어하기 위해 다양한 유형의 '두뇌' 네트워크(신경망)를 훈련시켰습니다. 그들은 단순한 표준형 두뇌(MLP라고 불리는)는 복잡한 규칙들을 이용해 수 시간 동안 수동으로 조정하지 않으면 처참하게 실패한다는 것을 발견했습니다. 그러나 더 발전된 '시간 인지형' 두뇌(LSTM이라 불리는)는 스스로 마법 같은 일을 해냈습니다. 이 두뇌는 로봇의 센서로부터 오는 노이즈가 섞인 지연된 신호들을 무시하는 법을 배웠고, 대신 척수에서 발견되는 중추 패턴 생성기(CPG)와 똑같이 자신만의 내부 리듬을 생성해 냈습니다.
결과는 놀라웠습니다. 이 스스로 학습된 리듬은 매우 강력해서, 연구진이 기존의 지연 위에 인위적으로 320밀리초의 지연을 추가로 더했을 때도 로봇은 계속 걸을 수 있었습니다. 단순한 로봇의 두뇌는 무너져 내려 멈춰 섰지만, 시간 인지형 두뇌는 꾸준한 속보를 유지했습니다. 이 논문은 이것이 단순히 운 좋은 우연이 아니라 일반적인 전략임을 시사합니다. 로봇에게 느리고 노이즈가 많은 하드웨어를 감당하도록 강요하면, 로봇이 찾을 수 있는 가장 똑똑한 해결책은 현재에 반응하려고 애쓰는 대신 스스로 미래를 생성하기 시작하는 것입니다.
연구팀은 또한 로봇의 실제적이고 노이즈가 섞인 센서 데이터(속도나 힘 등)를 사용하려고 시도하는 것이 오히려 상황을 악화시킨다는 것을 발견했습니다. 저렴한 센서들은 매우 신뢰할 수 없었기 때문에, 로봇은 팀이 그 센서들이 존재하지 않는 것처럼 행동하고 내부 리듬에 전적으로 의존하라고 지시했을 때 더 잘 걸었습니다. 그들은 두 개의 층으로 구성된 시스템을 구축했습니다. 장기적인 타이밍을 담당하는 '리듬 유지자'(LSTM)와, 고장 난 실제 센서를 대체하여 다리가 어디에 있어야 하는지 추측하는 단순한 '예측기'(작은 신경망)입니다.
결국, 이 논문은 잘 걷기 위해 10,000달러짜리 로봇이 필요하지 않다는 것을 증명합니다. 단지 기다릴 줄 아는 두뇌를 가진 저렴한 로봇만 있으면 됩니다. 내부 리듬을 생성하는 생물학적 기법을 모방함으로써, 연구진은 시뮬레이션과 실제 세계 사이의 간극을 메웠으며, 때로는 느리고 소란스러운 세상을 다루는 가장 좋은 방법은 세상의 소리에 귀를 기울이는 것이 아니라 자신만의 비트에 맞춰 춤을 추는 것임을 보여주었습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.