ADEPT: Accelerating Dexterity via Pre-Training and Post-Training using Reinforcement Learning
ADEPT는 범용적인 작업들을 통해 사전 학습을 수행하고 안정적인 사후 학습 레시피를 채택함으로써, 원시 시각-촉각 인지로부터 복잡하고 장기적인 조작 과제들을 해결하기 위한 제로샷 심투리얼(sim-to-real) 전이를 가능하게 하여 고자유도 로봇의 인간 수준 숙련도 발전을 가속화하는 대규모 강화 학습 프레임워크입니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
로봇은 오랫동안 공장 바닥의 숙련가로서, 자동차를 조립하거나 상자를 쌓기 위해 경직된 정밀도로 움직여 왔습니다. 그러나 달걀을 집어 들어 뒤집은 다음 그릇에 부드럽게 놓는 것과 같이 일상생활의 유연하고 섬세한 과업을 수행하라는 요청을 받으면 대부분의 기계는 비틀거립니다. 이것이 바로 기교(dexterity)의 과제입니다. 이는 로봇이 수십 개의 움직이는 부품을 동시에 조정하고, 물체가 미끄러지거나 구르거나 충돌하는 혼란스러운 물리 현상을 관리하기 위해 촉각과 시각에 실시간으로 반응할 것을 요구합니다. 수년간 연구자들은 로봇에게 엄격한 규칙을 프로그래밍하거나 인간의 시연을 보여줌으로써 이러한 기술을 가르치려 노력해 왔지만, 이러한 방법들은 환경이 조금만 변해도 종종 실패하곤 했습니다. 그러나 새로운 접근 방식은 로봇의 기교에 대한 비결이 모든 특정 과업을 처음부터 하나하나 가르치는 것이 아니라, 먼저 물리적 세계에 대한 폭넓고 기초적인 경험을 주는 데 있다고 제안합니다.
한 연구팀은 로봇이 먼저 일반적인 '재배치(repositioning)' 게임을 마스터함으로써 복잡한 조작 기술을 배울 수 있도록 하는 ADEPT라는 새로운 프레임워크를 개발했습니다. 로봇 손이 가상 세계에서 단순히 원기둥, 정육면체, 구와 같은 무작an한 모양들을 집어 올려 테이블의 다른 지점으로 옮기는 과정을 상상해 보십시오. 로봇은 특정한 목표 없이 오직 성공적으로 이동시키는 것만을 목적으로 하여, 물체를 뻗고, 움켜쥐고, 들어 올리고, 돌리는 법을 배웁니다. 이 단계는 물체가 어떻게 행동하는지, 그리고 로봇의 손가락이 물체를 제어하기 위해 어떻게 움직여야 하는지에 대한 깊고 직관적인 이해를 구축합니다. 이러한 토대가 마련되면, 연구자들은 핀을 구멍에 끼우거나 접시를 접시 랙에 놓는 것과 같은 구체적인 새로운 과업을 도입합니다. 처음부터 다시 시작하는 대신, 로봇은 이전의 경험을 가이드로 사용합니다. 연구자들은 이 방법이 로봇이 초기 단계의 서툰 학습 과정을 건너뛰고 새로운 구체적 과제에 즉시 일반적인 기술을 적용할 수 있게 해준다는 것을 발견했습니다.
이 접근 방식의 힘은 로봇이 한 번도 본 적 없는 과업에 직면했을 때 명확해집니다. 실험에서 연구자들은 다지형(multi-fingered) 손을 장착한 두 종류의 로봇 팔을 테스트했습니다. 하나는 23개의 움직이는 관절을 가졌고, 다른 하나는 29개를 가졌습니다. 연구자들은 수천 번의 시도를 동시에 실행할 수 있는 고충실도 시뮬레이션 환경에서 로봇을 훈련시켰습니다. 로봇은 먼저 다양한 단순한 모양들을 재배치하는 법을 배웠습니다. 그 후 연구자들이 로봇에게 정밀한 정렬과 접촉력의 처리가 필요한 과제인 '판에 핀을 삽입하기'와 같은 어려운 과업을 수행하도록 요청했을 때, 로봇은 제로(zero)에서 시작하지 않았습니다. 로봇은 이미 마스터한 기술인 뻗기, 잡기, 들어 올리기를 즉각적으로 인식했습니다. 로로봇이 배워야 했던 부분은 오직 마지막의 섬세한 삽입 과정뿐이었습니다.
하지만 단순히 한 가지 과업에 훈련된 로봇에게 다른 과업을 요구하는 것은 종종 학습한 내용을 잊게 만드는 원인이 됩니다. 연구자들은 만약 로봇의 행동을 직접 미세 조정(fine-tuning)하려고 시도하면, 새로운 지침이 기존의 기술을 덮어써 버려 로봇이 제대로 잡거나 들어 올리는 능력을 상실하게 된다는 것을 발견했습니다. 이를 해결하기 위해 그들은 세심한 훈련 레시피를 개발했습니다. 먼저, 로봇의 새로운 행동이 기존의 성공적인 행동과 유사해지도록 부드럽게 유도하는 기술을 사용하여 핵심 기술이 온전히 유지되도록 했습니다. 그다음, 로봇이 새로운 과업에 대해 무엇이 '좋은' 움직임인지 이해하는 과정을 천천히 조정하여 균형을 잃지 않고 적응할 수 있게 했습니다. 마지막으로, 카메라를 통해 보는 것과 손가락 끝을 통해 느끼는 것에만 의존할 수 있도록 훈련된 더 단순한 버전의 로봇을 만들어, 훈련 중에 사용했던 내부 데이터를 제거했습니다. 이 '학생' 로봇은 실제 세계로 보내졌습니다.
결과는 놀라웠습니다. 실제 세계에서 이 로봇들은 시각 및 촉각 피드백에만 의존하여 핀을 집어 들고, 손 안에서 방향을 바꾸고, 구멍에 삽생하는 일을 성공적으로 수행할 수 있었습니다. 그들은 대칭인 별 모양 핀과, 끼우기 위해 단 하나의 정밀한 방향 설정이 필요한 훨씬 더 어려운 비대칭 사각형-원형 핀을 모두 다룰 수 있었습니다. 또한 시스템은 평평한 접시를 집어 들어 뒤집은 다음 접시 랙에 놓는 일련의 동작을 학습했는데, 이는 초기 훈련에서 명시적으로 보여준 적이 없는 일련의 행동이었습니다. 로봇은 이 과업들을 인간과 비슷한 속도인 5초에서 10초 사이에 수행했으며, 이는 단순한 그리퍼와 외부 고정 장치를 사용한 기존 방식이 20초에서 70초가 걸렸던 것과 대조적입니다.
결정적으로, 연구자들은 로봇이 인간과 유사한 자연스러운 방식으로 물체를 쥐는 법을 개발했다는 것을 발견했습니다. 핀을 어떻게 잡아야 하는지 지시받지 않았음에도 불구하고, 로봇은 인간의 손처럼 안정적인 다점 파지(multi-point grip)를 통해 핀을 감싸 쥐는 법을 배웠습니다. 반면, 초기 재배치 단계 없이 훈련된 로봇들은 순간적으로는 작동하지만 압력이 가해지면 실패하는 어색하고 불안정한 방식으로 물체를 잡는 경향을 보였습니다. 이 연구는 로봇에게 물리학에 대한 폭넓고 일반적인 경험을 먼저 제공함으로써, 모든 것을 한꺼번에 배우려고 노력하는 것보다 훨씬 더 빠르고 신뢰성 있게 새로운 구체적 기술을 배울 수 있음을 시사합니다. 이 접근 방식은 단순히 로봇을 더 빠르게 만드는 것이 아니라, 로봇을 더 견고하게 만들며, 이전에는 도달할 수 없었던 수준의 기교로 예측 불가능한 실제 세계의 특성을 다룰 수 있게 합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.