CLAM: Continuous Latent Action Models for Robot Learning from Unlabeled Demonstrations
이 논문은 로봇이 레이블이 없는 관측 시퀀스로부터 자기 지도적 역학 예측을 통해 연속적인 잠재 행동을 추론하고 이를 작업 불가지론적 놀이 데이터(task-agnostic play data)로 접지함으로써, 비용이 많이 드는 액션 레이블이 지정된 시연 없이도 전문가 레이블이 있는 행동 복제와 유사한 성능을 달성할 수 있게 하는 프레임워크인 CLAM을 소개한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 로봇에게 블록을 쌓거나 음료를 따르는 것과 같은 어떤 일을 가르치려고 한다고 상상해 보세요. 보통 로봇을 가르치는 가장 좋은 방법은 당신이 로봇의 손을 잡고 모든 미세한 모터 움직임을 기록하면서, 무엇을 해야 하는지 단계별로 정확하게 보여주는 것입니다. 이것은 마치 학생에게 정답이 적혀 있는 교과서를 주는 것과 같습니다. 하지만 여기 함정이 있습니다. 이러한 모터 움직임을 기록하는 것은 믿을 수 없을 정도로 어렵고, 비용이 많이 들며, 지루한 일입니다. 인간 전문가가 로봇을 물리적으로 제어하며 몇 시간 동안 시간을 보내야 하기 때문에 매우 느리고 비용이 많이 듭니다.
이제 다른 종류의 선생님을 상상해 보세요. 이 선생님은 로봇을 가지고 있지 않습니다. 그저 비디오 카메라 한 대만 있을 뿐입니다. 그들은 자신이 과업을 수행하는 모습을 촬영하거나, 인터넷에서 사람들이 그 일을 하는 영상을 찾아냅니다. 로봇은 무엇이 일어나는지는 볼 수 있습니다—블록이 움직이고, 컵이 채워지는 것을 보는 것이죠—하지만 인간이 그것을 만들기 위해 손을 어떻게 움직였는지는 알지 못합니다. "모터 신호"가 빠져 있는 것입니다. 이것이 바로 로봇 공학 분야의 과학자들이 풀고자 하는 퍼즐입니다: '어떻게'에 대한 지침이 숨겨져 있는 영상을 보고도 로봇이 스스로 움직이는 법을 어떻게 배울 수 있을까? 이 논문은 바로 이 문제를 다루며, 값비싼 핸드헬드(hand-held) 훈련 세션 없이도 저렴하고 쉽게 수집할 수 있는 영상으로부터 로봇이 학습할 수 있도록 하는 것을 목표로 합니다.
이 논문의 연구진인 앤서니 리앙(Anthony Liang)과 그의 팀은 CLAM(Continuous Latent Action Models, 연속 잠재 행동 모델)이라고 불리는 새로운 방법을 소개합니다. CLAM을 아주 똑똑한 탐정이라고 생각해보세요. 이 탐정은 비디오의 연속된 두 프레임을 보고 그 변화를 일으킨 "보이지 않는 힘"을 추측할 수 있습니다. 만약 영상 속에서 컵이 테이블 왼쪽에서 오른쪽으로 이동하는 것을 본다면, CLAM은 그 사이에 일어난 구체적인 연속적 움직임을 알아내기 위해 노력합니다. 비록 그 컵을 움직인 손은 결코 보지 못했음에도 말이죠.
이 마법이 일어나는 방식은 다음과 같습니다. 먼저, 로봇은 방대한 양의 레이블이 없는 영상(그저 관찰 데이터일 뿐, 지침은 없음)을 시청합니다. 로봇은 현재 프레임과 숨겨진 행동에 대한 "추측"을 바탕으로 다음 프레임이 어떻게 보일지를 예측하려고 시도합니다. 만약 추측이 틀리면 예측은 실패하게 되고, 로봇은 자신의 추측을 조정하는 법을 배웁니다. 시간이 흐르면서, 로봇은 세상의 이치를 이해할 수 있는 이러한 "숨겨진 행동"들의 라이브러리를 구축하게 됩니다. 하지만 문제가 하나 있습니다. 이 숨겨진 행동들은 로봇의 뇌 속에 있는 숫자일 뿐, 아직 실제 모터 명령은 아니라는 점입니다.
이를 해결하기 위해, 팀은 두 번째의 더 작은 데이터 뭉치인 "플레이(play)" 데이터를 사용합니다. 이것은 로봇이 주변을 돌아다니며 물건에 부딪히거나 팔을 무작위로 움직이는 데이터인데, 이번에는 컴퓨터가 모터 명령을 실제로 기록합니다. 이것은 마치 로봇이 목표 없이 찰흙을 가지고 놀고 있지만, 자신의 손가락이 어떻게 움직였는지에 대한 일기를 쓰고 있는 것과 같습니다. CLAM은 이 일기를 사용하여 자신의 "숨겨진 행동" 추측을 실제 물리적 움직임으로 번역하는 법을 스스로 배웁니다. 여기서 핵심적인 혁신은 "추측"하는 부분과 "번역"하는 부분을 함께 훈련시킨다는 점입니다. 이를 통해 추측이 단순히 복잡한 숫자의 나열이 아니라, 로봇이 실제로 실행할 수 있는 단순하고 유용한 형태를 유지하도록 보장합니다.
결과는 상당히 인상적입니다. 팀은 컴퓨터 시뮬레이션(비디오 게임 세계와 같은 환경)과 WidowX라는 실제 물리적 로봇 팔을 사용하여 두 가지 방식으로 CLAM을 테스트했습니다. 그들은 CLAM이 부품을 조립하거나 물체를 집는 것과 같은 복잡한 과업을 해결하는 데 있어, 동일한 작업을 수행하려 했던 이전 방식들보다 2~3배 더 높은 성공률을 보였다는 것을 발견했습니다. 많은 경우에서, 로봇은 완벽한 "모터 명령" 데이터로 훈련받았을 때와 거의 대등한 성능을 보여주었습니다. 심지어 그 데이터를 직접 본 적이 없음에도 불구하고 말입니다.
결정적으로, 이 논문은 이러한 접근 방식이 "숨겨진 행동"이 (잘게 쪼개진 불연속적인 단계가 아니라) 연속적(부드럽고 유동적)일 때, 그리고 로봇이 그 적은 양의 "플레이" 데이터를 사용하여 행동을 번역할 때 가장 효과적이라는 것을 보여줍니다. 만약 행동을 경직되고 단계적인 형식으로 강제하거나, 번역 부분을 별도로 훈련시키려 했다면 로봇은 어려움을 겪었을 것입니다. 이 논문은 이 자가 지도 학습 방식의 탐정 작업과 약간의 무질서한 레이블 없는 플레이 데이터를 결합함으로써, 우리가 매 동작을 수동으로 기록할 필요 없이 로봇에게 새로운 기술을 가르칠 수 있음을 입증합니다. 이는 로봇이 우리가 모든 움직임을 일일이 기록해야 하는 방식이 아니라, 이미 인터넷에 존재하는 방대한 영상 콘텐츠로부터 학습할 수 있게 만드는 큰 진전입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.