← 최신 논문
💻 computer science

Practice Makes Policies: Bootstrapping and Consolidating Robotic Capabilities from Zero Human Demonstrations

이 논문은 휴리스틱 추론, 예시 재사용, 그리고 반사적 실행을 조율함으로써 인간의 시연 없이도 로봇 조작 능력을 효율적인 폐루프 정책으로 자율적으로 부트스트래핑하고 통합하는 자기 개선형 계층적 체화된 에이전트인 HERO를 소개한다.

원저자: Jialiang Li, Yuhan Wang, Haojun Li, Gaojing Zhang, Yangtian Ye, Qipeng Liu, Haotian Liang, Wenzhao Lian

게시일 2026-07-30
📖 6 분 읽기🧠 심층 분석

원저자: Jialiang Li, Yuhan Wang, Haojun Li, Gaojing Zhang, Yangtian Ye, Qipeng Liu, Haotian Liang, Wenzhao Lian

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. ✨ 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

로봇이 단순히 인간 프로그래머가 작성한 엄격한 스크립트를 따르는 것이 아니라, 우리처럼 움직이고 생각하는 법을 배우는 세상을 상상해 보십시오. 이것이 바로 '체화된 AI(Embodied AI)'의 꿈입니다. 컴퓨터에 몸을 부여하여 실제 세상과 상호작나게 하는 것입니다. 현재 로봇에게 새로운 것을 가르치는 것은 보통 유아에게 신발 끈 묶는 법을 가르치는 것과 비슷합니다. 아이의 손을 잡고, 정확히 무엇을 해야 하는지 보여주며, 근육이 그 동작을 '기억'할 때까지 수백 번 반복해야 합니다. 이를 '인간의 시연으로부터의 학습(learning from human demonstrations)'이라고 합니다. 하지만 만약 로봇이 스스로 배울 수 있다면 어떨까요? 당신이 손가락 하나 까딱하여 길을 보여주지 않아도, 로봇이 세상을 관찰하고 이것저것 시도해 봄으로써 컵을 잡거나, 상자를 밀거나, 서랍을 여는 법을 스스로 터득할 수 있다면 어떨까요? 이것이 바로 연구자들이 추적하고 있는 거대한 질문입니다. 어떻게 하면 로봇이 아무런 도움 없이 기초부터 자신만의 '근육 기억'을 구축하게 할 수 있을까요?

여기에 스스로 학습하는 견습생처럼 행동하는 새로운 로봇 두뇌, HERO가 등장합니다. 이 논문은 HERO를 인간의 도움 없이 시작하여 영리한 3단계 진화를 통해 사물을 조작하는 법을 배우는 시스템으로 소개합니다. 이를 로봇이 성장하는 세 가지 뚜렷한 단계라고 생각하십시오. 첫째, '휴리스틱 추론(Heuristic Reasoning)' 단계를 사용하는데, 이는 마치 거대한 지식 도서관을 활용하여 한 번도 본 적 없는 과업을 수행하기 위해 똑똑하게 추측하는 탐정의 역할을 합니다. 만약 이 방법이 실패하거나 속도가 느려지면, '예시 재사용(Exemplar Reuse)' 단계로 넘어갑니다. 이는 이전에 유사한 물체를 성공적으로 움직였던 기억을 떠올려, 새로운 상황에 맞춰 그 동작을 조정하여 복사하는 것과 같습니다. 마지막으로, 충분히 연습한 후에는 순수한 근육 기억인 '반사적 실행(Reflexive Execution)'을 발달시킵니다. 이는 매번 깊이 생각할 필요가 없는 빠르고 자동적인 반응입니다. 논문은 이 세 가지 기술을 혼합하고 로봇이 스스로 연습하게 함으로써, 블록 쌓기나 서랍 찾기와 같은 복잡한 과업을 수행하는 법을 배울 수 있으며, 결국에는 거의 생각하지 않고도 이를 수행할 수 있을 정도로 숙련될 수 있음을 보여줍니다.

논문의 핵심 이야기: 제로에서 근육 기억까지

상하이 교통대학교와 서섹스 대학교의 연구진으로 구성된 HERO 개발팀은 특정 문제를 해결하고자 했습니다. 오늘날 대부분의 로봇은 '정적인' 상태에 갇혀 있습니다. 즉, 일반적인 추론(무엇을 할지 말하는 것)에는 매우 뛰어나지만 실제 움직임은 느리고 서투르거나, 혹은 움직임은 매우 빠르지만 먼저 정확한 방법을 보여주어야만 움직일 수 있는 상태입니다. HERO는 스스로 기술을 진화시키는 시스템을 만듦으로써 이 간극을 메우고자 합니다.

논문은 로봇이 학습하기 위해 방대한 양의 인간 영상을 데이터베이스로 가질 필요가 있다는 생각에 반론을 제기합니다. 대신, HERO는 인간의 시연이 전혀 없는 상태에서 시작합니다. 이 여정은 '휴리스틱 부트스트래퍼(Heuristic Bootstrapper, 레벨 1)'를 사용하여 시작됩니다. "빨간색 패키지를 집어라"와 같은 새로운 과업에 직면했을 때, 이 레이어는 탐정처럼 작동합니다. 로봇은 시각-언어 모델(VLM, 이미지와 언어를 이해하는 AI의 일종)을 사용하여 장면을 관찰하고, 물체를 어디서 잡아야 할지 추측하며, 경로를 계획합니다. 완벽하지 않고 다소 느릴 수 있지만, 사전 훈련 없이도 과업을 수행해 냅니다.

로봇이 무언가를 성공적으로 잡으면, 그것을 그냥 잊어버리지 않습니다. 성공 사례를 '예시(exemplar)'로 저장합니다. 로봇이 더 많이 연습함에 따라 두 번째 단계인 '예시 가속기(Exemplar Accelerator, 레벨 2)'로 진입합니다. 이제 이전에 수행했던 것과 유사한 과업을 마주하면, 다시 추측할 필요가 없습니다. 저장된 예시를 찾아내어, 그 오래된 동작을 새로운 물체에 맞게 늘리거나 회전시켜 실행합니다. 이는 지난주에 특정 병을 열었던 방법을 기억했다가, 같은 크기의 새로운 병을 열 때 그 손목 비틀기 동작을 그대로 사용하는 것과 같습니다. 이 단계는 추측 단계보다 훨씬 빠릅니다.

마지막이자 가장 인상적인 단계는 '반사적 정책(Reflexive Policy, 레벨 3)'입니다. 로봇이 수백 번의 성공적인 시도를 수집한 후, 특별한 '근육 기억' 모델을 훈련시킵니다. 이 모델은 생각하고 복사하는 단계를 완전히 건너뜁니다. 물체와 목표를 보고 즉시 로봇 팔에 올바른 명령을 보냅니다. 이것이 논문에서 언급된 '폐루프(closed-loop)' 제어로, 로봇이 자신의 움직임을 지속적으로 확인하고 실시간으로 조정하는 것을 의미합니다. 이는 마치 사람이 물리 법칙을 생각하지 않고 공을 잡는 것과 같습니다.

실제 세계에서의 작동 방식

이를 테스트하기 위해 연구진은 네 대의 카메라가 설치된 실제 실험실 환경에 Franka Emika Panda 로봇 팔을 설치했습니다. 그리고 네 가지 서로 다른 도전 과제를 주었습니다: 다양한 색상의 패키지 집기, 특정 순서대로 블록 쌓기, 숨겨진 크로와상을 찾기 위해 서랍 열기, 그리고 숨겨진 붕대 롤을 드러내기 위해 상자 옮기기입니다.

로봇은 이 과업들을 단 한 번만 수행한 것이 아니라, **자율적 능력 진화(Autonomous Capability Evolution)**의 연속적인 사이클을 실행했습니다. 그 마법 같은 루프는 다음과 같습니다:

  1. 시도(Try): 로봇이 과업을 시도합니다. 새로운 과업이라면 '추측(L1)' 모드를 사용합니다.
  2. 저장(Save): 성공하면 동작을 저장합니다. 이미 본 적 있는 과업이라면 더 빠르게 진행하기 위해 '복사(L2)' 모드를 사용할 수 있습니다.
  3. 리셋(Reset): 과업을 마친 후, 로봇은 자동으로 모든 것을 시작 위치로 되돌리는 방법(역과업)을 파악하여 다시 시도할 수 있게 합니다. 로봇은 총 664번을 수행했습니다!
  4. 학습(Learn): 충분한 데이터를 모은 후, '근육 기억(L3)' 모델을 훈련시킵니다.

결과는 꽤 시사하는 바가 컸습니다. 논문에 따르면 HERO는 인간의 도움을 거의 받지 않고도 이 방대한 양의 데이터를 수집할 수 있었습니다. 서브태스크당 인간의 개입은 약 1.03초에 불과했으며, 이는 주로 로봇이 막혔을 때 장면을 수정하는 용도였습니다. 로봇은 인간의 손길 없이 46회의 연속적인 서브태스크 사이클을 완수했습니다.

최종 로봇을 이 과업들에 테스트했을 때, 전체 HERO 시스템(세 가지 레이어 모두 사용)은 네 가지 서로 다른 과업에 대해 **86.0%**의 성공률을 달お했습니다. 이는 하나의 레이어만 사용했을 때보다 현저히 높았습니다. 예를 들어, '추측' 레이어(L1)만 사용했을 경우 성공률은 **76.0%**로 떨어졌습니다. '근육 기억' 레이어(L3)만 사용했을 경우에는 **70.0%**였습니다. 논문은 비결이 바로 '유연성'에 있다고 제안합니다. 가능한 한 빠른 근육 기억을 사용하되, 상황이 까다로워지거나 새로운 것에 직면했을 때 투입할 수 있는 '복사' 및 '추측' 기술을 준비해 두는 것입니다.

트레이드오프와 문제점

논문은 한계점에 대해서도 솔직하게 밝히고 있습니다. '추측' 레이어(L1)는 많은 생각과 3D 매핑을 수행해야 하기 때문에 서브태스크당 약 46.57초가 걸려 가장 느립니다. '복사' 레이어(L2)는 20.96초로 더 빠릅니다. '근육 기억' 레이어(L3)는 반복적인 과업에 가장 효율적이지만, 실제 로봇이 움직이는 시간을 포함하여 37.90초가 소요됩니다(이는 긴 과정입니다).

연구진은 또한 실패가 발생하는 지점을 분석했습니다. 120번의 과업 시도 중 73번은 오류 없이 완벽하게 완료되었습니다. 발생한 실패들은 대부분 로봇이 물체의 위치를 잘못 판단하거나(인지 오류), '두뇌'가 잘못된 이동 순서를 계획했기 때문이었습니다. 흥쟁스럽게도 시스템의 '모니터링' 기능은 매우 우수하여, 과업 실패를 **94.5%**의 확률로 정확히 식별해 냈으며, 이를 통해 다시 시도하거나 도움을 요청할 수 있었습니다.

저자들은 HERO가 큰 진전이지만 아직 완벽하지는 않다고 제안합니다. '추측' 부분은 여전히 느릴 수 있으며 때때로 물체의 3D 형태를 잘못 읽기도 합니다. 또한, 로봇은 현재 인간이 설계한 기본적인 동작(예: 잡기, 밀기, 당기기)의 사전 정의된 목록에 의존하고 있습니다. 아직 스스로 완전히 새로운 유형의 움직임을 만들어낼 수는 없습니다.

요약

간단히 말해, HERO는 로봇이 백지 상태에서 시작하여, 직접 해보며 배우고, 결국 인간이 매 단계마다 손을 잡아주지 않아도 자신만의 '근육 기억'을 발달시킬 수 있음을 증명합니다. 이는 로봇의 미래가 단순히 더 똑똑한 두뇌나 더 강한 팔을 만드는 것이 아니라, 경험이 쌓임에 따라 생각하기, 복사하기, 반응하기 사이를 매끄럽게 전환할 수 있는 시스템을 만드는 데 있다는 것을 시사합니다. 이 논문은 모든 로봇 문제를 해결했다고 주장하는 것이 아니라, 복잡하고 예측 불가능한 우리 세상에서 진정으로 배우고 적응할 수 있는 기계들을 향한 유망한 경로를 제시하고 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →