Zeva: In-Context Causal Learning for Generalizable Embodied Manipulation
Zeva는 로봇의 물리적 경험으로부터 인과적 상호작용을 추출하여 이중 시간 척도 메모리에 저장함으로써, 고정된 정책 모델이 그래디언트 업데이트 없이 인컨텍스트 학습을 통해 다양한 과업에 걸쳐 성능을 스스로 진화시키고 향상시킬 수 있도록 하여 일반화 가능한 체화된 조작을 가능하게 하는 새로운 프레임워크이다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
로봇은 오랫동안 공장 바닥의 달인이었습니다. 그곳에서 로봇은 동일한 동작을 수천 번씩 완벽한 정밀도로 반복합니다. 하지만 로봇을 그 통제된 환경에서 벗어나 실제 주방이나 실험실로 데려가면, 로봇은 종종 비틀거립니다. 물리적 세계는 무질서합니다. 물체는 움직이고, 표면은 고르지 않으며, 그리퍼가 물이 담긴 유리잔을 느끼는 방식은 금속 컵을 느끼는 방식과 다릅니다. 수년 동안 로봇을 가르치는 주요한 접근 방식은 로봇이 실험실을 떠나기 전에 방대한 양의 영상과 데이터를 입력하여, 무엇이든 처리할 수 있는 충분한 일반 규칙을 배우기를 기대하는 것이었습니다. 그러나 이러한 로봇들이 한 번도 본 적 없는 상황에 직면했을 때, 그들의 내부 '두뇌'가 그 순간의 새로운 물리 법칙에 적응하지 못하기 때문에 빈번하게 실패하곤 합니다. 그들은 주어진 지식에 갇혀, 발생하는 과정 중에 자신의 실수를 통해 배울 수 없습니다.
칭화대학교와 Z-Trans AI의 연구진은 로봇이 실시간으로 인과관계를 생각하는 법을 배우는 다른 경로를 제안했습니다. 그들은 제바(Zeva)라고 불리는 시스템을 도입했는데, 이는 로봇이 근본적인 소프트웨어 코드를 전혀 변경하지 않고도 스스로의 성능을 향상시킬 수 있게 해줍니다. 로봇의 두뇌를 다시 훈련시키는 것은 느리고 위험한 일이지만, 제바는 고도로 조직화된 노트처럼 작동합니다. 로봇이 과업을 수행하려고 시도할 때, 제바는 자신이 움직였을 때 정확히 어떤 일이 일어났는지를 기록합니다. 즉, 특정 물체를 보았고, 팔을 특정 방식으로 움직였으며, 그 결과 물체가 제자리에 있었는지 아니면 넘어졌는지를 기록하는 것입니다. 시스템은 그 단 한 번의 상호작용으로부터 교훈, 즉 행동과 결과 사이의 인과적 연결 고리를 추출하여 저장합니다. 로봇이 동일한 과업을 다시 시도할 때, 로봇은 이 노트를 다시 살펴보고 관련 교훈을 찾아내어 다음 움직임을 조정하는 데 사용합니다. 이 과정은 즉각적으로 일어나며, 이를 통해 로봇의 핵심 프로그래밍이 얼어붙은 채 변하지 않더라도 매 시도마다 더 나아질 수 있게 합니다.
연구진은 이 아이디어를 매우 다른 두 세계에서 테스트했습니다. 먼저, 주전자, 토스터, 믹서기와 같은 복잡한 물체들로 가득 찬 정교한 주방 컴퓨터 시뮬레이션을 사용했습니다. 이 가상 환경에서 제바는 믹서 헤드를 열거나 전자레인지를 켜는 것과 같은 다섯 가지 뚜렷한 과업에 직면했습니다. 결과는 놀라웠습니다. 다른 첨단 로봇 시스템들이 약 60~72%의 성공률을 보인 반면, 제바는 76.8%의 성공률에 도달했습니다. 더 중요한 것은, 이 시스템이 명확한 자기 개선 패턴을 보여주었다는 점입니다. 과업의 첫 번째 시도에서 로봇은 약 4분의 1 정도만 성공했습니다. 하지만 실패로부터 얻은 교훈을 다음 움직임의 가이드로 삼아 동일한 시나리오를 계속 반복하게 되자, 성공률은 꾸준히 상승했습니다. 네 번째 시도에 이르렀을 때, 로봇은 73%의 사례에서 성공했습니다. 이는 로봇이 단순히 운이 좋았던 것이 아니라, 자신의 행동으로부터 오는 물리적 피드백을 통해 진정으로 학습하고 있었음을 증명했습니다.
이것이 단순히 컴퓨터 시뮬레이션의 결과가 아님을 확인하기 위해, 연구진은 이 시스템을 실제 화학 실험실로 가져갔습니다. 그들은 시험관이나 비커와 같은 섬세한 유리 기구를 다루고 물을 붓거나 화학 물질의 무게를 재는 등의 과업을 수행할 수 있는 물리적 로봇 팔을 갖추었습니다. 이 환경은 실제 중력, 마찰력, 그리고 유리가 깨질 위험이 존재하는 훨씬 더 예측 불가능한 곳이었습니다. 여기서 제바는 기존의 최고 시스템들을 다시 한번 능가했습니다. 시험관을 집는 것과 같은 단순한 과업에서는 100%의 성공률을 보였습니다. 염 용액을 준비하는 것과 같이 더 복잡한 순서의 과업에서는 70%의 성공률을 달성하며 경쟁자들보다 현저히 높은 수치를 기록했습니다. 연구진은 또한 로봇이 전체 작업을 마쳤는지 여부뿐만 아니라, 과정의 얼마나 많은 부분을 완료했는지도 측정했습니다. 과업이 어려울 때조차 제바는 다른 어떤 시스템보다 요구되는 단계들을 더 많이 완료해냈으며, 이는 상호작용을 통해 배우는 능력이 물리적 세계의 무질서한 현실을 헤쳐 나가는 데 도움이 된다는 것을 보여주었습니다.
제바의 성공의 핵심은 기억을 조직하는 방식에 있습니다. 시스템은 자신이 했던 모든 일을 긴 목록으로 저장하는 것이 아닙니다. 그렇게 하면 빠르게 처리하기에는 너무 많기 때문입니다. 대신, 두 가지 유형의 메모리가 함께 작동합니다. 하나는 지난 몇 초간의 행동을 기억하여 로봇이 지금 무슨 일이 일어나고 있는지 이해하도록 돕는 단기 흔적(short-term trace)입니다. 다른 하나는 이전 시도가 실패했더라도 가장 유용한 교훈을 유지하는 지속적 메모리(persistent memory)입니다. 로봇이 새로운 시도를 시작할 때, 로봇은 이 지속적 메모리에서 현재 직면한 상황과 유사한 상황을 검색합니다. 그런 다음 과거의 경험을 가이드로 사용합니다. 예를 들어, 이전에 물을 붓다가 너무 빨리 기울여서 컵이 넘어졌다면, 로봇은 그 구체적인 인과관계를 기억합니다. 다음 시도에서 로봇은 이 메모리를 참고하여 기울이는 속도를 늦춤으로써 똑같은 실수를 피합니다. 이 과정은 로봇의 메인 소프트웨어에 아무런 변화를 주지 않고 진행되므로, 로봇은 전체 두뇌를 다시 훈련시키는 느리고 위험한 과정 없이 즉각적으로 배우고 적응할 수 있습니다.
연구진은 또한 이 시스템이 자신의 실수뿐만 아니라 인간으로부터도 배울 수 있다는 것을 발견했습니다. 한 실험에서, 인간이 복잡한 과업의 성공적인 단 한 번의 시도를 통해 로봇 팔을 물리적으로 안내했습니다. 시스템은 이 인간의 시연을 기록하고, 인과적 교훈을 추출하여 메모리에 저장했습니다. 그 후 로봇이 스스로 과업을 시도할 때, 로봇은 이 단 한 번의 인간 사례를 사용하여 학습을 촉발했습니다. 이러한 '예열(warm-up)' 덕분에 로봇은 처음부터 완전히 독학해야 할 때보다 성공률을 최대 15%까지 높이며 훨씬 더 나은 성과를 낼 수 있었습니다. 이는 로봇이 단 한 번의 인간 시연으로부터 새로운 기술을 배울 수 있고, 그 후 자신의 반복적인 연습을 통해 그 기술을 정교화할 수 있음을 시사하며, 인간의 지도와 자기 진화의 힘을 결합할 수 있음을 보여줍니다.
연구는 또한 로봇이 한 과업에서 배운 교훈이 완전히 다른 과업에도 도움이 될 수 있는지를 조사했습니다. 그들은 시스템이 새로운 과업에서의 물리적 효과가 이전에 보았던 것과 유사하다는 것을 인식할 수 있다는 것을 발견했습니다. 예를 들어, 물을 붓기 위해 용기를 기울이는 동작은 비록 물체와 목표는 다르더라도 화학 물질을 섞기 위해 용기를 기울이는 동작과 유사하다고 인식되었습니다. 이러한 과업 간 지식 전이 능력은 로봇이 새로운 도전에 직면할 때마다 처음부터 다시 시작할 필요가 없음을 의미합니다. 로봇은 시간이 지나면서 구축해 온 물리적 인과관계의 라이브러리를 활용할 수 있으며, 이는 로봇을 더 다재다능하고 다양한 상황에서 역량을 발휘할 수 있게 만듭니다.
이러한 성공에도 불구하고, 연구진은 자신들의 작업에 대한 한계를 분명히 밝히고 있습니다. 현재 시스템은 특정 작업을 완료하기 위해 시도하는 과정 중에 발생하는 것들로부터만 학습합니다. 아직은 세상을 배우기 위해 단순히 돌아다니며 탐색하는 행동, 즉 '능동적 탐색(active exploration)'을 할 수 있는 능력은 없습니다. 저자들은 향다면 연구가 로봇이 스스로 실험을 선택하도록 가르치는 것, 즉 물리적 세계가 어떻게 작동하는지에 대한 불확실성을 줄이기 위해 의도적으로 다양한 행동을 시도하도록 하는 것에 집중할 것이라고 제안했습니다. 그때까지 제바는 로봇이 더 똑똑해지기 위해 반드시 재훈련될 필요는 없다는 것을 보여주는 중요한 진전입니다. 단순히 자신의 행동이 가져오는 결과를 주의 깊게 살피고, 무엇이 효과가 있었고 없었는지를 기억함으로써, 로봇은 스스로의 능력을 진화시키고 모든 실패를 다음 시도를 위한 교훈으로 바꿀 수 있습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.