Motus2: A Self-Evolving General World Model for Dexterous Manipulation
Motus2는 정책, 시뮬레이션, 평가를 하나의 폐쇄형 의사결정 및 학습 루프로 통합하여, 스케일링된 모델 아키텍처와 점진적으로 확장되는 멀티모달 데이터셋을 활용함으로써 전문가의 시연과 스스로 생성한 상호작용 데이터를 통해 지속적인 개선을 가능하게 하는 정교한 조작을 위한 자기 진화형 일반 세계 모델이다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
인간의 복잡하고 예측 불가능한 과업들을 진정으로 처리할 수 있는 로봇을 만들기 위해, 과학자들은 오랫동안 단순히 지시 사항의 목록을 따르는 것 이상의 시스템을 추구해 왔습니다. 목표는 주변 환경을 인지하고, 다음에 어떤 일이 일어날지 상상하며, 행동을 취하고, 그 결과로부터 배워 다음번에는 더 잘할 수 있는 기계를 만드는 것입니다. '월드 모델(world model)'로 알려진 이 개념은 로봇을 위한 내부 시뮬레이터 역할을 합니다. 로봇은 단순히 현재 보이는 것에 반응하는 대신, 실제로 움직이기 전에 자신의 움직임이 가져올 결과를 추측하기 위해 정신적 시뮬레이션을 실행합니다. 이러한 시스템의 초기 버전들은 미래를 예측하거나 동작을 제안할 수는 있었지만, 대개 '보고, 추측하고, 행동하고, 멈추는' 직선적인 방식으로 작동했습니다. 그들은 자신의 예측을 되돌아보고, 그 예측이 좋은지 나쁜지 판단하며, 매번 인간이 올바른 방법을 보여주지 않아도 스스로의 의사결정 능력을 개선할 수 있는 방법을 갖추지 못했습니다.
연구진은 이제 도구를 사용하거나 인간과 유사한 손으로 물체를 다루는 것과 같이 섬세하고 복잡한 과업을 위해 특별히 설계된 자가 진화형 로봇 두뇌인 Motus2라고 불리는 시스템을 선보였습니다. 이 시스템은 사고와 학습 사이의 고리를 닫는다는 점에서 중요한 진전을 의미합니다. Motus2는 단순한 관찰자나 수동적인 추종자가 아니라, 스스로의 스승 역할을 합니다. 이 시스템은 일련의 가능한 움직임을 제안하고, 그 움직임이 미래에 어떤 모습일지 시뮬레이션한 다음, 그 상상된 결과가 성공으로 이어질지 여부를 평가합니다. 만약 시뮬레이션이 실패를 보여준다면 로봇은 그 실수로부터 배웁니다. 만약 성공을 보여준다면 그 경로를 강화합니다. 이 순환 과정을 통해 로봇은 매 단계마다 인간의 가이드가 없어도 자신의 아이디어를 끊임없이 테스트하고 정교화함으로써, 자신의 정책(policy), 즉 행동을 위한 일련의 규칙을 스스로 개선할 수 있습니다.
이 시스템의 토대는 인간의 손에서 수집된 방대한 양의 데이터에 기반합니다. 연구진은 카메라가 사람의 머리에 장착된 것처럼 1인칭 시점에서 녹화된 영상을 사용하여 로봇이 세상과 어떻게 상호작용하는지 가르치는 것으로 시작했습니다. 요리부터 정리 정돈까지 다양한 과업을 담은 단순한 단안 렌즈 영상으로 시작하여, 이후 인간의 양안 시야와 유사하게 깊이감을 제공하는 동기화된 스테레오 영상으로 넘어갔습니다. 이를 통해 로봇은 손이 물체를 움켜쥐고, 들어 올리고, 조작하는 미묘한 물리 법칙을 학습할 수 있었습니다. 그러나 단순히 인간을 관찰하는 것만으로는 서로 다른 신체를 가진 로봇에게 충분하지 않습니다. 이에 연구진은 시스템이 인간의 움직임을 자신의 로보틱 팔과 손의 특정 메커니즘으로 변환하는 법을 배우는 중간 단계의 훈련을 유도했습니다. 이 과정에는 수천 시간의 인간 데이터와 더불어, 인간과 로봇이 어떻게 협력할 수 있는지에 대한 구체적인 사례를 보여주는 과정이 포함되었으며, 이는 인간의 직관과 로봇의 실행 사이의 간극을 효과적으로 메워주었습니다.
Motus2가 독특한 점은 이 지식을 사용하는 방식에 있습니다. 이 시스템은 동시에 세 가지 역할을 수행하는 하나의 통합된 모델을 중심으로 구축되었습니다. 첫째, 다음 행동을 제 제안하는 정책(policy) 역할을 합니다. 둘째, 해당 행동을 취한 후 세상이 어떻게 보일지 예측하는 시뮬레이터(simulator) 역할을 합니다. 셋째, 예측된 미래가 좋은지 나쁜지 판단하는 평가자(evaluator) 역할을 합니다. 전통적인 시스템에서는 이러한 기능들이 종종 분리되어 있거나 단절되어 있지만, 여기서는 긴밀하게 엮여 있습니다. 로봇이 어떤 움직임을 고려할 때, 즉각적으로 정신적 시뮬레이션을 실행하여 그 결과를 확인합니다. 그런 다음 그 결과가 바람직한지 스스로에게 묻습니다. 만약 답이 '아니오'라면, 그 경로를 버리고 다른 경로를 시도합니다. 만약 답이 '예'라면, 그 행동을 실행에 옮깁니다. 이러한 내부 대화는 매우 빠르게 일어나기 때문에, 로봇은 근육 하나 움직이기 전에 최선의 경로를 선택하며 몇 단계 앞을 계획할 수 있습니다.
연구진은 두 개의 팔, 두 개의 정교한 손, 그리고 인간의 손가락 끝과 유사한 촉감을 느낄 수 있는 센서를 갖춘 완전한 로봇 플랫폼을 통해 이 시스템을 테스트했습니다. 그들은 로봇에게 공을 특정 위치에 놓거나, 전구를 소켓에 돌려 끼우거나, 지우개를 펜에 부착하는 것과 같은 어려운 과업들을 부여했습니다. 이 테스트에서 내부 평가자를 사용하여 최선의 옵션을 선택하도록 허용했을 때 로봇의 성공률은 크게 향상되었습니다. 더욱 인상적인 것은, 시스템이 자신의 예측을 사용하여 스스로의 학습 규칙을 업데이트하도록 허용했을 때 작업 능력이 더욱 향상되었다는 점입니다. 로봇은 단순히 운이 좋았던 것이 아니라, 시뮬레이션된 실수를 피하고 성공을 시뮬레이션한 행동을 반복하는 법을 진정으로 배웠습니다.
이 성공의 핵심 요소 중 하나는 과업 도중 정보가 일시적으로 가려지더라도 이전의 일을 기억하는 로봇의 능력이었습니다. 많은 복잡한 작업에서는 손이 물체를 가리거나, 최종 결과가 보이기 훨씬 전에 중요한 단계가 발생할 수 있습니다. 이를 처리하기 위해 연구진은 로봇에게 과거의 중요한 시각적 세부 사항을 보유할 수 있는 작업 기억(working memory) 형태를 부여했습니다. 그들은 최근의 사건들을 짧게 굴리는 창(window) 방식을 유지하는 것부터 더 길고 상세한 이력을 유지하는 것까지 다양한 방식의 메모리 관리법을 테스트했습니다. 결과에 따르면, 더 긴 이력에 접근할 수 있는 기능이 로봇으로 하여로 더 긴 기간 동안의 사건 순서를 기억해야 하는 과업을 해결할 수 있게 해주었으며, 이는 과거를 회상하는 능력이 미래를 예측하는 능력만큼 중요하다는 것을 입증했습니다.
또한 이 시스템은 촉각을 위한 특화된 모듈을 포함했습니다. 시각은 강력하지만, 손잡이가 미끄러지고 있는지 또는 표면이 너무 부드러운지는 항상 알려주지 못합니다. 로봇은 촉각 피드백을 처리하기 위해 전담하는 경량 전문가 시스템을 갖추고 있었습니다. 이를 통해 로봇은 실시간으로 움직임을 정교하게 조정하고, 미끄러짐이나 압력의 변화를 느끼는 즉시 움켜쥐는 힘을 조절할 수 있었습니다. 시각, 촉각, 사고, 그리고 학습의 결합은 현실 세계의 불확실성을 다룰 수 있는 견고한 시스템을 만들어냈습니다.
이러로 된 결과는 진정으로 유능한 로봇으로 가는 길이 단순히 더 많은 데이터를 수집하는 것이 아니라, 그 데이터를 사용하여 스스로를 의심하고 개선할 수 있는 시스템을 구축하는 데 있다는 것을 시사합니다. 대규모 인간 상호작용 데이터와 예측 및 평가의 자가 교정 루프를 결합함으로써, Motus2는 로봇이 이전에는 도달할 수 없었던 수준의 적응력을 가지고 물리적 세계를 조작할 수 있음을 보여주었습니다. 연구진은 훈련에 사용된 스테레오 영상의 양을 늘릴수록 인간의 행동을 예측하는 로봇의 능력이 일관되고 예측 가능한 방식으로 향상된다는 것을 발견했습니다. 이러한 확장은 더 많은 데이터가 있다면 이러한 시스템이 훨씬 더 능숙해질 수 있음을 시사합니다. 궁극적으로, 이 연구는 로봇이 모든 문제에 대한 모든 가능한 해결책을 프로그래밍받을 필요는 없다는 것을 보여줍니다. 대신, 미래를 시뮬레이션하고, 결과를 판단하며, 그 차이로부터 배울 수 있다면, 로봇은 복잡하고 정교한 세상을 마주하기 위해 스스로의 기술을 진화시킬 수 있습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.