GE-Act 2.0: Pretraining and Scaling a World-Action Model for Robotic Manipulation
GE-Act 2.0은 조작 데이터로부터 처음부터 학습된 새로운 월드 액션 모델로서, 제어 지향적 오토인코더, 단일 단계 시각적 플래너, 그리고 지식 정렬 선택적 최적화가 통합된 역역학 모델을 결합하여, 광범위한 스케일링과 교차 체형 전이를 통해 다양한 작업 및 체형 전반에 걸쳐 상당한 제로샷 성공을 달성한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
로봇은 오랫동안 공장 바닥의 달인이었으며, 동일한 정밀한 동작을 오류 없이 수천 번 반복해 왔습니다. 하지만 그들을 주방이나 거실, 혹은 어지러운 작업장으로 데려다 놓으면, 그들은 종-종 얼어붙곤 합니다. 문제는 단순히 손을 움직이는 것이 아니라, 그 손이 무언가에 닿았을 때 세상이 어떻게 변하는지를 이해하는 것입니다. 이를 해결하기 위해, 새로운 세대의 인공지능은 미래를 상상하는 법을 배우고 있습니다. 단순히 지금 보이는 것에 반응하는 대신, 이 시스템들은 특정 행동을 취했을 때 다음에 어떤 일이 일어날지를 예측하려고 시도합니다. '월드-액션 모델(world-action model)'이라고 알려진 이 접근 방식은 로봇이 근육 하나를 움직이기 전에 머릿속에서 일련의 사건들을 시뮬레이션하여, 그 결과가 목표와 일치하는지 확인하게 해줍니다. 수년간 연구자들은 기존의 비디오 생성기—가짜 영화를 만들도록 훈련된 프로그램들—를 가져와 로봇의 움직임을 이해하도록 강제함으로써 이러한 시스템을 구축하려 노력해 왔습니다. 그러나 이 방법은 비디오 생성기가 물리적인 신체를 제어하도록 설계된 것이 아니었기에, 로봇에게 모호한 물리적 이해만을 남기는 경우가 많았습니다.
AgiBot의 한 팀은 이제 다른 접근 방식을 도입했는데, 이는 오직 실제 세계의 상호작용 데이터만을 사용하여 로봇의 상상력을 밑바닥부터 구축하는 방식입니다. 그들은 GE-Act 2.0이라는 시스템을 만들었는데, 이는 미래를 예측하고 행동을 결정하는 것을 동시에 학습하지만, 결정적인 차이점이 있습니다. 바로 시스템의 모든 부분이 로봇과 인간이 물체를 조작하는 데이터로부터 처음부터 직접 훈련되었다는 점입니다. 연구진은 미리 만들어진 비디오 모델에 의존하지 않았습니다. 대신, 그들은 시스템에 압축된 움직임의 언어, 즉 제어를 위해 중요한 것에 집중하기 위해 불필요한 세부 사항을 제거하여 세상을 바라보는 방식을 가르쳤습니다. 이를 통해 로봇은 성공적인 시연, 실패한 시도, 심지어 기록된 지침 없이 작업하는 인간의 영상까지 포함된 방대하고 다양한 라이브러리로부터 학습할 수 있었습니다. 이러한 다양한 유형의 학습을 결합함으로써, 시스템은 일반화하는 법을 배웠습니다. 즉, 한 상황에서 배운 것을 한 번도 본 적 없는 완전히 새로운 상황에 적용할 수 있게 된 것입니다.
이 성과의 핵심은 연구진이 물리적 세계의 무질서한 현실을 처리한 방식에 있습니다. 로봇이 학습할 때 흔히 직면하는 혼란스러운 문제가 있는데, 바로 동일한 지시라도 여러 가지 방식으로 완료될 수 있다는 점입니다. 로봇에게 "빨간 컵을 집어라"라고 명령하면, 왼쪽에서 접근할 수도 있고, 오른쪽에서 접근할 수도 있으며, 손잡이를 잡거나 테두리를 잡을 수도 있습니다. 만약 훈련 데이터가 한 가지 방식만을 보여주는데 로봇의 상상이 다른 방식을 예측한다면, 시스템의 두 부분은 서로 어긋나게 됩니다. 연구진은 이를 '유효성 간극(validity gap)'이라고 명명했는데, 이는 로봇의 미래 예측이 수행해야 할 행동과 일치하지 않는 상태를 의미합니다. 이를 해결하기 위해 그들은 필터 역할을 하는 선택 프로세스를 개발했습니다. 로봇이 예측된 미래로부터 학습하기 전에, 그 미래가 수행해야 할 행동과 호환되는지 확인하는 절차를 거칩니다. 시스템은 가능한 여러 미래를 생성하고, 이를 요구되는 행동과 대조하여 검증한 뒤, 서로 말이 되는 것들로부터만 학습합니다. 이는 로봇이 서로 다른 행동이 어떻게 다른 결과로 이어지는지에 대한 이해를 흐리지 않도록 보장합니다.
이 훈련의 결과는 놀랍습니다. 특히 로봇이 연습해 본 적 없는 과업을 테스트했을 때 더욱 그러합니다. 연구진은 블록 쌓기, 액체 붓기, 수건 접기, 플러그 꽂기 등 100가지의 서로 다른 조작 과업을 통해 시스템을 평가했습니다. 이 테스트들은 훈련에 사용된 것과는 다른 조명, 배경, 물체 배치를 가진 환경의 실제 로봇 위에서 수행되었습니다. 시스템을 300시간의 작은 데이터셋으로 훈련했을 때, 한 로봇 모델에서 성공률은 17.1%에 불과했습니다. 그러나 연구진이 훈련 데이터를 30,000시간으로 확장하자 성공률은 꾸준히 상승하여 44.1%에 도달했습니다. 이러한 개선은 특정 과업에 대한 별도의 미세 조정 없이 이루어졌으며, 로봇은 단지 학습한 일반적인 기술을 새로운 과제에 적용한 것이었습니다. 더욱 놀라운 점은, 훈련 데이터의 2% 미만을 차지하는 두 번째의 다른 로봇 모델에서도 시스템이 강력한 능력을 보여주었다는 것이며, 이는 더 큰 데이터셋에서 학습된 기술이 새로운 물리적 형태에도 효과적으로 전이되었음을 시사합니다.
시스템의 지시 이행 능력 또한 까다로운 조건 하에서 테스트되었습니다. 많은 실험에서 로봇은 장면의 맥상이나 이전 습관에 기반해 예상했던 것과 상충하는 행동을 수행하도록 요청받았습니다. 예를 들어, 로봇이 움직임의 중간 단계에 있더라도, 경로를 변경하라는 명시적인 새로운 명령을 받으면 멈추고 따를 수 있었습니다. 90% 이상의 실험에서 로봇은 지시 내용이 미묘하거나 문맥이 혼란스러운 상황에서도 언급된 특정 물체, 색상, 모양 또는 위치를 정확히 식별해 냈습니다. 연구진은 로봇이 학습한 기술의 다양성과 새로운 과업을 성공적으로 수행하는 능력 사이에 강력한 연관성이 있음을 발견했습니다. 훈련 데이터가 더 다양할수록 로봇이 새로운 상황을 처리할 가능성이 높았습니다. 이는 더 유능한 로봇으로 가는 길이 단순히 더 나은 알고리즘뿐만 아니라, 그들이 소비하는 데이터의 양과 다양성에 달려 있음을 시사합니다.
이 연구는 인간이 세상을 이해하기 위해 사용하는 풍부하고 구조화되지 않은 데이터를 로봇이 학습할 수 있도록 하는 중요한 진전입니다. 미래를 예측하고 행동을 계획하는 것을 통합된 방식으로 구축하고, 여러 가능성 중에서 올바른 예측을 선택하도록 가르침으로써, 연구진은 견고하고 적응력이 뛰어난 모델을 만들어냈습니다. 이 결과는 충분히 다양한 경험이 뒷받침된다면 로봇이 물체의 행동 방식과 상호작용하는 법에 대해 깊고 직관적인 이해를 발달시킬 수 있으며, 경직된 프로그래밍을 넘어 더 유연한 형태의 지능으로 나아갈 수 있음을 보여줍니다. 매번 새로운 작업을 위해 재학습할 필요 없이 실제 하드웨어에서 보여준 이 방식의 성공은, 로봇이 역동적이고 예측 불가능한 환경에 배치되어 그곳에서 번창할 수 있는 미래를 가리키고 있습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.