GigaBrain-0.7: Scaling Embodied Foundation Models to Emergent Capabilities with a Three-System Architecture
이 논문은 새로운 3개 시스템 아키텍처를 활용하고 37,000시간 이상의 이질적인 데이터로 학습되어, 다양한 로봇 형태에 걸쳐 기존의 최첨단 모델들과 비교하여 우수한 제로샷 일반화, 지시 이행 및 작업 성공률을 달성한 임보디드 파운데이션 모델인 GigaBrain-0.7을 소개한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
로봇이 어질러진 주방 식탁을 바라보고, "빨간 사과를 그릇에 넣어줘"라는 음성 요청을 이해하며, 물건을 쓰러뜨리지 않고 팔을 어떻게 움직여야 할지 정확히 파악할 수 있는 세상을 상상해 보십시오. 이것이 바로 체화된 인공지능(embodied AI)의 약속입니다. 즉, 단순히 정보를 처리하는 것이 아니라 물리적 세계와 상호작용하는 기계들 말입니다. 수년 동안 연구자들은 로봇에게 인간의 손이 물체를 움직이는 수천 개의 영상을 보여주며, 기계가 물리 법칙과 인과관계를 학습하기를 희망하며 가르치려 노력해 왔습니다. 그러나 큰 장애물이 남아 있었습니다. 로봇은 서로 다르게 만들어집니다. 어떤 것은 두 팔이 있고, 다른 것은 하나의 그리퍼(집게)가 있으며, 세 번째는 바퀴로 이동할 수도 있습니다. 한 종류의 로봇에서 수집된 데이터는 종종 다른 종류의 로봇에게 혼란을 줍니다. 게다가 단순히 영상을 보는 것만으로는 기계가 실수를 했을 때 다음에 어떤 일이 일어날지 예측하거나, 작업이 잘못되었을 때 어떻게 복구해야 하는지를 가르칠 수 없습니다. 문제는 우리가 언어를 이해하고, 세상을 보고, 어떤 종류의 로봇 몸체라도 제어할 수 있는 단일하고 똑똑한 '두뇌'를 구축할 수 있느냐는 것이었습니다. 이 모든 것을 방대한 양의 다양한 경험으로부터 학습하면서 말입니다.
한 연구팀이 이제 'GigaBrain-0.7'이라 불리는 시스템을 통해 중요한 진전을 선보였습니다. 이것은 단순한 단일 프로그램이 아니라, 실제 세계의 복잡한 상호작용을 처리하도록 설계된 조정된 시스템입니다. 연구진은 로봇에게 모든 것을 한 번에 무질서하게 학습시키려 하는 대신, 학습 과정을 서로 연결된 세 가지 뚜렷한 부분으로 조직했습니다. 첫 번째 부분은 손과 반사 신경 역할을 하며, 로봇의 모터를 즉각적으로 제어하여 동작을 실행합니다. 두 번째 부분은 계획가이자 관찰자 역할을 합니다. 장면을 관찰하고, 언어 지침을 이해하며, "식탁을 치워라"와 같은 큰 목표를 "컵을 집어라" 또는 "싱크대로 옮겨라"와 같은 작고 관리 가능한 단계로 나눕니다. 세 번째 부분은 가장 참신한 추가 요소로, 예측가이자 심판 역할을 합니다. 이 부분은 로봇이 현재의 경로를 계속 갈 경우 몇 초 후에 장면이 어떻게 보일지 상상하며, 그 미래에 점수를 부여하여 로봇이 진전을 보이고 있는지 아니면 실패를 향해 가고 있는지를 결정합니다.
이 시스템을 훈련하기 위해 연구진은 단일 데이터 소스에 의존하지 않았습니다. 그들은 37,000시간 이상의 경험이 담긴 거대한 라이브러리를 수집했습니다. 이 컬렉션에는 공장과 가정에서 작동하는 실제 로봇의 영상, 1인칭 시점에서 인간의 손이 물체를 조작하는 기록, 그리고 컴퓨터 시뮬레이션에서 생성된 데이터가 포함되었습니다. 또한 연구진은 인공지능을 사용하여 새로운 훈련 시나리오를 만들어냄으로써 로봇이 학습할 수 있는 상황의 다양성을 효과적으로 확장했습니다. 이 다양한 데이터의 혼합물을 시스템에 입력함으로써, 연구진은 모델이 특정 로봇만을 위한 특정한 기술을 암기하는 것이 아니라 움직임과 상호작용의 일반적인 원칙을 학습할 수 있도록 했습니다. 시스템은 두 팔을 가진 기계부터 휴머노이드 형태에 이르기까지 16가지 다른 유형의 로봇 몸체를 다루도록 훈련되었으며, 이를 통해 제어하는 특정 몸체에 따라 '왼쪽'과 '오른쪽', 또는 '쥐다'와 '놓다'의 이해를 적응시키는 법을 배웠습니다.
이 접근 방식의 결과는 산업 및 가정 환경의 실제 로봇을 통해 테스트되었습니다. 한 번도 본 적 없는 과업을 수행하도록 요청받았을 때, 시스템은 놀라운 일반화 능력을 보여주었습니다. 한 테스트에서 로봇은 엉망으로 쌓여 있는 옷더미 속에서 옷 한 벌을 접으라는 요청을 받았는데, 이는 천의 모양이 변함에 따라 기계가 끊임없이 움켜쥐는 힘을 조절해야 하는 작업입니다. 특정 셔츠에 대해 다시 훈련할 필요 없이, 시스템은 변형 가능한 물체를 성공적으로 조작했습니다. 또 다른 시나리오에서 로봇은 섞여 있는 식기들 사이에서 특정 색상의 숟가락을 집으라는 요청을 받았으며, 이를 통해 미묘한 언어 지침을 이해하고 새로운 물체에 적용할 수 있음을 입증했습니다. 시스템은 책상을 정리하거나 쌀을 쓰는 것과 같이, 로봇이 많은 작은 움직임을 실행하는 동안 전체적인 목표를 유지해야 하는 긴 연속 동작을 처리할 수 있음도 증명했습니다.
핵심적인 발견은 시스템의 미래 예측 및 자신의 진전도를 평가하는 능력이 성공률에 실질적인 차이를 만든다는 것이었습니다. 연구진이 시스템에서 예측 부분을 제거했을 때, 로봇은 복잡한 과업에서 어려움을 겪었으며, 종종 반복적인 동작의 루프에 빠지거나 사소한 오류로부터 복구하지 못했습니다. 예측 구성 요소가 활성화되었을 때, 로봇은 특정 움직임이 충돌이나 떨어뜨림으로 이어질 것임을 예상하고, 실수가 발생하기 전에 경로를 수정할 수 있었습니다. 이러한 능력 덕분에 로봇은 선물 포장을 하거나 큐브를 분류하는 것과 같은 어려운 과업을 이전 모델보다 훨씬 높은 신뢰도로 완수할 수 있었습니다. 연구진은 훈련 데이터의 양을 늘릴수록 로봇의 성능이 일관되게 향 향상되는 것을 발견했으며, 이는 시스템이 순수하게 경험의 방대함과 다양성으로부터 진정으로 학습하고 있음을 시사합니다.
또한 이 연구는 서로 다른 유형의 데이터가 어떻게 결합되는지의 중요성을 강조했습니다. 시스템은 실제 로봇 실험, 인간의 시연, 그리고 시뮬레이션 환경이 혼합되어 학습될 때 가장 좋은 성능을 보였습니다. 각 소스는 서로 다른 종류의 교훈을 제공했습니다: 실제 로봇은 특정 기계의 물리적 제약에 대해 가르쳐 주었고, 인간의 영상은 사람들이 자연스럽게 물체와 상호작용하는 방식을 보여주었으며, 시뮬레이션은 드물거나 위험한 시나리오를 안전하게 연습할 수 있게 해주었습니다. 이러한 소스들을 혼합함으로써, 시스템은 서로 다른 로봇 몸체에 적용될 수 있는 세상이 어떻게 돌아가는지에 대한 견고한 이해를 발달시켰습니다. 연구진은 시스템이 완벽하지 않으며 여전히 가장 복잡한 물리적 상호작용에는 어려움을 겪고 있지만, 이는 단일 작업을 위한 특화된 로봇을 만드는 것에서 새로운 도전에 적응할 수 있는 범용 지능을 만드는 것으로의 전환을 의미한다고 언급했습니다.
궁극적으로, GigaBrain-0.7은 훈련 데이터의 규모와 다양성을 키우는 것이 계획, 행동, 예측을 분리하는 구조화된 아키텍처와 결합될 때, 로봇을 더 유능하고 적응력 있게 만들 수 있다는 것을 보여줍니다. 이 시스템은 단순히 대본을 따르는 것이 아닙니다. 과업의 맥락을 이해하고, 자신의 행동에 따른 결과를 예상하며, 시간이 지남에 따라 자신의 경험으로부터 학습하여 개선합니다. 이러한 시스템이 가정이나 공장의 모든 가능한 상황을 다룰 수 있을 때까지는 여전히 할 일이 남아 있지만, 이 연구는 명확한 앞길을 제시합니다. 이는 로봇 공학의 미래가 단순히 더 나은 하드웨어를 만드는 데 있는 것이 아니라, 물리적 세계의 방대하고 다양한 경험으로부터 학습할 수 있는 더 똑똑하고 유연한 소프트웨어를 만드는 데 있다는 것을 시사합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.