OpenWAM: An Open, Modular Exploration Towards Systematic World-Action Model Pretraining
본 논문은 핵심 설계 원칙을 도출하기 위해 통제된 실험을 통해 월드-액션 모델(World-Action Model) 사전 학습을 체계적으로 조사하는 개방형 및 모듈형 연구 스택인 OpenWAM을 소개하며, 결과적으로 6,400시간의 다양한 임바디드(embodied) 데이터로 학습된 고성능 OpenWAM- 모델을 공개한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
지능은 단순히 세상을 보는 것만이 아니라, 세상을 어떻게 변화시킬지 아는 것에 관한 것입니다. 수십 년 동안 과학자들은 사진 속의 물체를 인식하거나 문장으로 장면을 설명할 수 있는 컴퓨터 시스템을 구축해 왔습니다. 최근에는 이들은 한 장면이 시간이 흐름에 따라 어떻게 진화할지 상상하고, 이전 프레임을 바탕으로 비디오의 다음 프레임을 예측하는 모델을 만들어냈습니다. 이러한 시스템은 방대한 양의 영상을 관찰함으로써 세상의 물리 법칙(컵이 떨어지는 방식이나 문이 흔들리는 방식 등)을 학습합니다. 하지만 세상을 관찰하는 것과 그 안에서 행동하는 것 사이에는 간극이 존재합니다. 로봇에게는 단순히 다음에 일어날 일에 대한 예측 그 이상의 것이 필요합니다. 즉, 그 예측을 실현하기 위해 어떤 구체적인 움직임이 필요한지를 알아야 합니다. 이것이 바로 체화된 학습(embodied learning)의 과제입니다. 시각적 미래를 이해하는 것과 그곳에 도달하기 위한 물리적 행동을 생성하는 것 사이의 간극을 메우는 일입니다.
한 연구팀은 이 문제를 해결하기 위해 OpenWAM이라는 새로운 접근 방식을 도입했습니다. 로봇 컨트롤러의 설계를 교체 가능한 부품들의 집합처럼 취급하는 개방형 모듈식 시스템을 만듦으로써, 변경하거나 이해하기 어려운 단일하고 경직된 로봇 두뇌를 구축하는 대신 이들은 더 유연한 방식을 택했습니다. 그들은 로봇에게 행동을 가르치는 복잡한 과제를 세 가지 명확한 질문으로 나누었습니다. 로봇이 영상을 통해 어떤 지식을 물려받아야 하는가, 로봇의 세상에 대한 이해와 움직이는 능력이 어떻게 함께 작동해야 하는가, 그리고 이러한 학습을 어떻게 다양한 유형의 로봇과 환경에 걸쳐 확장할 수 있는가 하는 점입니다. 이 질문들에 대해 통제된 실험을 통해 답함으로써, 그들은 실세계와 시뮬레이션 환경 모두에서 물체를 조작하는 법을 배울 수 있는 강력한 새로운 모델인 OpenWAM-α를 탄생시킨 일련의 원칙들을 추출해 냈습니다.
연구진은 먼저 로봇이 어떤 종류의 '세상 지식'을 가지고 시작해야 하는지 자문했습니다. 그들은 로봇이 수백만 시간의 영상을 본 거대한 비디오 생성기로부터 배워야 하는지, 아니면 더 단순한 시각 인코더에 의존해야 하는지를 테스트했습니다. 그 결과, 가장 좋은 성과는 거대한 사전 학습된 비디오 생성어를 기반으로 사용할 때 나타났습니다. 이 모델은 이미 물체가 어떻게 움직이고 상호작용하는지를 이해하고 있어 풍부한 출발점을 제공합니다. 그러나 단순히 이 비디오 모델에 로봇 팔을 부착하는 것만으로는 충분하지 않았습니다. 연구진은 로봇이 자신이 보는 것을 더 작고 효율적인 방식으로 표현할 방법이 필요하다는 것을 발견했습니다. 그들은 시각 정보를 더 작고 관리하기 쉬운 형태로 압축하는 다양한 방법을 테스트했으며, 세상의 필수적인 세부 사항은 유지하면서 노이즈는 버리는 특정 유형의 압축 방식이 가장 효과적이라는 것을 찾아냈습니다. 이를 통해 로봇은 데이터에 압도되지 않고 장면의 중요한 부분에 집중할 수 있었습니다.
다음으로, 연구팀은 세상에 대한 이해와 움직이는 능력을 연결하기 위해 로봇의 '두뇌'가 어떻게 구조화되어야 하는지 조사했습니다. 그들은 비디오와 행동 부분이 완전히 분리된 모델부터 서로 깊게 얽혀 있는 모델까지 다양한 아키텍처 설계를 비교했습니다. 실험 결과, 가장 효과적인 설계는 이중 시스템 접근 방식이었습니다. 이 설정에서 모델의 한 부분은 세상의 미래 시각적 상태를 예측하는 데 집중하고, 전담 부분은 움직임의 시퀀스를 생성하는 데 집중합니다. 결정적으로, 이 두 부분은 끊임없이 서로 대화할 수 있도록 허용되었습니다. 행동 생성기는 계획된 미래를 보고 무엇을 할지 결정할 수 있고, 세상 예측기는 계획된 행동을 사용하여 다음에 일어날 일에 대한 자신의 비전을 정교화할 수 있습니다. 이러한 지속적인 양방향 대화를 통해 모델은 단순히 보는 것과 행동하는 것을 나란히 배우는 것이 아니라, 둘 사이의 진정한 시너지를 학습할 수 있었습니다.
연구진은 또한 서로 다른 유형의 데이터를 사용하여 이 모델들을 어떻게 훈련할지 탐구했습니다. 그들에게는 두 가지 주요 데이터 소스가 있었습니다. 하나는 1인칭 시점에서 인간이 과업을 수행하는 영상으로, 매우 다양한 시각적 장면을 제공하지만 로봇의 행동 데이터는 없습니다. 다른 하나는 실제 로봇이 과업을 수행하는 기록으로, 정밀한 움직임 지침을 제공하지만 다루는 장면의 유형은 적습니다. 그들은 로봇 데이터만으로 훈련하는 것이 나은지, 인간 데이터만으로 훈련하는 것이 나은지, 혹은 두 가지를 혼합하는 것이 나은지를 테스트했습니다. 그들은 두 소스를 단일 훈련 세션에서 결합하는 것이 가장 강력한 전략이라는 것을 발견했습니다. 인간의 영상은 모델에게 세상의 광범위한 다양성을 가르쳤고, 로봇 데이터는 그 지식을 물리적 현실에 기반하게 했습니다. 이러한 결합은 모델이 한 가지 유형의 데이터로만 훈련되었을 때보다 보지 못한 새로운 상황에 훨씬 더 잘 일반화할 수 있게 해주었습니다.
이러한 원칙들을 사용하여 연구팀은 5억 프레임 이상의 비디오와 로봇 데이터를 학습시킨 OpenWAM-α를 구축했습니다. 그들은 8가지 서로 다른 시뮬레이션 벤치마크와 단일 암, 양팔, 심지어 정교한 손을 가진 실제 로봇을 대상으로 이 모델을 테스트했습니다. 결과는 일관되고 인상적이었습니다. 시뮬레이션에서 이 모델은 블록 쌓기부터 복잡한 물체 조작에 이르기까지 광범위한 작업에서 최고 수준의 성능을 보였습니다. 실제 세계로 옮겨졌을 때도 이 높은 성능을 유지하며, 한 번도 본 적 없는 물리적 로봇에서도 과업을 성공적으로 완수했습니다. 모델은 새로운 환경에 적응하는 데 특히 강점을 보였으며, 이는 비디오 기반의 세상 지식과 행동 기반의 접지(grounding)의 결합이 견고한 기초를 형성했음을 시사합니다.
이 접근 방식이 다른 인기 있는 방법들과 어떻게 비교되는지에 대한 연구 결과 중 하나는 매우 중요했습니다. 어떤 시스템은 언어와 시각적 이해에 크게 의존하지만 미래를 명시적으로 모델링하지 않는 반면, 다른 시스템은 순수하게 움직임의 역학에 집중합니다. 연구진은 자신들의 비디오 기반 접근 방식이 훈련 데이터를 맞추고 익숙한 환경에서 잘 수행하는 데 탁월한 반면, 다른 방법들은 때때로 완전히 새롭고 혼란스러운 환경에서 더 잘 일반화한다는 것을 발견했습니다. 그러나 그들은 어느 쪽도 단독으로는 완벽하지 않다고 결 결론지었습니다. 미래의 발전의 핵심은 두 가지 강점을 결합하는 데 있습니다. 즉, 행동을 안내하기 위해 비디오 생성의 풍부한 시각적 및 물리적 사전 지식을 사용하면서도, 실제 세계의 모든 범위를 포괄하는 다양하고 고품질인 데이터로 시스템을 훈련하는 것입니다.
OpenWAM 프로젝트는 단순히 새로운 로봇 컨트롤러를 제시하는 것을 넘어, 과학계에 완전한 툴킷을 제공합니다. 연구진은 인프라, 훈련 데이터, 평가 프로토콜을 공개함으로써 세상-행동 모델의 개발을 투명하고 재현 가능한 과학으로 탈바꿈시켰습니다. 이를 통해 다른 과학자들은 특정 아이디어를 테스트하고, 구성 요소를 교체하며, 왜 특정 설계가 더 나은 성능을 보이는지 정확히 이해할 수 있습니다. 이 연구는 더 유능한 로봇으로 가는 길이 더 크고 불투명한 시스템을 만드는 것이 아니라, 서로 다른 지식과 학습이 어떻게 상호작용하는지를 면밀히 이해하는 데 있음을 시사합니다. 로봇의 마음을 결합 가능한 부분들의 집합으로 다룸으로써, 연구진은 모든 설계 선택이 테스트되고 측정되며 개선될 수 있는 인공지능의 체계적인 탐구라는 새로운 시대의 문을 열었습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.