Flex-: A Multi-Stream World-Action Model with Compute Flexibility
Flex-는 동결된 비디오 생성 VAE를 활용하여 RGB와 함께 3D 기하학 및 객체 의미론을 암시적으로 인코딩함으로써, 새로운 센서나 사전 학습 없이도 실제 양손 조작 작업에서 우수한 일반화와 효율성을 달 Achieve하는, 60억 개의 파라미터를 가진 세계 행동 모델(world-action model)이다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
로봇이 셔츠를 접거나 고장 난 장난감을 고치는 법을 배우려고 노력하는 모습을 상상해 보세요. 오랫동안 과학자들은 로봇에게 인간이 그 일을 수행하는 수천 개의 영상을 보여주며, 로봇이 단순히 그 동작을 '복제'하기만을 바랐습니다. 하지만 이는 자동차 계기판의 불빛만 보고 운전을 배우려는 것과 같습니다. 속도계가 올라가는 것은 보이지만, 도로의 상태나 곡선, 혹은 다른 차들에 대해서는 이해하지 못하는 것과 같죠. '월드-액션 모델(World-Action Models)'이라 불리는 더 새롭고 똑똑한 접근 방식은 이 문제를 해결하고자 합니다. 단순히 복제하는 대신, 이 모델들은 다음에 어떤 일이 일어날지를 예측하려고 노력합니다. 즉, "내가 팔을 이렇게 움직이면, 1초 뒤에 세상이 어떻게 보일까?"라고 스스로에게 묻는 것입니다. 미래를 추측함으로써 로봇은 물리 법칙과 물체들이 어떻게 상호작용하는지를 배우게 되며, 이를 통해 수백만 개의 예시 없이도 새로운 과제를 해결하는 능력이 훨씬 좋아집니다. 하지만 대부분의 똑똑한 로봇들은 여전히 평면적인 2D 이미지(표준 카메라와 같은)만을 바라보기 때문에, 무언가에 가려진 3D 물체를 잡으려고 할 때 혼란을 겪을 수 있습니다.
여기에 FLEX-π라는, 이 퍼즐을 해결하는 영리한 트릭을 가진 새로운 로봇 두뇌가 등장했습니다. FLEX-π를 한 숟가락의 국물만 보고도 그 안에 어떤 향신료가 들어있는지, 온도는 얼마인지, 농도는 얼마나 걸쭉한지를 즉각적으로 알아내는 숙련된 요리사라고 생각해 보세요. 과거에는 로봇에게 3D 형태(깊이감 등)나 물체의 의미(예: "이것은 공이 아니라 컵이다")를 이해시키기 위해, 과학자들은 값비싼 3D 카메라를 제공하거나 로봇에게 세상을 보는 완전히 새로운 방식을 가르쳐야 했습니다. 그러나 FLEX-π는 '공짜 점심'을 발견했습니다. 이 모델은 평면 사진을 이해하는 데 사용하는 것과 동일한 두뇌가 추가적인 훈련이나 새로운 하드웨어 없이도 3D 형태와 물체의 의미를 거의 완벽하게 이해할 수 있다는 사실을 깨달았습니다.
연구진은 세 가지를 동시에 예측하도록 학습하는 60억 개의 파라미터(매우 거대한 디지털 두뇌)를 가진 모델을 구축했습니다. 그것은 바로 다음 장면이 어떻게 보일지, 장면의 3D 형태가 어떠할지, 그리고 장면 속의 중요한 물체들이 무엇인지를 예측하는 것입니다. 마법은 로봇이 이 세 가지를 함께 상상하도록 훈련할 때 일어납니다. 만약 로봇이 컵 사진을 본다면, 단순히 평면 이미지만 보는 것이 아니라 동시에 컵의 3D 깊이를 상상하고 그것이 '컵'이라는 사실을 인지하게 됩니다. 더욱 놀라운 점은, 연구진이 이 로봇에게 유연성을 가르쳤다는 것입니다. 훈련 중에 연구진은 때때로 3D 데이터나 물체의 이름을 숨겨서, 로봇이 오직 평면 사진만을 사용해 그것들을 추측하도록 강제했습니다. 덕분에 실제로 로봇이 작동할 때, 로봇은 카메라만을 사용하여 (3D 및 물체 데이터를 무시하고) '쾌속 모드'로 실행할 수 있으면서도 여전히 매우 똑똑하게 작동할 수 있으며, 시간이 허락한다면 모든 데이터를 사용하는 '슈퍼 모드'로 실행할 수도 있습니다.
결과는 인상적입니다. 정밀한 드라이버를 사용하여 자신의 그리퍼를 밀리미터 단위로 수리하거나, 부드럽고 말랑말랑한 필통의 지퍼를 올리는 것과 같은 까다로운 작업을 실제 로봇으로 테스트했을 때, FLEX-π는 기존의 최고 수준의 로봇 두뇌들을 큰 차이로 앞질렀으며, 때로는 2배에서 7배까지 더 나은 성능을 보였습니다. 이 모델은 인간이 그 과제를 수행하는 모습을 수백 번 볼 필요 없이, 아주 적은 양의 시연만으로도 이러한 복잡한 기술을 익혔습니다. 가장 놀라운 점은, FLEX-π를 '쾌속 모드'로 설정하여 카메라만을 사용하고 (학습했던 3D 및 물체 데이터를 무시하고) 실행했을 때조차, 다른 최고 수준의 로봇들보다 더 빠르고 성공적이었다는 사실입니다. 이 논문은 로봇에게 3D와 물체의 의미를 담아 미래를 상상하도록 가르치는 것이, 새로운 센서를 도입하거나 속도를 늦추지 않고도 로봇을 훨씬 더 똑똑하고 적응력 있게 만들 수 있음을 보여줍니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.