← 최신 논문
💻 computer science

MINERVA: How Small Can a Manipulation Policy Be and Still Solve LIBERO?

이 논문은 LIBERO 벤치마크에서 최상위 수준의 성능을 달성하는 0.54M 파라미터의 매우 컴팩트한 비전-언어-행동 정책인 MINERVA를 소개하며, 해당 태스크의 용량 하한선이 놀라울 정도로 낮다는 점을 밝히는 동시에 지시문 조건화(instruction conditioning)의 견고함에 대한 결정적인 한계와 플로우 매칭(flow matching)의 이점 부재를 드러낸다.

원저자: Kohei Sendai, Tatsuya Matsushima, Yusuke Iwasawa

게시일 2026-09-04
📖 4 분 읽기☕ 가벼운 읽기

원저자: Kohei Sendai, Tatsuya Matsushima, Yusuke Iwasawa

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

로봇들은 한때 불가능해 보였던 정교함으로 움직이는 법을 배우고 있으며, 물체를 집어 올리고, 블록을 쌓고, 간단한 음성 명령을 따르고 있습니다. 이러한 진보는 시각, 언어, 그리고 행동을 하나의 시스템으로 결합한 새로운 종류의 인공지능에 의해 추진되고 있습니다. 흔히 시각-언어-행동(vision-language-action) 모델이라 불리는 이 시스템들은 로봇의 두뇌 역할을 하며, 장면을 보고 "빨간 블록을 집어라"와 같은 요청을 이해한 다음, 그 과업을 완수하는 데 필요한 정밀한 움직임을 계산합니다. 이러한 두뇌를 훈련하기 위해 연구자들은 로봇이 얼마나 잘 수행하는지를 측정하는 척도로 사용되는 벤치마크라고 알려진 표준 세트의 도전 과제들을 사용합니다. 수년 동안 로봇 조작 분야에서 가장 인기 있는 벤치마크는 시뮬레이션된 환경에서 물체를 움직이는 40가지의 서로 다른 과업들의 모음이었습니다. 이 분야의 지배적인 믿음은 로봇이 이 과업들을 잘 해결하기 위해서는 거대한 두뇌, 즉 강력하고 비싼 컴퓨터 하드웨어가 필요한 수십억 개의 파라미터(내부 설정)를 가진 디지털 모델이 필요하다는 것이었습니다.

하지만 도쿄 대학교의 연구팀은 더 단순하고 실용적인 질문을 던졌습니다. 두뇌가 실제로 얼마나 커야 하는가 하는 점입니다. 만약 로봇이 공장이나 가정에서 특정 직무를 수행하도록 배치된다면, 세상의 모든 언어를 이해하거나 한 번도 본 적 없는 모든 물체를 인식할 필요는 없습니다. 로봇은 단지 고용된 특정 과업을 해결할 수 있으면 됩니다. 연구진은 표준적인 40가지 과업을 여전히 완벽하게 해결할 수 있는 가장 작은 버전의 로봇 두뇌를 찾고자 했습니다. 그들은 작업을 완수하는 데 필요한 최소한의 컴퓨팅 파워, 즉 로봇이 작은 저가형 칩에서 구동될 수 있을지 아니면 항상 거대한 서버가 필요할지를 결정할 임계치를 찾고 있었습니다.

이 한계를 찾기 위해 연구팀은 로봇에게 어떻게 움직일지 알려주는 프로그램인 로봇 정책(policy)의 가문(family)을 구축하고, 이를 체계적으로 작게 만들었습니다. 그들은 약 천만 개의 내부 설정을 가진 모델로 시작하여 단계적으로 크기를 줄여나가며, 로봇이 언제 실패하기 시작하는지를 관찰했습니다. 그들은 자연어 문장을 읽거나 사전 훈련된 시각 시스템을 사용하는 것과 같이 대규모 모델에서 흔히 볼 수 있는 복잡한 기능들을 제거했습니다. 대신, 연구진은 로봇에게 숫자로 표현된 40개의 단순한 과업 목록과 처음부터 학습하는 카메라를 부여했습니다. 그런 다음 이 모델들을 표준 40개 과업에 대해 훈련시키고, 성공 횟수를 확인하기 위해 2,000번 이상 테스트했습니다.

결과는 놀라운 바닥(floor)을 드러냈습니다. 연구진은 단 0.54백만 개의 파라미터를 가진 모델이 95.1%의 성공률로 과업을 해결할 수 있다는 것을 발견했습니다. 이 아주 작은 모델은 수십억 개의 파라미터를 가지고 있으며 수천 배 더 큰, 이 분야에서 가장 유명한 대규모 모델들과 거의 대등한 성능을 보여주었습니다. 모델의 크기가 약 1백만 파라미터에 도달했을 때 로봇의 성능은 유의미하게 향상되지 않았으며, 그 지점을 넘어서는 추가적인 컴퓨팅 파워는 수익 체감의 법칙(diminishing returns)을 보였습니다. 반대로, 모델을 25만 파라미터 미만으로 줄였을 때 로봇의 수행 능력은 특히 더 복잡하고 긴 시간이 소요되는 과업에서 급격히 무너졌습니다. 이는 이 특정 도전 과제들에 대해서는 로봇에게 거대한 두뇌가 필요한 것이 아니라, 작고 효율적인 두뇌가 필요함을 시사합니다.

이 연구는 또한 로봇의 두뇌 중 어떤 부분이 실제로 중요한지도 밝혀냈습니다. 연구진은 모델을 구성하는 다양한 방식들을 테스트했으며, 가장 결정적인 자원은 로봇의 '눈'인 시각 정보를 처리하는 부분이라는 것을 발견했습니다. 시각 시스템에서 너무 많은 용량을 제거하면, 움직임을 계획하는 부분에 아무리 많은 힘이 남아 있더라도 로봇은 실패했습니다. 또한 그들은 부드럽고 유연한 움직임을 생성하기 위해 흔히 사용되는 복잡한 수학적 방법들이 이 수준의 성능을 내는 데는 필수적이지 않다는 것을 발견했습니다. 더 단순하고 빠른 움직임 계산 방식이 똑같이 잘 작동했으며, 이를 통해 로봇은 순식간에 결정을 내릴 수 있었습니다.

아마도 가장 눈에 띄는 발견은 로봇이 명령을 이해하는 방식이었을 것입니다. 대규모 모델에서 로봇은 "컵을 집어라"와 같은 문장을 읽고 단어의 의미를 이해하려고 노력합니다. 이 작은 모델에서 연구진은 언어를 단순한 숫자 코드로 대체했습니다. 연구진이 이 코드들을 뒤섞어 로봇에게 과업에 대한 잘못된 숫자를 주었을 때, 로봇의 성공률은 거의 0에 가깝게 떨어졌습니다. 이는 이 특정 벤치마크에서 로봇이 일반적인 의미에서 언어를 진정으로 "이해"하는 것이 아니라, 단순히 어떤 시각적 패턴이 어떤 숫자 코드와 일치하는지를 암기하고 있었음을 증명했습니다. 명령은 특정 암기된 행동을 해제하는 열쇠에 불과했습니다.

이러한 차이는 로봇을 제작하고 사용하는 방식에 심오한 함의를 갖습니다. 연구진은 이 벤치마크에서 거대 모델들이 보고하는 높은 성공률이 로봇이 새로운 상황에 얼마나 잘 일반화할 수 있는지보다는, 얼마나 특정 과업을 잘 암기했는지에 대한 척도라는 것을 보여주었습니다. 연구진이 조명, 배경, 또는 물체의 모양을 바꾸는 등의 변형된 과업들을 이 작은 모델들에 테스트했을 때, 성공률은 급격히 떨어졌습니다. 이는 모델들이 세상의 근본적인 물리 법칙을 학습한 것이 아니라, 훈련 과업의 특정한 모습만을 학습했음을 드러냈습니다. 그러나 매일 동일한 40가지 과업을 수행하도록 배치된 로봇에게는, 이러한 암기가 바로 필요한 기능입니다.

이 연구의 실질적인 결과물은 매우 효율적인 로봇 정책입니다. 0.54백만 파라미터 모델은 별도의 그래픽 카드 없이 표준 노트북 컴퓨터에서 실행될 수 있으며, 10밀리초 미만 안에 결정을 내립니다. 이는 단 하나의 움직임을 계획하는 데 종종 몇 초가 걸리는 현재의 최첨단 모델들보다 수백 배 빠른 속도입니다. 작은 전문화된 모델이 표준 벤치마크를 해결할 수 있음을 입증함으로써, 연구진은 실용적이고 저렴한 로봇을 향한 길이 반드시 점점 더 커지는 두뇌를 만드는 것을 요구하지 않는다는 것을 보여주었습니다. 대신, 특정 직무에 딱 맞는 가장 작고 효율적인 두뇌를 찾는 것이 필요하며, 이는 공간, 전력, 비용이 제한적인 가정과 공장에 로봇을 배치할 수 있게 하는 발견입니다. 이 연구는 이러한 작은 모델들이 개방형 탐색에 필요한 대규모 범용 시스템을 대체할 수 있다고 주장하는 것은 아니지만, 고정된 과업 세트에 대해서는 필요한 역량이 이전에 믿어왔던 것보다 훨씬 작다는 점을 확고히 입증했습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →