← 최신 논문
💻 computer science

GaussVLA: Geometry-Aware Spatial Reasoning for Vision-Language-Action Model

GaussVLA는 2D 특징을 압축된 3D 가우시안 토큰으로 변환하는 가우시안 공간 토크나이저(Gaussian Spatial Tokenizer)와 구조적 기하학적 추론을 위한 깊이 인식 체인 오브 소트(Depth-Aware Chain-of-Thought) 모듈을 도입하여 공간 추론 능력을 강화한 파라미터 효율적인 Mamba 기반 시각-언어-행동(Vision-Language-Action) 모델로, 단 2억 개의 파라미터만으로 LIBERO 벤치마크에서 최첨단 성능을 달성했습니다.

원저자: Md Selim Sarowar, Md Tanvir Islam, Sungho Kim, Sangtae Ahn

게시일 2026-08-27
📖 4 분 읽기☕ 가벼운 읽기

원저자: Md Selim Sarowar, Md Tanvir Islam, Sungho Kim, Sangtae Ahn

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

인간이 물체를 조작하는 것을 관찰하며 학습할 수 있는 로봇은 현대 인공지능의 핵심 목표가 되었습니다. 수년 동안 연구자들은 카메라가 보는 세상을 디지털 사진과 매우 유사한, 색상이 있는 사각형의 평면 그리드로 취급하는 모델에 의존해 왔습니다. 이러한 모델은 어떤 물체가 존재하는지 인식하고 언어 명령을 이해하는 데는 뛰어나지만, 3차원 공간에서 해당 물체의 물리적 형태와 위치를 이해하는 데는 어려움을 겪습니다. 이들은 컵을 단순한 픽셀 패턴으로 볼 뿐, 테이블 위에 놓인 특정한 높이와 방향을 가진 견고한 물체로 보지 못합니다. 이러한 한계는 로로봇이 깨지기 쉬운 물건을 집거나 복잡한 작업 공간을 탐색하는 것과 같이 정밀한 핸들링이 필요한 작업을 수행하기 어렵게 만드는데, 이는 로봇에게 진정한 기하학적 감각이 부족하기 때문입니다.

이 간극을 메우기 위해, 연구진은 로봇에게 물리적 세계에 대한 더 직관적인 이해를 제공하도록 설계된 GaussVLA라는 새로운 시스템을 개발했습니다. 이 시스템은 평면 이미지에 의존하는 대신, 시각적 데이터를 공간에 떠 있는 작은 3차원 형상들의 집합으로 변환합니다. 각 형상은 물체가 어디에 있는지, 크기가 얼마인지, 그리고 그 정보에 대해 로봇이 얼마나 확신하는지에 대한 정보를 담고 있습니다. 연구진은 이러한 기하학적 이해를 공간 문제를 움직이기 전에 '생각'하는 새로운 방식과 결합하여, 매우 정확하면서도 놀라울 정도로 작은 로봇 컨트롤러를 만들어냈습니다. 테스트 결과, 이 시스템은 훨씬 더 크고 복잡한 모델들을 능가하였으며, 이는 로봇에게 더 나은 공간감을 부여하는 것이 단순히 뇌를 더 크게 만드는 것보다 더 중요하다는 것을 시사합니다.

문제의 핵심은 로봇이 현재 세상을 어떻게 "보는가"에 있습니다. 전통적인 시스템은 카메라 이미지를 긴 평면 패치 목록으로 분해하며, 멀리 있는 벽이든 로봇 바로 앞에 있는 도구이든 상관없이 이미지의 모든 부분을 동일하게 중요하게 취급합니다. 이는 단순한 작업에는 효과적이지만, 로봇이 거리나 표면의 각도를 판단해야 할 때는 실패합니다. 이를 해결하기 위한 다른 시도들은 각 픽셀이 로봇으로부터 얼마나 떨어져 있는지를 알려주는 단일 숫자인 깊이 지도(depth maps)를 추가하는 것이었습니다. 그러나 이러한 깊이 지도는 종종 표면의 방향이나 그 거리 측정값이 얼마나 신뢰할 수 있는지에 대한 정보를 결리하지 못하여, 환경이 변할 때 로봇을 추측하게 만듭니다.

연구진은 가우시안 공간 토크나이저(Gaussian Spatial Tokenizer)라고 불리는 새로운 시각 데이터 처리 방식을 도입하여 이 문제를 해결했습니다. 평면 이미지를 공중으로 들어 올려 각각의 패치를 작은, 흐릿한 3D 구름(cloud)으로 만든다고 상상해 보십시오. 각 구름은 중심점, 크기, 그리고 해당 물체가 나타내는 국부적 기하학을 설명하는 형태를 가집니다. 결정적으로, 시스템은 각 구름에 신뢰 점수를 할당하여 로봇이 세계의 그 부분에 대해 얼마나 확신하는지를 알려줍니다. 이를 통해 로봇은 테이블의 가장자리나 컵의 손잡이처럼 가장 신뢰할 수 있는 부분에 집중하고, 불확실한 영역은 무시할 수 있습니다. 이 변환은 평면 사진을 로봇이 추론할 수 있는 구조화된 3차원 지도로 바꿉니다.

로봇이 이 3D 지도를 갖게 된 후에도, 여로 여전히 무엇을 할지 결정해야 합니다. 이전의 시스템들은 종로 움직이기 전에 긴 텍스트 기반의 생각들을 생성함으로써 계획을 세우려 했으며, 이 과정은 느리고 실제 물리적 행동과 동떨어진 경우가 많았습니다. 새로운 시스템은 '깊이 인식 체인 오브 쏘트(Depth-Aware Chain-of-Thought)'라는 다른 접근 방식을 사용합니다. 로봇은 긴 이야기를 써 내려가는 대신, 작은 규모의 집중된 질문들을 사용하여 3D 지도를 빠르게 스캔하고 작업에 필요한 가장 중요한 공간적 관계를 추출합니다. 예를 들어, 로봇은 대상 물체가 로봇의 손과 비교했을 때 어디에 있는지 스스로에게 묻고, 그 답변을 사용하여 움직임을 직접 유도합니다. 이 방법은 느린 단계별 텍스트 생성이 아니라, 로봇의 움직임 결정과 동기화되어 일어나는 빠르고 구조화된 추론 과정입니다.

전체 시스템은 오늘날 대부분의 인공지능에서 사용되는 표준 모델보다 훨씬 빠르고 효율적으로 정보를 처리하도록 설계된 맘바(Mamba)라는 백본 아키텍처를 기반으로 구축되었습니다. 이러한 효율성은 로봇이 거대한 컴퓨터 없이도 실시간으로 결정을 내릴 수 있게 하는 데 필수적입니다. 연구진은 물체 이동, 블록 쌓기, 복잡한 지시 따르기 등 다양한 시뮬레이션 작업에서 시스템을 테스트했습니다. 이 테스트에서 새로운 시스템은 표준 벤치마크에서 93.5%의 성공률을 달로 달성하며 훨씬 더 큰 규모의 다른 선도적인 모델들을 능가했습니다. 공간 추론을 테스트하기 위해 설계된 특정 작업 세트에서는 100%의 완벽한 점수를 기록했습니다.

이 결과가 특히 놀라운 이유는 시스템의 크기 때문입니다. 많은 경쟁 모델이 작동을 위해 수십억 개의 파라미터를 필요로 하는 반면, 이 새로운 시스템은 단 200만 개의 파라미터로 작동합니다. 이는 현재 사용되는 가장 큰 모델들보다 약 97% 더 작으면서도, 물리적 공간을 이해하는 작업에서 더 나은 성능을 보여준다는 것을 의미합니다. 연구진은 실제 실험실의 로봇 팔에서도 시스템을 테스트했습니다. 카메라 노이즈나 약간 다른 물체 배치와 같은 실제 세계의 문제에 직면했을 때도 시스템은 높은 성공 수준을 유지했으며, 이는 시뮬레이션에서 학습한 3D 기하학적 이해가 실제 세계로 전이될 수 있음을 증명했습니다.

또한 연구는 조명 변화나 물체 색상 변화와 같이 시스템이 예상치 못한 변화에 직면했을 때 어떤 일이 일어나는지 조사했습니다. 시스템은 강력한 견고성을 보여주었지만, 연구진은 환경이 급격하게 변할 때 여전히 어려움을 겪는다는 점을 언급하며, 로봇을 모든 가능한 실제 상황에 적응시키는 데는 여전히 할 일이 남아 있음을 지적했습니다. 그러나 결과는 더 나은 로봇 조작의 핵심이 단순히 더 많은 데이터나 더 큰 모델을 갖는 것이 아니라, 로봇에게 점유하고 있는 공간에 대한 구조화된 3차원 이해를 부여하는 것임을 명확히 보여줍니다. 평면 이미지를 3D 구름으로 바꾸고 집중된 추론을 사용하여 이를 탐색함으로써, 연구진은 로봇이 더 높은 기술과 신뢰성을 가지고 물리적 세계를 다룰 수 있는 명확한 경로를 제시했습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →