Chain of Spatial Thoughts: Modality-Agnostic Spatial Grounding for Vision Language Models
이 논문은 추가적인 추론 시 모듈을 요구하지 않으면서도 공간 벤치마크에서 최첨단 성능을 달이는, 3D 기하학 및 객체 속성을 연쇄 사고(chain-of-thought) 처리를 위한 연속적 잠재 토큰으로 증류함으로써 시각-언어 모델의 공간 추론 능력을 향상시키는 경량화되고 양식 불가지론적인 프레임워크인 Space Tokens를 소개한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
로봇에게 지저질한 거실을 항해하는 법을 가르치고 있다고 상상해 보세요. 당신은 로봇에게 소파, 커피 테이블, 그리고 고양이의 사진을 보여줍니다. 기본적인 로봇은 "소파가 보입니다"라고 말할 수 있습니다. 하지만 테이블을 넘어뜨리지 않고 장난감을 집어 올리려면, 로봇은 훨씬 더 많은 것을 알아야 합니다. 소파의 크기는 얼마인가? 벽에서 얼마나 떨어져 있는가? 고양이가 테이블 위에 앉아 있는가, 아니면 그 아래에 있는가? 이것이 단순히 '보는 것'과 공간을 진정으로 '이해하는 것'의 차이입니다. 인공지능의 세계에서 이를 "공간 지능(spatial intelligence)"이라고 부릅니다. 오랫동안 컴퓨터는 사물을 인식하는 데는 뛰어났지만, 그 사물들이 3D 공간에서 어떻게 서로 맞물려 있는지 파악하는 데는 서툴렀습니다. 이를 해결하기 위해 과학자들은 두 가지 주요 방법을 시도했습니다. 컴퓨터의 뇌(모델)를 거대하고 비싸게 만들거나, 거리를 측정하기 위한 특수하고 무거운 도구를 추가하는 것이었습니다. 두 방법 모두 효과는 있지만, 느리고 번거롭습니다.
이제, 한 연구팀이 "스페이스 토큰(Space Tokens)"이라는 영리한 새로운 기술을 고안해 냈습니다. 표준적인 AI 모델을 시험을 치르는 학생이라고 생각해 보세요. 보통 학생이 방의 크기를 측정해야 한다면, 별도의 도구(각도기나 줄자)를 가져오거나 거대한 기하학 백과사전을 암기해야 합니다(거대한 뇌). 이 새로운 논문은 다른 접근 방식을 제안합니다. 만약 학생이 그냥 머릿속으로 측정을 하며 '생각'할 수 있다면 어떨까요? 연구진은 AI가 스스로의 사고 과정 내부에 보이지 않는 "정신적 메모"를 생성하는 법을 찾아냈습니다. 이 메모, 즉 "토큰"은 AI가 추가적인 도구 없이도 크기, 거리, 모양에 대해 추론할 수 있도록 돕는 미세하고 연속적인 기하학적 속삭임 역할을 합니다. 이는 마치 AI에게 대화하는 동안 사용할 수 있는 내장된 공간감을 부여하여, 속도를 늦추지 않으면서도 물리적 세계에 대해 더 똑똑하게 만드는 것과 같습니다.
문제점: 거대한 뇌 vs 무거운 도구
당신에게 사진을 아주 잘 설명하는 매우 똑똑한 친구가 있다고 상상해 보세요. 당신이 그에게 주방 사진을 보여주면, 그는 "냉장고가 있고, 토스터기가 있네요"라고 말할 수 있습니다. 하지만 당신이 "냉장고와 토스터기 사이에 거대한 피자 박스를 넣을 수 있을까요?"라고 묻는다면, 그는 공간을 실제로 '느끼지' 못하기 때문에 틀린 답을 할 수도 있습니다.
이를 해결하기 위해 과학자들은 두 가지 주요 경로를 시도했습니다. 첫 번째는 "스케일링(scaling)"으로, 이는 친구에게 도서관의 모든 책을 읽고 가능한 모든 방의 구조를 암기하라고 말하는 것과 같습니다. 이 방법은 효과적이지만, 실행하는 데 시간이 엄청나게 걸리는 거대한 뇌를 필요로 합니다. 두 번째는 "특화된 도구"로, 이는 친구에게 사진을 볼 때마다 레이저 측정기와 3D 스캐너를 사용하는 법을 알려주는 것과 같습니다. 이는 정확하지만, 느리고 비용이 많이 들며, 친구가 급히 움직여야 하거나 도구를 사용할 수 없는 상황에서는 사용할 수 없습니다.
이 논문의 저자들은 다음과 같은 간단한 질문을 던졌습니다. 우리는 친구에게 도서관이나 레이저 측정기 없이도 머릿속으로 공간을 그냥 "알 수 있도록" 가르칠 수 있을까?
해결책: 스페이스 토큰 (Space Tokens)
연구진은 스페이스 토큰이라는 방법론을 도입했습니다. AI 모델에 새로운 하드웨어를 추가하거나 모델을 거대하게 만드는 대신, 그들은 AI가 3D 공간을 나타내는 특수한 "토큰"(데이터의 작은 조각)을 생성하도록 가르쳤습니다.
이 토큰들을 AI가 자신의 생각 위에 붙이는 보이지 않는 포스트잇이라고 생각해 보세요.
- 장면 수준의 메모 (Scene-Level Notes): 일부 메모는 방 전체를 설명합니다. 이들은 바닥의 모양, 벽의 위치, 그리고 방의 깊이를 포착합니다.
- 객체 수준의 메모 (Object-Level Notes): 다른 메모들은 특정 아이템을 설명합니다. 이들은 물체가 어디에 있는지, 크기가 얼마인지, 그리고 어느 방향을 향하고 있는지에 대한 정보를 담고 있습니다.
핵심은 이 메모들이 "연속적(continuous)"이라는 점입니다. 즉, 단순히 "크다" 또는 "작다"와 같은 단순한 라벨이 아닙니다. 이들은 AI가 머릿속으로 수학 계산을 할 수 있도록 돕는 정밀한 좌표와 측정값과 같습니다. AI는 "선생님" 모델(매우 똑똑한 3D 재구성 시스템)로부터 예시를 보고 학습하며, 스스로 할 수 있을 때까지 연습함으로써 이러한 메모를 만드는 법을 배웁니다.
AI를 가르치는 방법
학습은 세 단계의 비디오 게임 레벨처럼 진행되었습니다.
- 레벨 1: 공간의 언어 배우기. AI에게 사진을 보여주고 장면의 3D 기하학적 구조와 일치하는 "포스트잇"(토큰)을 생성하도록 가르쳤습니다. AI는 자신의 내부적인 생각과 정밀한 3D 형태를 일치시키는 법을 배웠습니다.
- 레벨 2: 메모를 통한 사고. AI가 메모를 만드는 법을 익힌 후, 연구진은 AI가 질문에 답하는 데 이 메모를 사용하도록 가르쳤습니다. 연구진은 AI가 메모를 살펴보고 "냉장고가 2미터 떨어져 있기 때문에 피자 박스가 들어갈 수 없다"라고 말하도록 강제했습니다. 이것을 "생각의 사슬(Chain-of-Thought)" 추론이라고 하는데, 이제 그 생각에는 공간 데이터가 포함됩니다.
- 레벨 3: 연습을 통한 숙련. 마지막으로, 강화 학습(Reinforcement Learning) 기법을 사용했습니다. AI는 질문에 답하려고 시도했고, 만약 크기나 거리를 맞히면 "보상"을 받았습니다. 틀렸을 경우에는 실수로부터 배웠습니다. 이는 AI가 자신의 공간 메모를 사용하는 능력을 더욱 날카롭게 만드는 데 도움을 주었습니다.
연구 결과
결과는 인상적이었습니다. 연구진은 새로운 방법론을 VSI-Bench라는 까다로운 공간 이해 테스트에 적용했습니다.
- 이 방법을 Qwen3-VL-8B 모델에 적용했을 때, 점수가 4.3% 상승했습니다.
- 더 강력한 모델인 SenseNova-SI-1.3에 적용했을 때는 점수가 1.3% 상승했습니다.
하지만 진짜 승리는 특정 작업에서 나타났습니다. 새로운 방법론은 물체 크기 예측(정확도 79.2%)과 방 크기 예측(정확도 75.7%) 분야에서 세계 최고 수준이 되었습니다. 이 작업들은 보통 무거운 3D 도구가 필요한 작업들이지만, 이 방식은 오직 내부적인 "포스트잇"만을 사용하여 이를 해냈습니다.
이것이 중요한 이유
가장 흥다는 점은 AI가 뇌를 바꾸거나 추가적인 도구를 들고 다닐 필요가 없었다는 것입니다. AI는 단지 다르게 생각하는 법을 배웠을 뿐입니다. 연구진은 또한 이 "포스트잇"이 실재한다는 것을 보여주었습니다. 그들은 이 토큰들을 다시 3D 형태로 디코딩하여, AI가 실제로 방의 기하학적 구조를 학습했음을 확인했습니다. AI는 단순히 추측하는 것이 아니라, 공간에 대한 진정한 이해를 갖추고 있었습니다.
이는 우리가 더 크고, 느리고, 더 비싼 AI 모델을 만들 필요가 없음을 시사합니다. 우리는 단지 AI에게 공간적인 메모를 만들고 사용하는 법을 가르치기만 하면 됩니다. 이는 기계가 우리의 3D 세계를 항해할 수 있게 하는 더 가볍고, 빠르고, 유연한 방법이며, 우리 집을 돌아다녀야 하는 로봇이나 안전하게 운전해야 하는 자동차와 같은 분야에 있어 큰 진전입니다.
요약하자면, 이 논문은 단순하고 내부적인 토큰을 사용하여 AI가 "3D로 생각하는 법"을 가르침으로써, 모델을 더 무겁거나 느리게 만들지 않고도 물리적 세계를 훨씬 더 잘 이해하게 만들 수 있음을 보여줍니다. 이는 AI가 생각하는 방식에 대한 작은 변화가 그 능력이 발휘되는 영역에서의 거대한 도약을 이끌어낸 사례입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.