← 최신 논문
🤖 AI

SPARGen: Unifying Spatial Perception and Reasoning through Native Multimodal Generation

SPARGen은 3D 재구성, 밀집 대응(dense correspondence), 공간 추론을 지시어 기반 생성 작업에 통합하여, 공유된 표현을 통해 이러한 이질적인 공간 작업 전반에서 경쟁력 있는 성능을 가능하게 하는 통합된 네이티브 멀티모달 생성 프레임워크이다.

원저자: Jinsheng Quan, Jianhua Li, Siyi Xie, Xuanke Shi, Kewang Deng, Zukai Chen, Feifei Shao, Lei Yang, Quan Wang, Yawei Luo

게시일 2026-08-17
📖 5 분 읽기🧠 심층 분석

원저자: Jinsheng Quan, Jianhua Li, Siyi Xie, Xuanke Shi, Kewang Deng, Zukai Chen, Feifei Shao, Lei Yang, Quan Wang, Yawei Luo

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 어질러진 거실의 사진을 보고 있다고 상상해 보세요. 당신의 눈에 그것은 그저 색상과 모양이 모인 평면적인 그림일 뿐입니다. 하지만 세상을 이해하려는 컴퓨터에게 그 이미지는 하나의 퍼즐입니다. 컴퓨터는 소파가 얼마나 멀리 있는지, 사진이 찍힐 때 카메라가 어디에 있었는지, 그리고 당신이 물건 주변을 걸어 다닐 때 물건들이 어떻게 움직일지를 파악해야 합니다. 이 과학 분야를 "공간 지각(spatial perception)"이라고 부르며, 이는 벽에 부딪히는 로봇과 방 안을 우아하게 항해하는 로봇 사이의 차이를 만듭니다. 오랫동안 과학자들은 이 퍼즐의 서로 다른 부분들을 별개의 작업으로 취급했습니다. 한 팀은 거리 측정(기하학)에 뛰어난 로봇을 만들었고, 다른 팀은 "램프 왼쪽에 무엇이 있는가?"와 같은 질문에 답하는 데 탁월한 모델(추론)을 만들었습니다. 하지만 인간의 뇌가 서로 대화하지 않는 별개의 "거리" 및 "논리" 센터를 가지고 있지 않은 것처럼, 이러한 컴퓨터 모델들은 서로로부터 배울 수 있는 기회를 놓치고 있었습니다.

여기에 SPARGen이라는 새로운 접근 방식이 등장했습니다. 이는 단 하나의 컴퓨터 모델이 이 모든 것을 한꺼번에 수행하도록 가르치려는 시도입니다. 이것을 단순히 그림을 그리는 것뿐만 아니라, 그 그림에 대한 이야기를 쓰고, 중력이 변했을 때 그림 속 물체들이 어떻게 떨어질지에 대한 정확한 물리 법칙까지 계산해 내는 초능력을 가진 예술가라고 생각해보세요. SPARGen은 깊이를 측정하기 위해 서로 다른 도구를 사용하는 대신, 하나의 통합된 "두뇌"를 사용하여 이 모든 답을 동시에 생성하는 법을 배웁나다. 이는 세상을 별개의 작업들의 집합이 아니라, 기하학과 언어가 동일한 장면을 설명하는 서로 다른 방식일 뿐인 하나의 연결된 이야기로 취급합니다.

문제점: "전문가"의 병목 현상

수년 동안 컴퓨터에게 공간을 가르치는 표준적인 방법은 모든 직무에 대해 "전문가"를 고용하는 것이었습니다. 장면의 깊이를 알고 싶다면 깊이 측정 모델에 물었고, 카메라 위치를 알고 싶다면 포즈 추정 모델에 물었으며, 소파 뒤에 무엇이 있는지 알고 싶다면 언어 모델에 물었습니다.

이러한 접근 방식의 문제는 이 전문가들이 서로 거의 대화하지 않는다는 점입니다. 방의 깊이를 아는 모델이 방에 대한 질문에 답하려는 모델을 반드시 도와주는 것은 아닙니다. 이는 채소를 써는 데는 천재적이지만 빵을 만드는 제빵사를 한 번도 만나본 적 없는 요리사가 완벽한 식사를 만들기 위해 협력할 수 없는 것과 같습니다. 게다가, 이러한 모델 중 다수는 수학을 처리하기 위해 추가적이고 번거로운 부가 장치들에 의존했으며, 이는 모델을 느리고 복잡하게 만들었습니다.

해결책: "만능 스토리텔러"

SPARGen은 **네이티브 멀티모달 생성기(native multimodal generator)**로서 게임의 판도를 바꿉니다. 전문가는 아니지만, 이미지텍스트라는 두 가지 언어를 모두 유창하게 구사하는 범용 모델입니다.

여기 마법 같은 기술이 있습니다. SPARGen은 모든 것을 "생성(generation)" 작업으로 취급합니다.

  1. "이미지" 관련 작업: 깊이, 포인트 클云(점들로 이루어진 3D 지도), 또는 광학 흐름(프레임 간 픽셀의 움직임)을 파악해야 할 때, 모델은 새로운 이미지를 "생성"합니다. 단순히 숫자를 계산하는 것이 아니라, 픽셀의 밝기가 사물의 거리를 알려주는 그림을 그려냅니다.
  2. "텍스트" 관련 작업: "하얀 테이블 오른쪽에 무엇이 있나요?"와 같은 질문에 답해야 할 때, 모델은 챗봇처럼 단어의 시퀀스를 생성합니다.

이 논문은 이를 혼합 전문가 트랜스포머(Mixture-of-Transformer-Experts, MoT) 백본이라고 부릅니다. 이는 다양한 "전문가"(특화된 AI 뇌)들이 같은 건물 안에 사는 거대한 도서관을 상상하게 합니다. 한 전문가는 텍스트 읽기에 능숙하고, 다른 전문가는 이미지 이해에 능숙하며, 또 다른 전문가는 수학에 능숙합니다. SPARGen은 이 모든 전문가가 같은 테이블에 앉아 대화를 나눌 수 있게 해줍니다. 질문을 던지면, 이들은 고립되어 작업하는 대신 각자의 지식을 대화에 기여합니다.

작동 원리: 두 갈래의 시스템

SPARGen은 이미지와 텍스트를 이해하는 데 이미 뛰어났던 Bagel이라는 모델을 기반으로 구축되었습니다. 연구진은 별도의 이상한 하드웨어나 분리된 수학 모듈을 추가하지 않고도 "공간적"인 것들을 처리할 수 있도록 이를 업그레이드했습니다.

  • 텍스트 트랙 (자기회귀 경로): 모델이 카메라의 위치(회전 및 거리)나 방을 설명하는 문장과 같이 구조화된 답을 내야 할 때, 모델은 단어(또는 토큰)를 하나씩 써 내려갑니다. 이는 앞서 나온 맥락을 바탕으로 다음에 올 것을 결정하며 한 글자씩 타이핑하는 타자수와 같습니다.
  • 이미지 트랙 (정류 흐름 경로): 모델이 조밀한 맵(모든 픽셀에 대한 전체 깊이 맵 등)을 출력해야 할 때, 모델은 정류 흐름(rectified flow) 기술을 사용합니다. 이는 조각가가 노이즈(정적) 덩어리에서 시작하여 서서히 명확한 형상을 깎아내는 과정을 생각하면 됩니다. 모델은 흐릿하고 무작위적인 이미지에서 시작하여, 주어진 지시에 따라 정밀한 깊이 맵이나 포인트 클라우드로 "흐르게(flow)" 만듭니다.

이 시스템의 묘미는 모델에게 "이제 수학을 해라" 혹은 "이제 언어를 해라"라고 명령할 필요가 없다는 점입니다. 모델은 지시 사항(예: "깊이를 추정하라" 또는 "오른쪽에 무엇이 있는가?")을 보고 어떤 "트랙"을 사용하여 답을 생성할지 스스로 판단합니다.

결과: 모든 것을 다스리는 하나의 모델

연구진은 다양한 작업, 즉 방의 깊이를 측정하는 것부터 비디오 속 자동차의 움직임을 파악하는 것, 까다로운 공간 질문에 답하는 것까지 SPARGen을 테스트했습니다.

결과:

  • 저글링의 달인: SPARGen은 단 하나의 모델만으로 이 모든 다양한 작업에서 경쟁력 있는 성능을 보여주었습니다. 별도의 "깊이 모델"이나 "흐름 모델"이 필요하지 않았습니다.
  • 전문가를 이기다: 많은 벤치마크에서 SPARGen은 특정 작업만을 위해 만들어진 모델들과 대등하거나 더 나은 성능을 보였습니다. 예를 들어, 자동차 시야에서의 움직임을 추적하는 표준 테스트인 KITPI 데이터셋에서, SPARGen은 종단 오차(End-Point Error, EPE) 4.09F1-all 점수 13.34를 기록하여, RAFT(5.03 EPE)나 FlowFormer(4.10 EPE)와 같은 특화된 모델들을 능가했습니다.
  • 추론의 왕: 공간 추론 영역(예: "내가 여기 서 있다면, 내 오른쪽에 무엇이 있는가?")에서 SPARGen은 압도적인 성과를 냈습니다. SPAR 벤치마크에서 평균 79.25점을 기록하며, 오픈 소스 모델인 Qwen2.5-VL-72B(44.80)와 거대 모델인 GPT-4o(43.27)를 크게 앞질렀습니다.
  • 혼합의 힘: 논문은 이러한 작업들이 실제로 서로를 돕는다고 제안합니다. "기하학" 학습(3D 형태 학습)을 제거했을 때 모델은 질문에 답하는 능력이 떨어졌습니다. 반대로 "추론" 학습을 제거했을 때 모델은 3D 형태를 이해하는 능력이 약간 저하되었습니다. 이는 3D로 세상을 보는 법을 배우는 것이 언어를 이해하는 데 도움을 주고, 언어를 배우는 것이 3D 공간을 이해하는 데 도움을 준다는 것을 시사합니다.

한계점: 아직 완벽하지는 않습니다

결과는 인상적이지만, 저자들은 한 가지 제한 사항을 주의 깊게 언급했습니다. SPARGen은 이미지를 압축하고 생성하기 위해 **VAE(Variational Autoencoder)**를 사용하기 때문에, 3D 세계를 더 작고 압축된 형식으로 구겨 넣어야 합니다. 이러한 압축은 때때로 물체의 매우 날카로운 모서리를 흐릿하게 만들거나, 아주 정확한 물리적 측정값(예: "이 테이블은 정확히 1.23미터 떨어져 있다")을 얻는 것을 어렵게 만들 수 있습니다. 구조와 레이아웃을 이해하는 데는 뛰어나지만, 밀리미터 단위의 정밀함이 필요한 목수에게는 최선의 도구가 아닐 수 있습니다.

큰 그림

SPARGen은 우리가 매번 다른 공간 작업을 위한 로봇 두뇌를 만들 필요가 없음을 시사합니다. 대신, 세계의 기하학을 "상상"하는 동시에 그것에 대해 "말할" 수 있는 유연하고 생성적인 두뇌를 구축할 수 있습니다. 이러한 능력들을 통합함으로써, 모델은 더 풍부하고 일관된 공간 이해를 학습하게 되며, 진정한 공간 지능으로 가는 길은 수학과 의미를 분리하는 것이 아니라 하나로 합치는 데 있음을 증명합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →