← 최신 논문
💻 computer science

3D Primitives are a Spatial Language for VLMs

본 논문은 비전-언어 모델을 위한 강력한 공간 언어로서 코드로 표현된 3D 기하학적 원시들을 소개하며, SpatialBabel 벤치마크, 학습이 불필요한 코드-CoT 추론 전략, 그리고 자기지도학습 기반의 S3^{3}-FT 미세조정 방법을 통해 이 중간 표현이 인간의 레이블 없이도 다양한 VLM 아키텍처 전반에 걸쳐 공간 추론 능력을 현저히 향상시키고 일반화됨을 입증합니다.

원저자: Junze Liu, Kun Qian, Florian Dubost, Kai Zhong, Arvind Srinivasan, Nan Chen, Anping Wang, Sam Zhang, Alejandro Mottini, Qingjun Cui, Tian Wang

게시일 2026-05-14
📖 3 분 읽기☕ 가벼운 읽기

원저자: Junze Liu, Kun Qian, Florian Dubost, Kai Zhong, Arvind Srinivasan, Nan Chen, Anping Wang, Sam Zhang, Alejandro Mottini, Qingjun Cui, Tian Wang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

매우 똑똑하고 예술적인 로봇이 방의 사진을 보고 그 내용을 설명할 수 있다고 상상해 보세요. 하지만 이상한 점은, 이 로봇에게 "이 사진에 의자가 몇 개 있나요?"라고 물으면, 의자가 세 개뿐인데도 "다섯 개"라고 잘못 추측할 수 있다는 것입니다. 로봇이 혼란스러워 보이는군요.

하지만 같은 로봇에게 그 방을 정확히 재현하기 위해 간단한 모양(정육면체, 구, 원기둥 등)을 사용한 컴퓨터 프로그램을 작성하라고 하면, 놀라운 성과를 보여줍니다. 로봇은 정확히 세 개의 정육면체를 올바른 위치에 배치하는 코드를 작성합니다. 로봇은 정답을 완벽하게 알고 있지만, 단순히 평범한 영어로 표현할 수 없을 뿐입니다.

이 논문인 **"3D Primitives are a Spatial Language for VLMs(3D 기본 도형은 VLM 을 위한 공간 언어이다)"**는 이러한 기이한 모순을 탐구하고, 이를 이용해 로봇을 더 똑똑하게 만듭니다.

다음은 그들의 발견과 해결책을 간단한 비유를 통해 설명한 내용입니다:

1. 문제: "이중언어" 로봇

연구자들은 비전 - 언어 모델 (VLM) 이 공간에 관해서는 비밀 언어 (코드) 에는 유창하지만, 일반적인 언어 (영어) 에는 어려움을 겪는 사람들과 같다는 사실을 발견했습니다.

  • 패러독스: 로봇은 코드 (레고 설명서와 유사) 를 사용하여 장면의 완벽한 3D 모델을 구축할 수 있지만, 같은 장면에 대한 간단한 질문을 받으면 환각 (허위 사실 생성) 을 일으킵니다.
  • 테스트 (SpatialBabel): 연구자들은 SpatialBabel이라는 거대한 테스트를 만들었습니다. 로봇에게 같은 사진을 주고, 세 가지 (Three.js, Unity, 또는 특수 JSON 형식 등) 다른 "언어"로 재구성하라고 요청한다고 상상해 보세요.
  • 충격: 로봇의 성능은 사용해야 하는 언어에 따라 극적으로 달라졌습니다. 한 언어에서는 마스터 건축가가 되지만, 다른 언어에서는 서투른 아마추어가 되었습니다. 이는 로봇의 "공간 뇌"가 그 "코딩 습관"과 얽혀 있음을 증명했습니다.

2. 첫 번째 해결책: "Code-CoT(코드 기반 사고)"

로봇이 질문에 답하는 것보다 코드를 작성하는 데 더 능숙하므로, 연구자들은 **Code-CoT(Code Chain-of-Thought)**라는 새로운 트릭을 시도했습니다.

  • 비유: 까다로운 수학 응용 문제를 풀고 있다고 상상해 보세요. 바로 답을 추측하는 대신, 먼저 종이에 방정식을 적어보세요. 방정식이 적히면 답이 명확해집니다.
  • 작동 원리: "빨간 정육면체가 파란 구의 왼쪽에 있나요?"와 같은 질문을 받으면, 로봇은 먼저 장면을 재구성하는 코드를 작성하도록 강요받습니다. 코드가 작성되면 로봇은 자신의 코드를 "읽어" 답을 찾습니다.
  • 결과: 이는 이미 코딩에 능한 로봇들에게 마법처럼 작용했습니다. 로봇이 강력한 "코드 뇌"를 사용하여 "영어 질문"을 해결하도록 강요했기 때문에 정확도가 크게 향상되었습니다.

3. 두 번째 해결책: "S3-FT(자기 학습 로봇)"

아직 코딩을 잘하지 못하는 로봇은 어떨까요? 그들의 코드가 엉망이므로 "먼저 코드 작성" 트릭을 사용할 수 없습니다.

연구자들은 **S3-FT(Self-Supervised Spatial Fine-Tuning)**라는 방법을 고안했습니다.

  • 비유: 그림 그리기를 잘 못하는 학생을 상상해 보세요. 선생님을 고용하는 대신, 학생은 그림을 그린 후 즉시 자신의 그림을 보고 무엇을 잘했고 무엇을 잘못했는지 확인한 뒤 다시 그려봅니다. 그들은 스스로의 선생님이 됩니다.
  • 작동 원리:
    1. 로봇은 기하학적 모양 (정육면체, 구 등) 의 간단한 사진을 봅니다.
    2. 그 그림을 재구성하는 코드를 작성해 봅니다.
    3. 연구자들은 해당 코드를 가져와 자동으로 "요약 노트"(구조화된 사실 목록: "X 위치에 빨간 정육면체가 있음") 로 변환합니다.
    4. 이 요약 노트를 로봇에게 피드백하여 수업 자료로 제공하고, 로봇이 자신의 코드를 기반으로 질문에 올바르게 답하도록 가르칩니다.
  • 결과: 로봇은 인간의 교사나 비싼 레이블 없이 공간을 이해하는 법을 배웠습니다. 로봇은 코딩 능력 안에 숨겨져 있던 "공간 지식"을 추출하여 일반적인 대화 기술로 이전시켰습니다.

4. 핵심 교훈

이 논문은 코드 형태로 표현된 3D 기하학적 모양 (기본 도형) 이 이러한 로봇들을 위한 "보편적 번역기" 역할을 한다고 결론 내립니다.

  • 진단 도구로서: 로봇이 공간 질문에 실패하지만 코드 작성에는 성공한다면, 문제는 로봇이 대상을 "보지 못해서"가 아니라 시상을 언어로 번역하지 못하기 때문임을 알 수 있습니다.
  • 어휘로서: 로봇이 코드를 통해 "정육면체, 구, 원기둥"이라는 개념으로 생각하도록 강요함으로써, 우리는 세계를 이해할 수 있는 구조화된 어휘를 제공합니다.

간단히 말해: 연구자들은 이러한 AI 모델들이 드러내는 것보다 공간에 대해 더 많이 알고 있음을 발견했습니다. 로봇이 3D 조립 블록 (코드) 의 언어로 "말하게" 함으로써, 우리는 숨겨진 지식을 해방시켜 간단한 질문에 올바르게 답할 수 있게 만들었습니다. 이는 모두 인간이 답을 가르쳐 줄 필요 없이 가능합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →