← 최신 논문
🤖 AI

GeoWorld-VLM: Geometry from World Models for Vision-Language Models

GeoWorld-VLM 은 고정된 카메라 조건 비디오 월드 모델로부터 3D 기하학적 단서를 시각 경로에 증류하여 Vision-Language 모델의 공간 추론 한계를 해결함으로써, 원래 모델의 언어 능력을 유지하면서 공간 벤치마크에서 일관된 성능 향상을 달성합니다.

원저자: Renjie Gu, Kaichen Zhou, Yan Luo, Mengyu Wang

게시일 2026-05-19
📖 3 분 읽기☕ 가벼운 읽기

원저자: Renjie Gu, Kaichen Zhou, Yan Luo, Mengyu Wang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

상상해 보세요. 아주 똑똑한 사서 (비전 - 언어 모델, 즉 VLM) 가 있는데, 이 사서는 책을 읽고 그림을 완벽하게 묘사할 수 있습니다. 만약 이 사서에게 매트 위에 있는 고양이의 사진을 보여준다면, "그건 고양이고, 매트 위에 있어요"라고 정확히 알려줄 수 있습니다. 사물은 이름 붙이는 것과 단어를 이해하는 데 매우 뛰어납니다.

하지만 이 사서에게는 이상한 맹점이 하나 있습니다. 바로 공간을 이해하는 데 매우 서툴다는 점입니다. "고양이가 의자 에 있나요, 아니면 에 있나요?"라고 묻거나 "전등이 책상 에 있나요?"라고 물으면, 종종 틀리게 추측합니다. 사물은 보지만, 방의 3 차원적인 형태를 "느끼지" 못합니다.

문제: "평면"인 그림

이 논문은 이러한 현상이 **비전 인코더 (Vision Encoder)**라고 불리는 카메라로부터 정보를 받기 때문에 발생한다고 설명합니다. 이 카메라는 3 차원 세계를 2 차원 이미지로 압축합니다. 그렇게 하는 과정에서 깊이, 각도, 그리고 주변을 돌아다닐 때 사물이 어떻게 보일지에 대한 단서들이 사라집니다. 사서는 현실의 "평면" 버전만 받아서 3 차원 관계를 추측하려 하기 때문에 실수가 발생합니다.

해결책: "상상력" 교사

저자 인 런지에 구 (Renjie Gu) 와 동료들은 GeoWorld-VLM이라는 새로운 시스템을 개발했습니다. 이는 사서의 두뇌가 아닌, 눈을 훈련시키기 위해 고용된 특별한 튜터라고 생각하면 됩니다.

이 튜터가 작동하는 방식은 다음과 같습니다:

  1. 세계 모델 교사: 그들은 가상 현실 시뮬레이터와 같은 강력한 AI(세계 모델) 를 사용합니다. 이 시뮬레이터는 매우 뛰어나서, 방의 사진을 보여주고 "카메라를 약간 왼쪽으로 움직여 상상해 봐"라고 말하면, 그 새로운 각도에서 방이 어떻게 보일지 예측할 수 있습니다. 사물이 서로 어떻게 가려지는지 (가려짐) 와 원근감이 어떻게 변하는지 이해합니다.
  2. 훈련 과정: 튜터는 사서에게 정적인 사진만 보여주는 것이 아니라, 사진과 함께 시뮬레이터에게 카메라가 움직이는 것을 상상하도록 요청합니다. 시뮬레이터는 장면이 변하는 "마음속 영화"를 생성합니다.
  3. 수업: 튜터는 사서의 카메라 시스템이 이러한 "마음속 영화"에 주의를 기울이도록 강요합니다. 카메라에게 이렇게 가르칩니다: "단순히 평면 그림만 보지 말고, 움직였을 때 사물들이 어떻게 이동할지 보라!"

마술 같은 트릭: 두뇌 동결

일반적으로 AI 를 훈련시킬 때 전체 두뇌를 다시 훈련시키면, 언어를 말하거나 이해하는 방법을 잊어버릴 수 있습니다.

GeoWorld-VLM 의 영리한 점은 사서의 두뇌 (언어 모델) 를 동결시킨다는 것입니다. 오직 **눈 (비전 인코더와 연결부)**만 다시 훈련시킵니다.

  • 비유: 50 개 국어를 구사하지만 시력이 나쁜 천재 번역가가 있다고 상상해 보세요. 이미 알고 있는 새로운 언어를 가르치는 대신, 그에게 3D 안경만 한 켤레 선물해 주는 것입니다. 이제 그 번역가가 사진을 볼 때 깊이를 볼 수 있게 되지만, 여전히 평소와 똑같은 방식으로 말을 합니다.

어떤 일이 일어날까요?

이 훈련을 마친 후 사서는 공간 관련 질문에 훨씬 더 잘 대답하게 됩니다.

  • 훈련 전: "울타리는 어디에 있나요?" -> "위쪽에 있어요." (틀림)
  • 훈련 후: "울타리는 어디에 있나요?" -> "집 뒤에 있어요." (맞음)

이 논문은 지마 (Gemma) 와 인터널 VL(InternVL) 이라는 두 가지 유형의 사서에게 이를 테스트했고, 이러한 "3D 안경"을 추가함으로써 다양한 테스트에서 공간 추론 점수가 약 4% 향상되었다는 사실을 발견했습니다. 이는 많지 않게 들릴 수 있지만, AI 세계에서는 일관된 4% 의 상승은 엄청난 성과입니다.

이것이 중요한 이유 (논문에 따르면)

논문에 따르면, AI 가 공간 작업에서 실패하는 이유는 언어를 잘 못해서가 아니라, 받아들이는 시각 정보가 "평면"이고 3 차원 구조가 빠져 있기 때문입니다. 세계가 어떻게 움직이는지 이해하는 "세계 모델 (시뮬레이터)"을 사용하여 시각 시스템을 가르침으로써, AI 의 말하기 능력을 해치지 않고 공간적 맹점을 해결할 수 있습니다.

간단히 말해: 그들은 AI 에게 장면 주위를 "상상"하며 움직이는 법을 가르쳤고, 이를 통해 사물이 3 차원 공간에서 어디에 있는지 이해하도록 도왔습니다. 모든 과정에서 언어 능력은 정확히 동일하게 유지되었습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →