← 최신 논문
💻 computer science

Grounded 3D-Aware Spatial Vision-Language Modeling

본 논문은 명시적 2D 그라운딩, 암시적 2D 그라운딩, 단안 3D 그라운딩을 통합하여 복잡한 공간 추론을 그라운딩된 지각과 3D 추론으로 분해함으로써 일반적인 공간 이해 능력을 크게 향상시키는 통합된 공간 비전-언어 모델인 GR3D를 소개합니다.

원저자: An-Chieh Cheng, Yang Fu, Yatai Ji, Ligeng Zhu, Guanqi Zhan, Zhuoyang Zhang, Zhaojing Yang, Song Han, Yao Lu, Pavlo Molchanov, Vidya Nariyambut Murali, Jan Kautz, Xiaolong Wang, Hongxu Yin, Sifei Liu

게시일 2026-05-29
📖 4 분 읽기☕ 가벼운 읽기

원저자: An-Chieh Cheng, Yang Fu, Yatai Ji, Ligeng Zhu, Guanqi Zhan, Zhuoyang Zhang, Zhaojing Yang, Song Han, Yao Lu, Pavlo Molchanov, Vidya Nariyambut Murali, Jan Kautz, Xiaolong Wang, Hongxu Yin, Sifei Liu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

메이크업이 어지러운 주방 사진 한 장을 보고 있다고 상상해 보세요. 당신은 컴퓨터에게 "왼쪽의 병과 오른쪽의 병 사이의 거리는 얼마나 되나요?" 또는 "저 멀리 있는 건물 중 어느 것이 더 높나요?"라고 묻고 싶을 것입니다.

대부분의 현재 AI 모델은 주방에 관한 책을 백만 권 읽었지만, 실제로 주방을 적이 없는 사람과 같습니다. 그들은 훈련 데이터의 패턴을 기반으로 답을 추측할 수는 있지만, 거리를 잘못 판단하거나 존재하지 않는 물체를 환각으로 만들어 내는 경우가 많습니다. 그들은 당신이 입력한 단어를 화면의 특정 픽셀과 연결하는 데 어려움을 겪으며, 평면 사진만 보고 사물이 얼마나 깊거나 멀리 있는지 파악하는 데도 고전합니다.

이제 GR3D(Grounded 3D-Aware Spatial Vision-Language Modeling, 3D 인지 지향적 공간 비전 - 언어 모델링) 가 등장합니다. GR3D 는 단순히 추측만 하는 것이 아니라, 실제로 사물을 가리키고 측정하며 퍼즐을 해결하는 새로운 유형의 AI 탐정으로 생각할 수 있습니다.

다음은 이를 세 가지 간단한 초능력으로 나누어 설명한 작동 원리입니다:

1. "가리키고 클릭하는" 탐정 (명시적 2D 그라운딩)

AI 에게 "빨간 의자는 어디 있나요?"라고 물어본다고 상상해 보세요.
기존 모델은 단순히 "방 안에 있어요"라고 말할지도 모릅니다.
GR3D 는 다릅니다. 실제로 화면에서 빨간 의자 주변에 상자를 그리고 "여기 바로 찾았습니다"라고 말합니다. 이는 당신의 단어를 이미지의 특정 위치로 변환하는 것입니다. 이것이 기초입니다: 무엇을 측정하기 전에, 당신이 정확히 무엇을 말하고 있는지 알아야 하기 때문입니다.

2. "생각을 말로 표현하는" 조수 (암시적 그라운딩)

이것이 이 논문의 가장 큰 혁신입니다. "선반 위의 두 번째 병과 세탁기 위의 테디 곰 사이의 거리는 얼마나 되나요?"와 같은 복잡한 질문을 한다고 상상해 보세요.

일반적인 AI 는 이 모든 것을 한 번에 답변하려다 종종 혼란에 빠집니다. GR3D 는 **"스트리밍 리전 삽입 **(Streaming Region Insertion)이라는 기법을 사용합니다.
이는 탐정이 당신과 대화하며 사건을 해결하는 것과 같습니다.

  • 1 단계: AI 는 "먼저, 그 '선반 위의 두 번째 병'을 찾아보겠습니다"라고 말합니다. 그것은 즉시 병을 찾아 심리적으로 상자를 그리고, 그 특정 병을 나타내는 '토큰'(디지털 태그) 을 자신의 사고 과정에 삽입합니다.
  • 2 단계: 그다음 "이제 테디 곰을 찾아보겠습니다"라고 말합니다. 곰을 찾아 태그를 붙이고 사고 과정에 추가합니다.
  • 3 단계: 이제 두 물체 모두 '태그'가 붙고 마음속에서 가시화되었으므로, 그 사이의 거리를 계산합니다.

GR3D 는 단순히 답을 추측하는 것이 아니라, 말하면서 시각적 증거를 끊임없이 확인하며 단계별로 답을 구성합니다. 이는 사실을 만들어 내는 것 (환각) 을 방지합니다.

3. "3D 비전" 번역가 (단안 3D 그라운딩)

평면 사진을 보는 것은 도시 지도를 보는 것과 같습니다. 거리는 볼 수 있지만, 추가 단서가 없으면 건물의 높이나 거리를 알 수 없습니다. 작은 장난감 자동차가 멀리 있으면 가까이 있는 큰 실제 자동차와 크기가 똑같이 보이기 때문에 이는 AI 에게 어렵습니다.

GR3D 는 **"리전 - 프롬프트 **(Region-Prompted) 방식을 사용하여 이를 해결합니다.

  • AI 가 2D 에서 물체를 식별하면 (이전 단계의 병처럼), 그 2D 상자를 3D 세계에 묻는 '쿼리'로 취급합니다.
  • **고유 정규화 **(Intrinsic Normalization)라는 특별한 트릭을 사용합니다. AI 가 카메라의 '초점 거리'(렌즈가 얼마나 확대되었는지) 를 알고 있다고 상상해 보세요. AI 는 이를 이용해 마음속에서 이미지를 수학적으로 '확대 축소 해제'하여 물체의 실제 크기와 거리를 추정할 수 있게 됩니다.
  • 그런 다음 비디오 게임 엔진이 하듯이 좌표 (중앙, 너비, 높이, 깊이) 가 포함된 3D 상자를 출력합니다.

이것이 왜 중요한가요?

이 논문은 이 세 가지 능력을 결합함으로써 GR3D 가 이전 모델들보다 공간을 이해하는 데 훨씬 더 뛰어났다고 주장합니다.

  • 더 정확합니다: 3D 공간에서 물체의 위치를 찾는 3D 물체 감지 테스트에서 다른 모델들을 능가합니다.
  • 더 신뢰할 수 있습니다: 답을 주기 전에 물체를 '가리키기' 때문에 물체의 위치에 대해 실수를 덜 합니다.
  • 범용적입니다: 실내 장면 (주방 등), 실외 장면 (거리 등), 심지어 다양한 각도에서 장면을 바라보는 복잡한 다중 뷰 시나리오에서도 작동합니다.

결론

GR3D 는 AI 에게 3D 안경과 측정 테이프를 주는 것과 같습니다. 방에 대한 설명을 읽는 대신, 그림을 보고 당신이 언급한 특정 물건을 가리키며, 실제 세계의 크기와 거리를 측정하고, 기억한 추측이 아니라 '본' 사실로 질문에 답하는 법을 배웁니다.

저자들은 Omni3D(거대한 3D 장면 컬렉션) 와 같은 다양한 데이터셋에서 이를 테스트한 결과, GR3D 가 다른 최상위 AI 모델들을 일관되게 능가했으며, "그라운딩"(단어를 시각적 현실에 연결하는 것) 이 AI 가 물리적 세계를 진정으로 이해하게 만드는 비결임을 증명했습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →