← 최신 논문
💻 computer science

G2^2TAM: Geometry Grounded Track Anything Model

이 논문은 새롭게 구축된 InsTrack 데이터셋에 의해 뒷받침되는, 변화하는 시점과 가려짐 현상에 대해 강건하고 프롬프트 가능한 3D 인스턴스 추적 및 비디오 세그멘테이션을 달성하기 위해 공간적으로 정렬된 기하학적 표현을 암시적 메모리로 활용하는 통합 프레임워크인 G2^2TAM을 소개한다.

원저자: Chenming Zhu, Peizhou Cao, Jingli Lin, Wenbo Hu, Yunlong Ran, Jiangmiao Pang, Tai Wang, Xihui Liu

게시일 2026-07-07
📖 3 분 읽기☕ 가벼운 읽기

원저자: Chenming Zhu, Peizhou Cao, Jingli Lin, Wenbo Hu, Yunlong Ran, Jiangmiao Pang, Tai Wang, Xihui Liu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 복잡하고 어질러진 방을 걷고 있다고 상상해 보세요. 당신은 특정한 빨간 의자 하나를 발견합니다. 당신이 방 안을 돌아다닐 때, 당신의 눈에 비친 의자의 모양은 변합니다. 옆에서 보면 평평한 선처럼 보이고, 뒤에서 보면 다리만 보입니다. 만약 당신이 책장 뒤로 지나가면, 의자는 완전히 사라져 버립니다.

현재 대부분의 컴퓨터 비전 시스템은 현재 보이는 모습만으로 사물을 인식하는, 아주 짧은 단기 기억력을 가진 사람과 같습니다. 만약 그 빨간 의자가 "평평한 선"으로 변하거나 가려지게 되면, 이 시스템들은 그것을 놓치게 되어, 이를 새로운 물체로 인식하거나 영원히 사라졌다고 생각하곤 합니다. 이들은 과거에 그 물체가 어떻게 생겼었는지 보여주는 "사진 앨범"에 의존하여 대상을 찾아내려 합니다.

G2TAM(Geometry Grounded Track Anything Model)은 다르게 생각하는 새로운 AI 시스템입니다. 단순히 사진을 기억하는 대신, 이 시스템은 방이 어떻게 생겼는지에 대한 **3D 정신적 지도(mental 3D map)**를 구축합니다. G2TAM은 그 "평평한 선"과 "다리"가 사실은 동일한 빨간 의자라는 것을 이해합니다. 왜냐하면 그것들이 동일한 3D 공간 안에 들어맞기 때문입니다.

다음은 이 시스템이 어떻게 작동하는지에 대한 설명을 쉬운 비유를 들어 설명한 것입니다.

1. 핵심 아이디어: "3D 기억" vs "사진 앨범"

  • 기존 방식 (사진 앨범): 기존 시스템은 물체의 사진들을 쌓아둔 메모리 뱅크를 유지합니다. 만약 물체가 방향을 틀거나 가려지면, 시스템은 일치하는 사진을 찾으려고 시도합니다. 하지만 각도가 너무 다르거나 물체가 너무 오래 가려지면 혼란에 빠집니다.
  • G2TAM 방식 (정신적 지도): G2TAM은 단순히 사진을 보는 것이 아니라, 장면의 3D 형태를 즉각적으로 파악합니다. 이 3D 형태를 자신의 "기억"으로 삼습니다. 설령 빨간 의자가 벽 뒤에 숨겨지더라도, G2TAM은 방의 기하학적 구조를 이해하고 있기 때문에 3D 공간 내 정확히 어디에 있는지 알고 있습니다. 이 시스템은 사진 더미를 필요로 하지 않습니다. 지속적이고 보이지 않는 지도를 가지고 있기 때문입니다.

2. 명령을 받는 방법 (프롬프트 시스템)

당신은 친구에게 길을 알려주듯 세 가지 방식으로 G2TAM에게 추적할 대상을 말할 수 있습니다:

  • 가리키기: 화면의 한 지점을 탭합니다 (예: "저 빨간 의자").
  • 박스 그리기: 물체 주변에 사각형을 그립니다 (예: "이 박스 안의 의자").
  • 말하기: "창문 근처에 있는 의자를 찾아줘"라고 말합니다.

G2TAM은 이러한 지시를 받아 이를 즉시 자신의 3D 정신적 지도로 변환합니다. 단순히 빨간 덩어리를 찾는 것이 아니라, 그 특정 공간에 있는 당신의 설명과 일치하는 3D 물체를 찾습니다.

3. 학습의 "마법"

논문에 따르면 G2TAM은 두 가지를 동시에 학습하기 때문에 추적 능력이 향상됩니다:

  1. 물체를 그리는 법 (Segmentation/분할)
  2. 3D 공간을 재구성하는 법 (Reconstruction/재구성)

이것은 마치 자동차를 그리는 법을 배우는 학생과 같습니다. 만약 정면에서 본 자동차만 연습한다면, 옆모습을 그려달라는 요청에는 실패할 수 있습니다. 하지만 자동차를 그리면서 동시에 3D 모델을 만드는 연습을 한다면, 모든 각도에서 바퀴가 차체와 어떻게 연결되는지 이해하게 됩니다. G2TAM도 이와 같습니다. 3D 세계를 재구축하는 법을 배움으로써, 카메라가 움직이거나 물체가 가려질 때 물체를 놓치는 일이 훨씬 줄어듭니다.

4. 할 수 있는 일 (논문의 주장 기반)

연구진은 G2TAM을 테스트하였으며, 다음과 같은 분야에서 탁월한 성능을 보임을 확인했습니다:

  • 혼란 속에서의 추적: 카메라가 격렬하게 회전하거나 물체가 오랫동안 사라지더라도, G2D TAM은 물체가 3D 공간 내 어디에 있어야 하는지 알기 때문에 끝까지 추적할 수 있습니다.
  • 언어 이해: 복잡한 설명(예: "창문 근처의 의자")을 바탕으로 물체를 찾아내고, 다양한 카메라 각도에서도 이를 추적할 수 있습니다.
  • 세계 구축: 추적하는 동안, 카메라의 위치와 방의 깊이(depth)를 포함하여 장면의 3D 지도를 함께 생성합니다.

5. 새로운 "체육관" (데이터셋)

이를 훈련하고 테스트하기 위해, 저자들은 InsTrack이라는 새로운 데이터셋을 구축했습니다. 이것은 영상과 3D 스캔으로 채워진 거대하고 복잡한 장애물 코스를 상상하시면 됩니다. 그들은 물체가 숨겨지거나, 카메라가 빠르게 움직이거나, 지시 사항이 까다로운 특정 도전 과제들을 만들어 G2TAM이 이전 시스템들보다 더 강력하다는 것을 증명했습니다.

요약

G2TAM은 보는 것(물체가 어떻게 생겼는가)과 공간을 이해하는 것(물체가 3D 어디에 있는가)을 결 Combine한 시스템입니다. 기억을 단순히 사진 목록이 아닌 세계의 기하학적 구조에 기반함으로써, G2TAM은 물체가 움직이거나, 모양이 변하거나, 시야에서 사라지더라도 훨씬 더 안정적으로 물체를 추적할 수 있습니다. 이는 AI가 세상을 단순히 2D 사진의 연속이 아니라, 안정적인 3D 공간으로 이해하는 방식, 즉 인간이 세상을 이해하는 방식에 한 걸음 더 다가가는 과정입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →