← 최신 논문
💻 computer science

ZeroSplat: Generalized Referring Segmentation in 3D Gaussian Splatting

이 논문은 다중 뷰 기하학적 제약을 통해 2D 시각-언어 모델의 사전 지식을 3D 공간으로 들어 올림으로써, 임의의 개수의 타겟에 대한 일반화된 참조 분할을 3D 가우시안 스플래팅에서 가능하게 하여 기존 방법들의 한계를 해결하는 학습 불필요 및 제로 피처 프레임워크인 ZeroSplat을 소개한다.

원저자: Jiayu Ding, Meilu Song, Xiaoyi Zhang, Hongbo Jin, Yichen Jin, Xiangtian Si

게시일 2026-07-22
📖 4 분 읽기☕ 가벼운 읽기

원저자: Jiayu Ding, Meilu Song, Xiaoyi Zhang, Hongbo Jin, Yichen Jin, Xiangtian Si

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 단순히 평면적인 사진을 찍는 것이 아니라, 공간 속에 떠다니는 작은 빛나는 먼지 구름처럼 방 전체를 3D로 포착하는 마법 카메라를 들고 있다고 상상해 보세요. 이것이 바로 **3D 가우시안 스플래팅(3D Gaussian Splatting)**의 세계입니다. 이는 컴퓨터가 실시간으로 볼 수 있을 만큼 매우 선명하고 빠른 방식으로 3D 장면을 구축하는 새로운 방법입니다. 하지만 오랫동안 이 3D 장면들은 언어에 대해 "눈이 멀어" 있었습니다. 즉, 당신이 컴퓨터에게 "빨간 의자를 보여줘"라고 말했을 때 컴퓨터가 그 의미를 이해하게 할 수 없었습니다. 연구자들은 컴퓨터에게 텍스트를 읽고 사물을 가리키는 법을 가르쳐 이를 해결하려 노력했지만, 벽에 부딪혔습니다. 기존의 방식은 한 번에 단 하나의 특정 책만을 찾아낼 줄 아는 엄격한 사서와 같았습니다. 만약 당신이 "모든 빨간 의자"를 찾거나 "의자가 하나도 없는 상태"를 요구한다면, 사서는 혼란에 빠지거나 시스템이 멈춰버릴 것입니다. 이 논문은 이 간극을 메우며, 다음과 같은 단순하지만 강력한 질문을 던집니다. "우리가 3D 장면에 하나, 혹은 0개 또는 한꺼번에 여러 개를 요구하는 복잡하고 무질서한 인간의 지시를 이해하도록 가르칠 수 있을까?"

이 논문의 저자들은 자신들의 새로운 도구를 ZeroSplat이라 부르며, 답은 "예"라고 말합니다. 그리고 그들은 보통 요구되는 무겁고 비용이 많이 드는 훈련 없이 이를 해냈습니다. 그들은 기존의 방식들이 3D 객체를 2D 사진으로만 이해하려고 했기 때문에 근본적으로 결함이 있다고 주장합니다. 이는 마치 조각상을 오직 그 그림자만을 보고 이해하려는 것과 같습니다. 이로 인해 컴퓨터는 느려지고 메모리를 많이 잡아먹었으며, 모든 장면마다 엄청난 양의 데이터를 저장해야 했습니다. ZeroSplat은 이 판도를 뒤집습니다. 매번 새로운 방을 위해 새로운 뇌를 훈련시키는 대신, 그들은 영리한 트릭을 사용합니다. 이미 이미지와 단어를 매칭하는 법을 알고 있는 똑똑한 사전 학습된 "시각-언어 모델(Vision-Language Model, 매우 똑똑한 AI)"을 가져와서 기하학적 구조를 이용해 그 이해력을 3D 먼지 입자들에 직접 투영하는 것입니다.

이렇게 생각해 보세요. 당신에게 방 안 가득 떠다니는 풍선들(3D 장면)이 있습니다. 당신은 "파란 풍선"을 찾고 싶습니다. 기존의 방식은 방을 몇 시간 동안 공부한 뒤 모든 풍선에 라벨을 색칠해 붙이는 것과 같았습니다. ZeroS

ZeroSplat은 다릅니다. 그것은 방의 사진 몇 장을 보고 어디에 파란 풍선이 있는지 파악한 다음, 레이저 포인터를 사용하여 3D 공간의 실제 떠다니는 풍선들을 즉시 태깅하는 똑똑한 친구와 같습니다. 만약 당신이 "풍선 없음"을 요구하면, 그 친구는 그냥 "알겠습니다, 태그할 것이 없습니다"라고 말할 것입니다. 만약 "파란색과 빨간색 풍선 모두"를 요구한다면, 그들은 둘 다 태그할 것입니다. 가장 좋은 점은? 이 친구는 방을 미리 암기할 필요가 없습니다. 그저 자신이 가진 기존의 지식과 방의 기하학적 구조를 사용하여 즉석에서 문제를 해결할 뿐입니다.

이 논문은 **일반 참조 3D 가우시안 스플래팅(Generalized Referring 3D Gaussian Splatting, GR3DGS)**이라는 새로운 과제를 도입합니다. 이것은 복잡한 이름이지만 단순한 아이디어입니다. 즉, 어떤 수의 대상이라도 처리할 수 있는 시스템입니다. 이 시스템은 당신이 입력한 문장에 따라 0개의 아이템(존재하지 않는 것을 요청할 경우), 1개의 아이템, 또는 전체 그룹의 아이템을 찾아낼 수 있습니다. 이를 증명하기 위해 팀은 GR-LERFGR-ScanNet이라는 두 가지 새로운 테스트 세트를 구축했습니다. 이들은 컴퓨터가 정말로 "모든 빨간 의자"나 "빈 공간"의 의미를 이해할 수 있는지 확인하기 위한 까다로운 지시들이 담긴 장애물 코스와 같습니다.

ZeroSplat을 테스트했을 때 결과는 인상적이었습니다. 이 테스트에서 ZeroSplat은 이전의 최고 방법들을 크게 앞질렀습니다. 다른 시스템들이 여러 객체를 분리하는 데 어려움을 겪거나 복잡한 문장에 혼란을 느낀 반면, ZeroSplat은 자신이 찾아야 할 정확한 3D 지점들을 짚어냈습니다. 예를 들어, 한 테스트 세트에서 ZeroSplat은 (mIoU로 측정된) 50.8의 점수를 기록했는데, 이는 차점자의 점수인 23.8을 훨씬 웃도는 수치였습니다. 또 다른 테스트에서는 41.2를 기록하며 24.5를 기록한 2위 방법을 제쳤습니다. 논문은 이러한 성공이 두 가지 주요 트릭 덕분이라고 제안합니다. 첫째, 스마트한 AI를 사용하여 장면의 최적의 사진을 선택하는 것(따라서 지루하고 평평한 벽에 시간을 낭비하지 않음), 둘째, 빈틈을 채워주는 "공간 확산(spatial diffusion)" 과정을 사용하여 객체의 3D 형태가 단순히 흩어진 점 구름이 아니라 견고하고 완전한 형태를 갖추도록 만드는 것입니다.

결정적으로, 이 논문은 매번 새로운 장면을 위해 몇 시간씩 모델을 훈련하거나 엄청난 양의 추가 데이터를 저장해야 한다는 생각에 반박합니다. 그들은 "장면별 최적화(per-scene optimization)"와 "무거운 시맨틱 특징(heavy semantic features)"의 필요성을 명시적으로 배제합니다. 대신 ZeroSplat은 "훈련이 필요 없고(training-free)", "특징이 필요 없는(zero-feature)" 방식, 즉 장면을 먼저 학습할 필요 없이 즉시 작동하는 방식입니다. 이는 단일 그래픽 카드에서 효율적으로 실행되는 "플러그 앤 플레이(plug-and-play)" 솔루션이며, 약 10 GB의 메모리를 사용하는데, 이는 다른 많은 방법이 요구하는 20~28 GB보다 훨씬 적은 양입니다.

저자들은 또한 단일 객체 찾기나 카테고리별 객체 찾기와 같은 더 단순한 작업에 대해서도 ZeroSplat을 테스트했으며, 여전히 매우 우수한 성능을 보였고, 심지어 그러한 작업들을 위해 특별히 설계된 방법들조차 능가했습니다. 이는 그들의 접근 방식이 단순한 일회성 기술이 아니라 3D 공간을 이해하는 강력한 방법임을 시사합니다. 그러나 논문은 결과가 강력하긴 하지만, 특정 데이터셋과 자신들이 만든 시뮬레이션에 기반하고 있다는 점을 주의 깊게 언급합니다. 그들은 세상의 모든 문제를 해결했다고 주장하는 것이 아니라, 인간의 언어를 진정으로 이해하는 3D 장면(당신이 하나를 찾든, 여러 개를 찾든, 혹은 아무것도 없든 상관없이)을 만들기 위한 명확한 길을 제시했다는 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →