Qwen-3D: A Generalist 3D Vision-Language Model for Spatial Understanding
Qwen-3D는 3D 회전 위치 임베딩(3D Rotary Positional Embeddings)과 쿼리 기반 세그멘테이션 디코더를 활용하여 이미지와 비디오 전반에 걸쳐 공간 추론, 참조적 그라운딩(referential grounding), 인스턴스 세그멘테이션을 통합함으로써 언어와 조밀한 3D 기하학적 예측 사이의 간극을 효과적으로 메우고 기존의 전문 모델 및 독점 모델들을 능가하는 새로운 기하학 인식 대규모 멀티모달 모델입니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 로봇에게 세상을 보는 법을 가르치려 한다고 상상해 보세요. 오랫동안 이 로봇들은 카메라를 든 관광객과 같았습니다. 방 사진을 찍고 "저것은 의자입니다"라거나 "사람이 세 명 있습니다"라고 말할 수 있었죠. 이는 평면 사진이나 짧은 비디오 클립에는 아주 잘 작동합니다. 하지만 만약 당신이 로봇에게 집 전체를 걸어 다니며 주방에서, 복도에서, 그리고 침실에서 똑같은 의자를 바라본 뒤, 그 의자가 3D 공간의 정확히 어디에 있는지 말하라고 요구한다면 상황은 엉망이 됩니다. 로봇은 수천 개의 별개 2D 사진을 하나로 꿰어 맞추려고 애쓰기 때문에 혼란에 빠지게 되는데, 이는 마치 수천 장의 평면 엽서를 풀로 붙여서 집을 지으려는 것과 같습니다. 이는 느리고, 많은 뇌력을 소모하며, 실제 세상에서 사물이 실제로 어디에 있는지 놓치기 일쑤입니다.
이것이 바로 "3D 시각-언어 모델(3D Vision-Language Models)"의 과제입니다. 과학자들은 AI가 단순히 물체를 인식하는 것을 넘어, 인간의 지시를 들으면서 동시에 3D 환경 속에서 사물의 형태, 위치, 그리고 다른 모든 것과의 관계를 이해하도록 만들고 싶어 합니다. 핵심적인 질문은 이것입니다. 어떻게 하면 AI가 모든 각도에서 방을 바라보고, 레이아웃을 기억하며, 데이터의 바다에서 길을 잃지 않고 정확한 물체를 가리킬 수 있게 만들 것인가? 우리가 이 문제를 해결할 수 있다면, 로봇은 마침내 우리의 집을 돌아다니고, 잃어버린 열쇠를 찾는 것을 돕거나, 복잡한 건설 작업 보조 업무를 수행하며, 단순히 '보는' 수준을 넘어 주변 공간을 진정으로 '이해하는' 단계로 나아갈 수 있을 것입니다.
여기, 디지털 세계의 숙련된 설계자처럼 행동하는 카네기 멜론 대학교 연구진이 개발한 새로운 종류의 AI, Qwen-3D가 등장했습니다. Qwen-3D는 모든 비디오 프레임을 별개의 평면 사진으로 취급하는 대신, 아주 영리한 방식을 사용합니다. 바로 여러 각도의 뷰를 하나로 모아 하나의 지속적인 3D 지도로 "녹여내는" 것입니다. 만약 당신이 조각상을 여러 각도에서 찍은 사진들을 모아 즉각적으로 머릿속에서 회전하는 입체적인 조각상으로 융합할 수 있다면 어떨까요? 그것이 바로 이 모델이 시각 데이터로 하는 일입니다. 이 모델은 깊이 정보(사물이 얼마나 멀리 있는지)와 카메라 위치를 사용하여, 길고 구불구불한 비디오 스트림을 압축된 3D 표현으로 응축합니다. 이를 통해 AI는 한 번에 한 프레임씩에 갇히지 않고, 장면 전체에 대해 추론할 수 있게 됩니다.
논문은 기존의 AI에게 3D 기술을 가르치려 했던 시도들에 주요한 병목 현상이 있었다고 주장합니다. 이전 모델들은 3D 위치를 텍스트로 쓰거나(예: "의자는 좌표 1.2, 0.8, 0.9에 있다"), 미리 만들어진 가능한 물체 목록 중에서 선택하는 방식을 사용했습니다. 저자들은 이러한 방식이 마치 복잡한 그림을 설명하기 위해 제한된 세트의 이모지만 사용하거나, 미리 인쇄된 스티커 중 가장 잘 맞는 것을 골라 맞추려는 것과 같다고 제안합니다. 이는 매우 어색하고 비효율적인 소통 방식입니다. Qwen-3D는 AI의 "두뇌"(언어 추론)를 "손"(세그멘테이션 디코더)에 직접 연결함으로써 이 문제를 해결합니다. 좌표를 추측하는 대신, 침대 위의 베개든 거리의 신호등이든 사용자가 말하는 특정 부분의 정확한 형태를 강조하여 보여주는 법을 배웁니다.
결과는 꽤 인상적입니다. 다양한 벤치마크에서 테스트했을 때, Qwen-3D는 기존의 3D AI 모델들을 능가했으며 심지어 3D 공간을 이해하는 데 있어 몇몇 거대 상용 2D 모델들보다 뛰어난 성능을 보였습니다. 구체적으로, 연구진은 Qwen-3D가 기존의 최선책들과 비교했을 때 3D 시각적 접지(설명을 바탕으로 물체를 찾는 능력)를 4% 향상시켰고, 3D 인스턴스 세그멘테이션(장면에서 개별 물체를 분리하는 능력)을 13% 끌어올렸다는 것을 발견했습니다. 놀랍게게도, 이 모델은 2D 이미지와 비디오를 이해하는 능력을 잃지 않으면서 이 모든 것을 해냈으며, 이는 3D를 보는 법을 가르친다고 해서 2D를 보는 법을 잊게 만들 필요가 없음을 증명합니다.
하지만 저자들은 이것이 아직 모든 상황에 적용되는 마법의 해결책은 아니라는 점을 주의 깊게 언급합니다. 현재 이 모델은 세상이 대부분 정적이라는 것을 가정하고 있습니다. 따라서 자동차가 빠르게 지나가는 번화한 거리처럼 물체가 움직이거나 모양이 급격히 변하는 동적인 환경에서는 어려움을 겪습니다. 또한 외부 도구를 사용하여 깊이와 카메라 위치를 추정하는 것에 의존하기 때문에, 만약 초기 측정값이 틀리다면 AI의 이해도 약간 어긋날 수 있습니다. 이는 언어와 3D 지각 사이의 간극을 메우는 중요한 진전이지만, 연구진은 향후 작업이 이러한 움직이는 목표물들을 다루어야 하며, 아마도 스스로 기하학적 구조를 추정하는 법을 배워야 할 것이라고 제사합니다. 현재로서는 Qwen-3D가 더 나은 3D AI를 만드는 열쇠가 단순히 더 좋은 데이터가 아니라, AI가 보는 것과 말하는 방식을 더 스마트하게 연결하는 방법이라는 점을 시사하는 강력한 새로운 도구로 자리 잡고 있습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.