← 최신 논문
💻 computer science

Multi-View Relational Distillation for Spatial Reasoning with Vision-Language Models

이 논문은 기하학적 근거를 가진 교사 모델로부터 여러 뷰(view)에 걸친 패치 단위 코사인 유사도를 증류함으로써, 사전 학습된 언어 정렬을 유지하고 특징 융합의 계산 오버헤드를 피하면서도 시각-언어 모델의 기하학적 추론 능력을 향상시키는 방법인 다중 뷰 관계 증류(Multi-View Relational Distillation, MVRD)를 제안한다.

원저자: Kiet T. Nguyen, Hanbo Shim, Jinwoo Kim, Seunghoon Hong

게시일 2026-08-12
📖 3 분 읽기☕ 가벼운 읽기

원저자: Kiet T. Nguyen, Hanbo Shim, Jinwoo Kim, Seunghoon Hong

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 로봇에게 세상을 이해하는 법을 가르치고 있다고 상상해 보세요. 당신은 로봇에게 카메라와 마이크를 주었고, 로봇이 단순히 "컵"이나 "의자"를 인식하는 것을 넘어, 그것들이 3D 공간의 어디에 있는지, 서로 얼마나 떨어져 있는지, 그리고 서로 어떤 관계를 맺고 있는지를 이해하기를 원합니다. 이것이 바로 **시각-언어 모델(Vision-Language Models, VLMs)**의 세계입니다. 이 모델들을 도서관의 모든 책을 읽고 수백만 장의 사진을 본 아주 똑똑한 학생이라고 생각해 보세요. 이들은 단어와 이미지를 매칭하는 데 탁월합니다. 예를 들어 "개"라는 단어가 털이 많은 동물 사진과 어울린다는 것을 아는 것과 같습니다. 하지만 여기에는 함정이 있습니다. 이들은 언어에는 천재적이지만, 기하학에는 매우 서툽니다. "전자레인지"가 어떻게 생겼는지는 알지 몰라도, 그것이 토스터기의 왼쪽에 있는지 오른쪽에 있는지, 혹은 실제로 크기가 어느 정도인지를 파악하는 데는 어려움을 겪습니다. 이는 물리적 공간을 항해해야 하는 로봇, 자율주행 자동차, 그리고 AI 비서들에게 매우 큰 문제입니다. 과학자들은 이 모델들에게 기하학을 가르쳐 이 "공간적 맹목(spatial blindness)"을 해결하려 노력해 왔지만, 기존 방식은 마치 집 전체를 교체하여 새는 지붕을 고치려는 것과 같았습니다. 즉, 모델의 언어 이해 능력을 망가뜨리거나, 모델을 너무 거대하고 느리게 만들어 실시간 작업에 쓸 수 없게 만들었습니다.

여기에 Kiet T. Nguyen과 동료 연구자들이 제안한 **다중 뷰 관계 증류(Multi-View Relational Distillation, MVRD)**라는 새로운 아이디어가 등장했습니다. 학생 모델에게 교사 모델의 지식의 정확한 "형태"를 암기하도록 강요하는 대신(이는 모델의 언어 능력을 망가뜨립니다), 그들은 사물들 사이의 "관계"를 가르치기로 했습니다. 당신이 누군가에게 도시의 레이아웃을 가르치려고 한다고 상상해 보세요. 기존 방식은 모든 건물의 정확한 GPS 좌표를 외우도록 강요하는 것이었습니다. 만약 좌표를 조금이라도 틀리면, 그들은 엉뚱한 동네에 도착하게 되어 빵집이 어디 있었는지조차 잊어버릴 수도 있습니다. 새로운 방식인 MVRD는 이렇게 말하는 것과 같습니다. "정확한 좌표는 걱정하지 마. 그냥 빵집이 공원 옆에 있고, 도서관이 빵집 건너편에 있다는 것만 기억해." 절대적인 위치보다는 이러한 상대적인 연결 관계(즉, "관계")에 집중함으로써, 모델은 언어를 이해하는 능력을 잃지 않으면서 공간을 이해하는 법을 배웁니다.

연구진은 이 방법을 LLaVA-Video-7B라는 모델에 테스트했습니다. 그들은 이 새로운 방법을 기존의 "특징 증류(feature distillation)" 방식(좌표 암기 방식)과 비교했습니다. 결과는 명확했습니다. 기존 방식은 모델의 기하학적 능력을 향상시켰지만, 물체의 개수를 세거나 물체가 나타난 순서를 추적하는 것과 같은 간단한 언어 작업에서 실패하게 만들었습니다. 그것은 마치 완벽한 지도를 그릴 수는 있지만 거리 표지판을 읽는 법은 잊어버린 학생과 같았습니다. 반면, MVRD는 모델의 공간 추론 능력을 크게 향상시켰습니다. 공간 추론 테스트(VSI-Bench)에서 표준 버전은 59.9%, 특수 "듀얼 패스웨이(Dual Pathway)" 버전은 **60.4%**의 평균 정확도를 기록하며 모델의 언어 능력을 온전히 유지했습니다. 실제로 이 새로운 방식은 거대한 별도의 기하 엔진을 사용하는 기존의 가장 우수한 방식과 단 0.5포인트 차이밖에 나지 않았지만, 훨씬 적은 추가 파라미터(단 0.19B)와 훨씬 낮은 지연 시간(latency)을 보여주었습니다.

이 논문은 모델이 장면의 여러 뷰(view)에 걸쳐 "코사인 유사성"(정보의 조각들 사이의 각도를 측정하는 수학적 방법)에 집중함으로써, 언어 이해라는 "살(flesh)"을 덮어쓰지 않고도 3D 공간의 "골격(skeleton)"을 학습할 수 있다고 시사합니다. 이 접근 방식은 또한 견고함이 입증되어, 다양한 유형의 베이스 모델에서 잘 작동했으며 방 안의 특정 물체를 찾거나 장면을 상세히 묘과하는 것과 같은 복잡한 3D 작업으로 일반화되었습니다. 본질적으로, 연구진은 AI에게 말을 하는 법을 잊게 하지 않으면서도 방향 감각과 깊이감을 부여하는 방법을 찾아냈으며, 이는 로봇이 우리의 물리적 세계를 항해할 수 있도록 하는 더 가볍고, 빠르고, 스마트한 길을 제시합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →