ReVSI: Rebuilding Visual Spatial Intelligence Evaluation for Accurate Assessment of VLM 3D Reasoning
ReVSI 는 현실적이고 희소하게 샘플링된 비디오 입력 하에서 질문이 답변 가능하고 정확하도록 381 개의 장면을 재주석하고 질문-답변 쌍을 재생성함으로써 현재 VLM 3D 추론 평가의 체계적 무효성을 해결하는 새로이 제안된 벤치마크 및 평가 프로토콜로, 이를 통해 공간 지능의 이전에 가려져 있던 실패 모드를 드러냅니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
학생이 집을 탐색하고 내부 가구를 세는 능력을 테스트하려 한다고 상상해 보세요. 학생에게 집의 영상을 주고 "소파 위에 베개가 몇 개 있나요?"라고 물어봅니다.
인공지능(AI) 세계에서는 연구자들이 VSI-Bench라는 표준 테스트를 사용하여 AI 모델 (특히 비전 - 언어 모델, 즉 "VLM") 이 3D 공간을 얼마나 잘 이해하는지 평가해 왔습니다. 하지만 이 논문에 따르면, 그 테스트는 결함이 있습니다. 마치 숫자가 흐릿하고, 질문에 핵심 정보가 누락되었으며, 정답지가 틀린 시험지로 학생의 수학 실력을 평가하는 것과 같습니다.
저자들은 이러한 문제를 해결하기 위해 ReVSI라는 새롭고 재건된 테스트를 소개합니다. 그들이 발견한 내용과 수행한 작업을 간단한 비유로 정리해 보겠습니다.
1. 문제: "고장 난 지도"와 "눈가리개"
이 논문은 구식 테스트 (VSI-Bench) 가 오점을 준 두 가지 주요 원인을 지적합니다.
"고장 난 지도" (주석 드리프트):
구식 테스트는 과거 다른 목적으로 생성된 "지도"(3D 데이터) 에 의존했습니다. 마치 오늘날 도시를 탐색하기 위해 1990 년에 그린 성급한 손그림 지도를 사용하는 것과 같습니다.- 누락된 객체: 구식 지도는 스캐너가 놓쳐서 의자가 없다고 표시할 수 있지만, 실제 영상에서는 의자가 명확히 보입니다. AI 는 의자를 보았다는 이유로 감점받지만, "정답지"에는 의자가 없어야 한다고 되어 있습니다.
- 잘못된 라벨: 3D 형태가 왜곡되어 지도가 "컵"을 "노트"로 잘못 라벨링할 수 있습니다. AI 는 영상에 컵이 명확히 보임에도 불구하고 혼란을 겪습니다.
- 부적절한 기하학: 스캐너가 거울에 혼란을 느껴 방의 크기를 20 평방미터로 계산했을지라도, 영상에서는 실제로 40 평방미터임을 보여줍니다.
"눈가리개" (프레임 샘플링):
현대 AI 모델은 종종 전체 영상을 보지 않고 시간을 절약하기 위해 몇 장의 스냅샷 (프레임) 만을 봅니다.- "이 방에 사람이 몇 명 있나요?"라고 물으면서 방이 비어 있을 때 찍은 사진만 보여준다고 상상해 보세요.
- 구식 테스트는 AI 가 전체 영상을 볼 수 있다고 가정했습니다. 하지만 실제로 AI 가 1,000 개 중 16 개의 스냅샷만 본다면, 객체를 완전히 놓칠 수 있습니다. 구식 테스트는 이를 고려하지 않았기 때문에, AI 가 실제로 가진 제한된 시야로는 답할 수 없는 질문을 던졌습니다.
2. 해결책: ReVSI ("새로 단장된 집")
저자들은 구식 테스트를 단순히 수정한 것이 아니라, 완전히 해체하고 처음부터 다시 재건했습니다. 이를 ReVSI라고 부릅니다.
- 집의 재주석: 그들은 인간 전문가를 고용하여 원본 영상을 보고 수동으로 새롭고 완벽한 "지도"를 그리게 했습니다. 누락된 의자를 수정하고, 잘못된 라벨을 바로잡으며, 노이즈가 있는 스캐너가 있다고 생각한 것이 아니라 영상에 실제로 있는 것을 바탕으로 방을 정확하게 측정했습니다.
- "프레임 인식" 규칙: 그들은 게임의 규칙을 변경했습니다. 이제 AI 가 16 개의 프레임만 볼 수 있다면, 테스트 질문은 그 16 개의 프레임에 맞춰 생성됩니다. 만약 그 16 개의 프레임에 객체가 없다면, 질문이 변경되거나 제거됩니다. 이를 통해 AI 는 실제로 볼 수 있는 것만 테스트받도록 보장합니다.
- "더미 영상" 스트레스 테스트: 이것이 그들의 가장 창의적인 도구입니다. 그들은 AI 가 찾아야 할 객체를 디지털 방식으로 지운 "더미 영상"을 만들었습니다.
- 테스트: 그들은 AI 에게 거실 영상을 보여주지만 "베개"가 포함된 모든 프레임을 제거합니다.
- 목표: 똑똑한 AI 는 "베개가 보이지 않으므로 정답은 0 입니다"라고 말해야 합니다.
- 결과: 많은 AI 모델이 "0"이라고 말하는 대신, 거실에는 보통 베개가 있다는 것을 기억하고 있어 "2"나 "3"이라고 추측했습니다. 이는 이러한 모델들이 증거를 보고 있는 것이 아니라 기억을 바탕으로 망상 (할루시네이션) 하고 있음을 드러냈습니다.
3. 충격적인 결과
그들이 새로운 테스트를 실행했을 때, AI 모델들의 순위는 극적으로 바뀌었습니다.
- "독점" 모델 (빅테크): GPT-5.2 와 Gemini 3 와 같은 모델들은 실제로 꽤 잘 수행했습니다. 그들은 추측보다는 영상에서 실제로 본 것에 더 의존하는 것으로 보였습니다.
- "오픈소스" 모델: 구식 테스트에서 훌륭해 보였던 많은 모델들이 갑자기 훨씬 더 나빠 보였습니다. 그들의 점수가 크게 떨어졌는데, 이는 구식 테스트의 "고장 난 지도"와 "편향"에 의존했기 때문입니다.
- "전문" 모델: 3D 작업에 특화되도록 훈련된 일부 모델들은 오히려 훈련되지 않은 버전보다 새로운 테스트에서 더 나쁜 성적을 받았습니다. 이는 그들이 구식 테스트의 나쁜 데이터에 과적합되어, 올바른 추론 대신 "틀린 정답"을 학습했음을 시사합니다.
결론
이 논문은 테스트에 결함이 있었기 때문에 현재 AI 공간 지능의 점수를 신뢰할 수 없다고 주장합니다. ReVSI는 새롭고 더 엄격하며 더 정직한 시험입니다. 이는 AI 가 방이 어떻게 보여야 한다고 생각하는 것에 기반해 추측하는 것이 아니라, 제공된 영상 프레임을 실제로 보고 있는지 증명하도록 강제합니다.
간단히 말해, 구식 테스트는 흐릿한 사진과 틀린 정답지를 바탕으로 학생을 평가하는 교사와 같았습니다. ReVSI 는 학생에게 선명한 고화질 영상을 건네주고, 그 영상에 정확히 보이는 것과 일치하는 질문을 하는 교사입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.