← 최신 논문
💻 computer science

Towards Spatial Supersensing in the Wild

이 논문은 공간적 초감각(supersensing) 능력을 평가하기 위해 설계된 대규모 실제 롱 비디오 벤치마크인 VSI-Super-Wild를 소개하며, 현재의 멀티모달 모델들이 공간적 붕괴 및 불충분한 업데이트와 같은 문제로 인해 시간이 흐름에 따라 일관된 세계 상태 추적을 유지하는 데 근본적으로 실패한다는 점을 밝혀낸다.

원저자: Tianjun Gu, Tianyu Xin, Kuan Zhang, Bowen Yang, Kok-Chung Chua, Peize Li, Xinran Zhang, Yupeng Chen, Qiyue Zhao, Qinlei Xie, Jianhang Liu, Yucheng Lu, Yinan Han, Marco Pavone, Yiming Li

게시일 2026-07-16
📖 3 분 읽기☕ 가벼운 읽기

원저자: Tianjun Gu, Tianyu Xin, Kuan Zhang, Bowen Yang, Kok-Chung Chua, Peize Li, Xinran Zhang, Yupeng Chen, Qiyue Zhao, Qinlei Xie, Jianhang Liu, Yucheng Lu, Yinan Han, Marco Pavone, Yiming Li

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 북적이는 도시를 걷고 있다고 상상해 보세요. 당신은 단순히 단절된 사진들의 연속을 보는 것이 아니라, 머릿속에 정신적 지도를 구축합니다. 커피숍이 왼쪽에 있다는 것, 은행에서 오른쪽으로 꺾었다는 것, 그리고 똑같은 빨간 자전거를 세 번 지나쳤다는 것을 알고 있습니다. 눈에 보이는 것, 자신이 어디에 있는지, 그리고 무엇을 했는지를 하나의 연속적인 이야기로 엮어내는 이 능력은 인간이 세상을 항해하는 방식입니다. 과학자들은 이를 "세계 모델링(world modeling)"이라고 부릅니다. 오랫동안 컴퓨터 프로그램들은 고양이 한 장이나 자동차 사진 한 장을 인식하는 데는 뛰어난 성능을 보여왔습니다. 하지만 긴 영상을 시청하며 이야기를 추적하는 문제, 예를 들어 하루 종일 돌아다닌 후에 열쇠를 정확히 어디에 두었는지 기억하는 문제에 있어서 컴퓨터는 어려움을 겪어왔습니다. 그들은 줄거리를 놓치거나 등장인물을 혼동하곤 합니다. 이 논문은 바로 그 구체적인 어려움을 파고듭니다. 인공지능이 비디오 스트림을 시청할 때 실제로 신뢰할 수 있는 내부 세계 지도를 구축할 수 있을까요, 아니면 그저 현재 프레임이 어떻게 보이는지에 기반해 추측하는 것뿐일까요?

이 연구를 진행한 칭화대학교, NVIDIA, 스탠퍼드 대학교의 연구진은 세계에서 가장 똑똑한 비디오 판독 AI 모델들을 매우 혹독한 테스트에 투입하기로 했습니다. 그들은 VSI-SUPER-WILD라는 새로운 벤치마크를 만들었습니다. 이것을 AI를 위한 "생존 챌칭"이라고 생각하십시오. 이전의 테스트들이 조용하고 텅 빈 방에서 몇 가지 특정 기술을 훈련시키는 강아지와 같았다면, 이 새로운 테스트는 AI를 가공되지 않은, 편집되지 않은, 혼란스러운 현실 세계의 야생 속으로 던져 넣습니다. 그들은 인터넷에서 번화한 거리, 쇼핑몰, 병원, 사무실 건물 등을 포함한 442개의 실제 세계 영상을 수집했습니다. 이것들은 짧게 이어 붙인 클립이 아닙니다. 일부는 4시간 이상 길며, 삶의 무질서하고 연속적인 흐름을 포착합니다.

목표는 이 AI 모델들이 진정한 "정신적 지도"를 필요로 하는 질문에 답할 수 있는지 확인하는 것이었습니다. 그들은 인간의 기억 방식에 기반하여 네 가지 유형의 도전 과제를 설계했습니다:

  1. "어느 방향?" 테스트: 영상을 시청한 후, AI가 카메라(카메라를 들고 있는 사람)가 앞, 뒤, 왼쪽, 또는 오른쪽으로 움직였는지 말할 수 있는가?
  2. "어디에 있었나?" 테스트: 카메라가 회전하여 같은 장소를 다른 각도에서 보았더라도, AI가 방문했던 장소들의 순서를 기억할 수 있는가?
  3. "언제 일어났나?" 테스트: AI가 파란색 배낭과 같은 특정 물체가 정확히 언제 처음 나타났고 언제 사라졌는지 기억할可以 있는가?
  4. "몇 개인가?" 테스트: AI가 중복 계산 없이 고유한 항목들(예: "우리는 몇 개의 서로 다른 소화전을 지나쳤는가?")을 셀 수 있는가?

결과는 다소 충격적이었습니다. 매우 진보했음에도 불구하고, 구글의 최첨단 모델과 오픈 소스 프로젝트를 포함하여 테스트된 13개의 AI 모델은 저조한 성적을 보였습니다. 가장 뛰어난 모델조차 전체 답변의 약 **44%**만을 맞혔는데, 이는 겨우 찍는 것보다 조금 나은 수준입니다. 논문은 이 모델들이 "지름길(shortcuts)"에 의존하기 때문에 실패하고 있다고 시사합니다. 즉, 3D 지도를 구축하는 대신, 단일 프레임을 보고 추측한다는 것입니다. 예를 들어, 도로를 보면 그들은 보통 일어나는 일인 '앞으로 전진'을 가정하여 사람이 앞으로 걷고 있다고 추측합니다. 실제로는 뒤로 걷고 있는 상황임에도 말입니다.

연구진은 AI 모델들이 "무너지는" 네 가지 구체적인 방식을 식별했습니다:

  • 공간적 붕괴 (Spatial Collapse): 카메라 뷰를 회전시키면 AI는 그곳이 같은 장소라는 것을 잊어버립니다. 그것은 회전된 뷰를 완전히 새로운 위치로 취급하며 공간감을 상실합니다.
  • 의미론적 지름길 (Semantic Shortcuts): AI는 사물이 어떻게 움직이는지가 아니라 어떻게 '보이는지'에 기반해 추측합니다. 도로를 보면 실제 움직임을 추적하는 대신 "전진 운동"을 가정해 버립니다.
  • 불충분한 업데이트 (Insufficient Update): AI는 영상의 시작 부분은 잘 기억하지만, 새로운 정보가 들어옴에 따라 기억을 업데이트하는 데 실패합니다. 첫인상에 갇혀 나중에 나타난 증거들을 무시합니다.
  • 인스턴스 혼동 (Instance Confusion): AI는 현실의 무질서함에 혼란을 느낍니다. 물체가 흐릿하거나 일부가 가려져 있으면, 그것을 이전에 보았던 동일한 물체가 아닌 완전히 새로운 물체라고 생각할 수 있습니다.

연구는 또한 영상이 길어질수록 AI의 성능이 떨어진다는 것을 발견했습니다. 영상이 길어짐에 따라(10분에서 2시간 이상까지), 모델의 일관된 이야기를 유지하는 능력은 현저히 감소했습니다. 이는 AI가 단일 순간을 이해하는 데는 점점 나아지고 있지만, 여전히 일관되고 장기적인 세계 기억을 유지하는 능력은 부족하다는 것을 시사합니다. 논문은 AI가 인간처럼 세상을 진정으로 이해하기 위해서는 단순히 사진을 인식하는 것을 넘어, 공간과 시간에 대한 안정적이고 업데이트되는 지도를 구축하는 법을 배워야 한다고 결론짓습니다. 그때까지, 만약 당신이 긴 하루 끝에 열쇠를 어디에 두었는지 AI에게 묻는다면, 그것은 그럴듯하게 들리지만 사실이 아닌 이야기를 들려줄 뿐일 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →