← 최신 논문
🤖 AI

M3VerseM^3-Verse: A "Spot the Difference" Challenge for Large Multimodal Models

본 논문은 일관된 공간적 맥락 내에서 동적 객체 상태 변화를 추론하는 대규모 멀티모달 모델의 능력을 평가하고 향상시키기 위해 쌍으로 된 비디오 관측을 통해 M3VerseM^3-Verse라는 포괄적인 벤치마크를 소개하며, 현재 한계를 드러내고 다중 상태 인식을 위한 효과적인 기준선을 제시합니다.

원저자: Kewei Wei, Bocheng Hu, Jie Cao, Xiaohan Chen, Zhengxi Lu, Wubing Xia, Weili Xu, Jiaao Wu, Junchen He, Mingyu Jia, Ciyun Zhao, Ye Sun, Yizhi Li, Zhonghan Zhao, Jian Zhang, Gaoang Wang

게시일 2026-05-26
📖 4 분 읽기☕ 가벼운 읽기

원저자: Kewei Wei, Bocheng Hu, Jie Cao, Xiaohan Chen, Zhengxi Lu, Wubing Xia, Weili Xu, Jiaao Wu, Junchen He, Mingyu Jia, Ciyun Zhao, Ye Sun, Yizhi Li, Zhonghan Zhao, Jian Zhang, Gaoang Wang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

이 글은 M3-Verse 논문을 쉽고 일상적인 언어로 설명하며, 개념을 명확히 하기 위해 비유를 사용합니다.

핵심 아이디어: AI 를 위한 "차이 찾기" 게임

두 장의 그림을 가지고 고전적인 "차이 찾기" 게임을 한다고 상상해 보세요. 그림 A 를 보고 그림 B 를 본 뒤, 무엇이 변했는지 찾아내야 합니다. 아마도 고양이가 소파에서 바닥으로 이동했거나, 컵이 넘어졌을 수도 있죠.

이제 컴퓨터에게 이 게임을 가르쳐 보되, 두 장의 정적 그림 대신 두 개의 짧은 영상을 보여준다고 가정해 봅시다. 첫 번째 영상에서는 방이 정리되어 있고, 두 번째 영상에서는 누군가 가구를 재배치하고 물건을 옮겼습니다. 컴퓨터는 두 영상을 모두 보고 "빨간 꽃병이 어디로 갔나요?" 또는 "전등이 켜졌나요?"와 같은 질문에 답해야 합니다.

이것이 바로 M3-Verse 논문이 다루는 내용입니다. 저자들은 현대의 AI 모델 (대형 멀티모달 모델, LMM) 이 실제로 시간에 따른 변화를 추적하는 데 능숙한지, 아니면 단순히 추측하는 것인지 확인하기 위해 매우 어려운 새로운 테스트를 개발했습니다.

문제: AI 는 "지금"은 잘하지만, "과거 vs 현재" 비교는 서툴다

이 논문은 AI 가 단일 사진을 보고 설명하는 것 (예: "그건 러그 위에 있는 개예요") 은 놀라울 정도로 뛰어나지만, 서로 다른 두 시점을 비교하라고 하면 어려움을 겪는다고 주장합니다.

  • 현재의 AI: 방 사진을 찍고 눈을 돌린 뒤 다시 돌아와서 무엇이 변했는지 기억해 내려는 관광객과 같습니다. 그들은 종종 세부 사항을 잊어버립니다.
  • 인간 지능: 우리는 자연스럽게 과거와 현재를 비교합니다. 새가 나무에서 날아오면 우리는 즉시 그 차이를 알아챕니다. 논문은 AI 가 두 개의 명확한 장면 사이에서 미묘한 변화를 감지하는 이러한 "생물학적" 능력을 결여하고 있다고 말합니다.

해결책: M3-Verse 라는 새로운 테스트

이를 해결하기 위해 연구자들은 두 가지 부분으로 구성된 거대한 테스트 세트인 M3-Verse를 구축했습니다.

  1. 시뮬레이션 실험실 (M3-Verse-Sim): 연구자들은 비디오 게임 엔진 (AI2-THOR) 을 이용해 270 개의 가상 방을 만들었습니다. 로봇이 방을 돌아다니게 한 뒤, 서랍을 열거나 의자를 옮기는 것처럼 물건을 몰래 이동시키고 '이전'과 '이후' 영상을 기록했습니다. 그리고 이러한 변화에 대해 약 3,000 개의 질문을 생성했습니다.
    • 비유: 이는 규칙이 엄격하고 모든 세부 사항이 알려진 완벽하게 통제된 비디오 게임 레벨과 같습니다.
  2. 실제 세계 (M3-Verse-Real): 실제 가정과 사무실의 29 개 방을 촬영했습니다. 인간이 직접 물건을 이동시키고 변화를 촬영했습니다. 이를 위해 552 개의 질문을 만들었습니다.
    • 비유: 이는 조명 변화, 카메라 흔들림, 완벽한 정렬 부재 등으로 인해 messy 한 실제 생활 버전입니다.

이 테스트는 AI 에게 네 가지 작업을 요구합니다.

  • 공간 이해: 물체는 어디에 있나요?
  • 시간적 이해: 무엇이 먼저 일어났고, 무엇이 나중에 일어났나요?
  • 속성 인식: 색상이나 모양이 변했나요?
  • 추론: 왜 변했거나, 그건 무엇을 의미하나요?

결과: AI 가 어려움을 겪고 있음

연구자들은 GPT-5 와 Gemini 와 같은 주요 모델들을 포함한 16 개의 가장 똑똑한 AI 모델을 테스트했습니다. 결과는 놀라웠습니다.

  • 인간: 약 **90%**를 기록했습니다. 우리는 이 분야에서 뛰어납니다.
  • 최상위 AI 모델: 30% 에서 47% 사이를 기록했습니다. 최상위 모델조차도 가장 어려운 질문에서는 무작위 추측보다 겨우 나을 뿐입니다.
  • 격차: 논문은 이를 "뚜렷한 성능 격차"라고 부릅니다. 현재의 AI 는 한 순간에서 다음 순간으로 장면이 어떻게 변하는지 신뢰할 수 있게 추적할 만큼 충분히 똑똑하지 않습니다.

진단: 왜 AI 가 실패하는가?

연구자들은 단순히 "AI 가 실패했다"고 말하지 않았습니다. Text-Oracle Probe라는 교묘한 트릭을 사용하여 실패했는지 파악하려 했습니다.

  • 실험: 연구자들은 영상을 AI 가 모든 프레임을 텍스트로 설명하게 한 뒤 (상세한 대본처럼), 텍스트 전용 AI 에게 오직 그 텍스트만을 바탕으로 질문에 답하도록 했습니다.
  • 발견: AI 가 원본 영상을 처리할 필요가 없고 텍스트 설명만 읽을 수 있을 때, 점수는 급격히 상승했습니다.
  • 결론: AI 의 "눈" (시각 인코더) 은 실제로 정상적으로 작동하고 있습니다. 변화를 볼 수 있습니다. 문제는 "뇌" (추론 부분) 에 있습니다. 정보가 긴 영상에 걸쳐 분산되어 있을 때, AI 는 중요한 세부 사항을 잊어버립니다. 중요한 단서가 지루한 텍스트 수천 페이지에 묻혀 있는 책을 읽는 것과 같습니다. AI 는 소음에 휩쓸려 단서를 잊어버립니다.

결론

이 논문은 AI 가 단순히 이미지를 "보는" 것을 넘어, 시간의 흐름에 따라 실제로 기억하고 비교할 수 있는 새로운 세대의 AI 가 필요하다고 결론 내립니다.

  • 현재 상태: AI 는 훌륭한 사진을 찍지만 기억력은 형편없는 카메라와 같습니다.
  • 미래 목표: 우리는 방에 대한 정신적 지도를 유지하고, 그 변화를 지켜보며 '이전'과 '이후' 상태 사이의 차이를 찾아낼 수 있는 인간 형 탐정처럼 행동하는 AI 가 필요합니다.

저자들은 이 테스트 (M3-Verse) 를 공개하여 다른 연구자들이 우리의 역동적이고 변화하는 세계를 이해할 수 있는 더 나은, 더 "인식적인" AI 시스템을 구축할 수 있도록 했습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →