← 최신 논문
💻 computer science

MemoBench: Benchmarking World Modeling in Dynamically Changing Environments

이 논문은 동적으로 변화하는 환경에서 가려진 동안 물리적 변화를 겪는 객체에 대한 비디오 생성 모델의 메모리 일관성 유지 능력을 평가하기 위해 360개의 정답 클립과 다각적인 평가 스위트로 구성된 진단 벤치마크인 MemoBench를 소개한다.

원저자: Haoyu Chen, Kaichen Zhou, Hang Hua, Kaile Zhang, Jingwen Qian, Wufei Ma, Haonan Chen, Chunjiang Liu, Yizhou Zhao, Xiaoyuan Wang, Weiyue Li, Alan Yuille, Paul Pu Liang, Yilun Du

게시일 2026-07-21
📖 5 분 읽기🧠 심층 분석

원저자: Haoyu Chen, Kaichen Zhou, Hang Hua, Kaile Zhang, Jingwen Qian, Wufei Ma, Haonan Chen, Chunjiang Liu, Yizhou Zhao, Xiaoyuan Wang, Weiyue Li, Alan Yuille, Paul Pu Liang, Yilun Du

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신은 마술사가 커튼 뒤로 토끼를 사라지게 만드는 마술 쇼를 보고 있다고 상상해 보세요. 토끼가 숨겨져 있는 동안, 마술사는 토끼에게 당근을 먹이고, 미용을 해주고, 저글링을 가르칩니다. 커튼이 다시 올라갔을 때 토끼가 튀어나온다면, 만약 그 토끼가 여전히 그냥 털이 뭉실뭉실한 흰 토끼일 뿐이고 당근도 없고 저글링 기술도 없다면, 그 마술은 실패한 것입니다. 관객은 토끼가 숨겨져 있는 동안 일어난 일을 기억할 것이라고 기대합니다. 이것이 인공지능의 "세계 모델링(world modeling)"이 직면한 핵심 과제입니다. AI 연구자들은 단순히 예쁜 그림들을 이어 붙이는 것이 아니라, 실제 세상이 어떻게 돌아가는지 이해하는 뇌처럼 작동하는 비디오 생성기를 만들고자 노력하고 있습니다. 그들은 이 AI "세계"가 컵이 탁자에서 떨어져 소파 뒤로 굴러갔을 때, 그것이 허공으로 사라지는 것이 아니라 여전히 그곳에 있으며, 아마도 커피가 쏟아진 상태로 다시 보이기를 기다리고 있다는 것을 알기를 바랍니다. 눈에 보이지 않을 때 사물을 기억하는 이 능력은 인간 아기들도 아주 일찍 배우는 기술인 "대상 영속성(object permanence)"이라고 불립니다. 하지만 AI에게 카메라가 움직이는 동안 변화하는 세상을 추적하는 것은 매우 어려운 일입니다.

여기에 AI가 이 기억력 게임을 얼마나 잘 수행하는지 정확히 테스트하기 위해 설계된 새로운 "성적표", MemoBench가 등장했습니다. 연구진은 AI가 대상(녹는 얼음이나 걷는 로봇 같은)의 영상을 보여준 뒤, 카메라가 옆으로 이동하여 대상이 사라지게 만드는 특별한 테스트를 만들었습니다. 대상이 숨겨져 있는 동안, 그것은 계속해서 변화합니다(녹거나, 걷거나, 가루를 붓는 등). 그러고 나서 카메라가 다시 돌아오면 대상이 다시 나타납니다. 큰 질문은 이것입니다. AI는 대상이 숨겨져 있는 동안 무슨 일이 일어났는지 기억하고 있을까요? 논문에 따르면 현재의 AI 모델들은 이 부분에서 형편없습니다. 가장 똑똑한 모델들조차 숨겨진 상태의 새로운 모습을 기억해 내는 데 실패합니다. 모델들이 대상을 다시 가져오기는 하지만, 그것은 종종 잘못된 모양이거나, 색상이 틀리거나, 혹은 막연하게 비슷해 보이는 완전히 다른 대상인 경우가 많습니다. 이 연구는 단순히 AI에게 카메라를 어디로 향하게 할지 알려주는 것만으로는 충분하지 않으며, AI가 아무도 보고 있지 않을 때 발생하는 변화를 추래하기 위해서는 훨씬 더 나은 내부적 "기억"이 필요하다는 점을 시사합니다.

설정: AI와의 숨바꼭질 게임

하버드, MIT 및 기타 유수의 기관 연구진이 이끄는 팀은 MemoBench라는 벤치마크를 구축했습니다. 이것을 비디오 생성 AI를 위한 거대하고 엄격한 숨바꼭질 게임이라고 생각하면 됩니다. 그들은 모델을 테스트하기 위해 360개의 비디오 클립을 만들었습니다. 이 클립 중 절반은 초현실적인 비디오 게임 엔진(Unreal Engine 5)으로 제작되었고, 나머지 절반은 실제 카메라로 촬영된 실제 세상의 영상입니다.

이 게임은 엄격한 3단계 대본을 따릅니다:

  1. 가시성(Visible): 카메라가 대상 물체(로봇이나 녹는 양초 등)를 보여줍니다.
  2. 사라짐(Disappear): 카메라가 고개를 돌립니다. 대상은 이제 숨겨졌지만, 자신의 행동(녹거나, 걷거나, 가루를 붓는 등)을 계속합니다.
  3. 재등장(Reappear): 카메라가 다시 돌아옵니다. 대상이 다시 보입니다.

AI의 임무는 "사라짐"과 "재등장" 부분을 생성하는 것입니다. AI는 대상이 한동안 숨겨져 있는 동안 어떤 모습이 되었을지 추측해야 합니다. 만약 대상이 녹고 있었다면, AI는 재등장 시 더 작고 웅덩이 같은 버전을 보여줘야 합니다. 만약 대상이 걷고 있었다면, AI는 그것을 처음 시작했던 곳이 아닌 새로운 위치에서 보여줘야 합니다.

결과: AI는 짧은 주의력을 가지고 있다

연구진은 이 벤치마크를 통해 10가지의 최첨단 AI 모델을 테스트했습니다. 결과는 다소 충격적이었습니다.

"정적인" 속임수:
일부 모델은 속임수를 쓰려고 했습니다. 실제로 카메라를 움직이고 대상을 추적하는 대신, 영상을 거의 움직이지 않는 상태로 유지했습니다. 영상이 거의 변하지 않았기 때문에, 이 모델들은 "매끄러움"과 "일관성" 지표에서 높은 점수를 받았습니다. 이는 마치 시험 중에 자리를 떠나지 않겠다고 버티는 학생과 같아서, 길을 잃지는 않겠지만 새로운 것도 전혀 배우지 못하는 것과 같습니다. 논문은 LTX-Video와 같은 모델들이 카메라를 거의 움직이지 않았기 때문에 서류상으로는 훌륭해 보였지만, 테스트의 본질에는 실패했다고 언급합니다.

기억의 간극:
실제로 카메라를 움직이고 지시를 따르려고 노력한 모델들조차 심각하게 고전했습니다. 가장 중요한 점수인 **대상 재등장 점수(Object Reappearance Score, ORS)**는 AI가 올바른 대상의 새로운 상태를 얼마나 성공적으로 가져오는지를 측정합니다.

  • 결과: 어떤 모델도 만점 1.0 중 0.6을 넘지 못했습니다.
  • 의미: 가장 뛰어난 모델들조차 대상을 올바르게 기억해 내는 비율이 60%를 넘지 못했습니다. 흔히 대상이 완전히 다른 모양으로 나타나거나, 아예 사라지고 환각(만들어낸 대상)으로 대체되곤 했습니다.

"카메라 제어"의 환상:
연구는 또한 카메라 이동 방식에 대한 명시적인 지시(예: "왼쪽으로 팬(pan)한 뒤 오른쪽으로 회전하라")를 받는 모델들을 살펴보았습니다. AI에게 지도를 주면 기억하는 데 도움이 될 것이라고 생각할 수도 있습니다. 그러나 논문은 이러한 모델들이 카메라 경로를 따라가는 데는 더 나았지만, 대상의 상태를 기억하는 데는 여전히 형편없다는 것을 발견했습니다. 이는 마치 GPS가 당신에게 정확한 운전 경로를 알려주지만, 자동차의 엔진은 코너를 돌기 전에 무엇을 하고 있었는지 잊어버리는 것과 같습니다.

측정 방법

팀은 단순히 추측하는 것이 아님을 확실히 하기 위해 두 가지 유형의 채점을 사용했습니다.

  1. 자동화된 지표(Automated Metrics): 컴퓨터가 AI의 비디오를 실제 비디오와 비교하여 픽셀 단위의 일치성과 3D 기하학적 구조를 확인했습니다.
  2. VQA (시각적 질의응답): 스마트한 AI 판사(LLM)를 사용하여 비디오를 시청하게 하고, "로봇이 같은 방향으로 계속 걸었는가?" 또는 "양초가 숨겨져 있는 동안 녹았는가?"와 같은 예/아니오 질문에 답하게 했습니다. 이러한 인간적인 검증은 단순한 픽셀 비교가 놓칠 수 있는 오류, 예를 들어 대상의 정체성이 변하거나 물리 법칙이 깨지는 현상(그림자가 잘못 움직이는 등)을 잡아냈습니다.

시사점

논문은 AI가 매우 예쁘고 매끄러운 영상을 만드는 데는 매우 능숙해지고 있지만, 기억력 측면에서는 여전히 매우 부족하다고 결론짓습니다. AI는 세상을 연속적인 이야기라기보다는 서로 단절된 스냅샷들의 집합으로 취급합니다. 대상이 화면을 벗어나면, AI는 그것이 존재한다는 사실을 잊어버리거나 새로운 버전을 만들어내곤 합니다.

저자들은 AI가 진정한 "세계 시뮬레이터(world simulator)" 역할을 하기 위해서는(이는 자율주행 자동차나 실제 방을 탐색해야 하는 로봇에게 매우 중요합니다), 단순히 영상을 보기 좋게 만드는 것을 넘어, 보이지 않을 때 일어나는 일을 실제로 기억하도록 모델을 가르치는 데 집중해야 한다고 제안합니다. "사라졌다 다시 나타나는" 테스트는 현재 우리의 AI 세계 모델들이 매우 짧은 기억력을 가지고 있음을 보여주는 단순하지만 강력한 방법입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →