← 최신 논문
🤖 machine learning

Addressable Memory for Video World Models

이 논문은 압축된 메모리 슬롯에 별도의 가상 위치를 할당함으로써 시간적 로터리 위치 임베딩(Rotary Positional Embeddings)의 한계를 극복하고, 새로운 LoopBench 벤치마크에서 시간적 일관성과 에피소드 회상 능력을 크게 향상시켜 비디오 월드 모델의 장기적 시각적 지속성을 가능하게 하는 훈련 불필요(training-free) 프레임워크인 WorldTrace를 소개한다.

원저자: Xindi Wu, Sven Elflein, James Lucas, Olga Russakovsky, Laura Leal-Taixé, Despoina Paschalidou, Jonathan Lorraine, Aljoša Ošep

게시일 2026-08-10
📖 4 분 읽기☕ 가벼운 읽기

원저자: Xindi Wu, Sven Elflein, James Lucas, Olga Russakovsky, Laura Leal-Taixé, Despoina Paschalidou, Jonathan Lorraine, Aljoša Ošep

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 단순히 세상을 보여주는 것이 아니라, 플레이하는 동안 세상을 '꿈꾸는' 비디오 게임 엔진을 구축하고 있다고 상상해 보십시오. 당신이 앞으로 나아가면, 게임은 다음 장면의 풍경을 생성합니다. 코너를 돌면, 게임은 새로운 복도를 발명해 냅니다. 이것이 "비디오 월드 모델(video world models)"의 마법입니다. 하지만 여기에는 함정이 있습니다. 이 디지털 꿈꾸는 존재들은 주의 지속 시간이 매우 짧습니다. 그들은 게임의 지난 몇 초 동안 일어났던 일만을 기억할 수 있습니다. 만약 당신이 거대한 원을 그리며 걷다가 10분 후에 출발점으로 돌아온다면, 게임은 보통 시작점이 어떻게 생겼었는지 잊어버립니다. 약간 다른 나무를 보여주거나, 벽의 위치가 바뀌거나, 완전히 틀린 색상을 보여줄 수도 있습니다. 이는 마치 이야기의 시작 부분은 기억하지만, 이야기의 중간에 도달했을 때 주인공의 이름조차 잊어버려 비슷하게 들리는 새로운 이름을 지어내는 이야기꾼과 같습니다.

이를 해결하기 위해, 과학자들은 보통 컴퓨터에게 본 것을 모두 기록할 수 있는 더 큰 "노트"를 주려고 노력합니다. 하지만 여기에는 문제가 있습니다. 이 노트에는 마법 같은 규칙이 있습니다. 뒤로 갈수록 기록하기가 점점 더 어려워진다는 것입니다. AI 모델의 세계에서 이 "필체"는 무언가가 언제 일어났는지를 알려주는 "위치 인코딩(positional encoding)"(구체적으로는 RoPE)이라는 특별한 코드입니다. 만약 고정된 크기의 노트 안에 너무 많은 역사를 구겨 넣으려 한다면, 이 코드는 뒤섞여 버립니다. 모델은 노트를 볼 수는 있지만, 어떤 노트가 어느 시점의 것인지 파악할 수 없게 됩니다. 이는 마치 날짜가 지워진 일기를 읽는 것과 같습니다. 해변에 대해 썼다는 것은 알지만, 그것이 어제였는지 작년이었는지는 알 수 없는 상태 말입니다. 이 논문은 바로 이 문제를 다룹니다. 즉, 플레이어가 길고 구불구불한 우회로를 거친 후에도 어떻게 비디오 게임 세계를 일관되고 인식 가능하게 유지할 것인가에 대한 문제입니다.

NVIDIA 및 여러 대학교와 협력하여 연구한 이 연구진은 WorldTrace라고 불리는 영리한 새로운 시스템을 제안합니다. 그들은 AI 모델이 망각하는 이유가 단순히 공간이 부족해서가 아니라, 저장된 기억을 '찾아내는' 능력을 상실하기 때문이라는 것을 발견했습니다. 도서관에 엄청난 양의 책이 쌓여 있지만 카탈로그 시스템이 없는 사서라고 상상해 보십시오. 당신이 10년 전의 책을 요청하면, 사서는 그 책이 더미 속에 있다는 것은 알 수 있지만, 라벨이 희미해졌거나 현재 날짜와 맞지 않아서 책장에서 꺼내지 못할 수도 있습니다.

연구팀은 두 가지 주요 문제가 발생한다는 것을 발견했습니다. 첫째, 모델이 학습된 것보다 게임이 더 오래 실행되면 기억의 "라벨"이 뒤섞입니다. 둘째, 공간을 절약하기 위해 오래된 기억을 압축하려고 할 때(예를 들어 한 장의 챕터를 한 문장으로 요약하는 것), 사람들은 의도치 않게 사건의 "날짜"를 뒤섞어 버려, 그 요약본이 서로 호환되지 않는 정보들의 혼란스러운 덩어리가 되도록 만듭니다.

이를 해결하기 위해, WorldTrace는 특별한 파일링 시스템을 갖춘 매우 체계적인 사서처럼 행동합니다. 기억의 "날짜 라벨"이 미지의 영역으로 떠내려가는 대신, 이 시스템은 모든 기억에 모델이 읽는 법을 알고 있는 고정된 안전한 주소를 할당합니다. 이는 마치 도서관이 커지더라도 변하지 않는 영구적인 서가 번호를 각 책에 부여하는 것과 같습니다.

이 새로운 파일링 시스템 내부에서, 연구진은 무엇을 기록할지 결정하기 위해 두 가지 다른 방법을 시도했습니다.

  1. WorldTrace-Field (부드러운 요약): 이 방법은 길고 구불구불한 자동차 여행을 하고 나서, 여정의 전반적인 "분위기"를 포착하는 부드럽고 연속적인 일지를 쓰는 것과 같습니다. 흐름이 자연스럽게 이어지도록 세부 사항을 평균화합니다. 이는 게임이 일관되고 안정적으로 느껴지도록 도와주며, 당신이 걸을 때 하늘 색이 갑자기 변하거나 지면이 흔들리는 현상을 방지합니다. 테스트 결과, 이 방식은 기존 방식에 비해 영상의 부드러움을 15.5% 개선했습니다.

  2. WorldTrace-Landmark (사진첩): 이 방법은 스크랩북과 더 비슷합니다. 모든 것을 요약하는 대신, 코너를 돌거나 독특한 건물을 본 순간처럼 특정하고 중요한 순간들을 골라내어, 그 장면의 완벽하고 고정된 스냅샷을 저장합니다. 나중에 그 장소로 돌아왔을 때, 모델은 스크랩북에서 그 정확한 "사진"을 꺼내 옵니다. 이는 "일화적 회상(episodic recall)", 즉 특정 장소를 기억하는 데 매우 중요합니다. 테스트에서 이 방식은 긴 우회 후에 장면을 기억하는 능력을 19.5% 향상시켰습니다.

이 아이디어가 효과가 있음을 증명하기 위해, 팀은 LoopBench라는 새로운 테스트를 고안했습니다. 당신이 사각형이나 삼각형 모양으로 걸으며 여러 지점을 방문한 뒤 출발점으로 돌아오는 게임을 상상해 보십시오. 이 테스트는 게임이 출발점이 어떻게 생겼었는지 기억하는지 확인합니다. 결과는 WorldTrace가 없다면 게임이 종종 원래의 장면을 재현하는 데 실패하여, 흐릿하거나 잘못된 버전을 보여준다는 것을 입증했습니다. 하지만 WorldTrace를 사용하면, 긴 여정 후에도 게임은 원래의 장면을 안정적으로 재구성할 수 있었습니다.

이 논문은 AI 세계를 실제처럼 느끼게 만드는 핵심은 단순히 더 많은 데이터를 저장하는 것이 아니라, 그것을 찾을 수 있는 방식으로 저장하는 데 있다는 점을 시사합니다. 기억의 "주소"를 고정하고 적절한 종류의 요약(부드러운 이야기 또는 선명한 스냅샷)을 선택함으로써, WorldTrace는 디지털 세계가 훨씬 더 오랫동안 일관성을 유지하도록 하여, 짧은 비디오 클립을 끝없이 탐험 가능한 모험으로 바꿀 수 있게 해줍니다. 세상이 당신을 기억하게 만드는 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →