Persistent Computational State: A Session-Centric Runtime for Generative World Models
이 논문은 현재의 생성형 월드 모델이 상태 유지 시뮬레이션 작업을 지원하지 못하는 원인이 구조적 한계가 아니라 지속적인 계산 상태를 폐기하는 요청 중심의 런타임 설계에 있다고 주장하며, 대신 효율적인 바이트 단위 동일 월드 모델 롤아웃을 용이하게 하기 위해 비재계산적 상태의 즉각적인 체크포인팅과 복원을 가능하게 하는 세션 중심의 런타임을 제안한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 단순히 스크립트를 재생하는 것이 아니라, 실제로 '살아 움직이는' 세계를 구축하는 비디오 게임을 만들고 있다고 상상해 보십시오. 이런 종류의 게임에서는 당신이 캠프파이어에서 멀어지면 불은 계속 타오릅니다. 언덕 아래로 굴러가는 공을 놓아두면, 공은 계속 굴러갑니다. 이것이 바로 "생성형 월드 모델(generative world models)"의 꿈입니다. 즉, 단순히 예쁜 그림을 만들어내는 것이 아니라, 일관되고 살아있는 현실을 시뮬레이션할 수 있는 AI 시스템입니다. 하지만 여기 함정이 있습니다. 이 세계를 살아있게 유지하려면, 컴퓨터는 플레이어가 눈을 돌렸다가 다시 바라볼 때조차 아주 작은 세부 사항까지도 정확하게 기억해야 합니다.
오랫동안 과학자들은 이러한 AI 모델들이 "망각"하거나 "기억력이 나쁘기" 때문에 실패한다고 생각했습니다. 그들은 AI의 뇌가 전체 이야기를 담기에 충분히 크지 않다고 가정했습니다. 하지만 이 논문은 다른 질문을 던집니다. 만약 문제가 AI가 아니라면 어떨까요? 만약 플레이어가 잠시 자리를 비운 사이, AI의 노트를 매번 버려버리는 컴퓨터 시스템이 문제라면 어떨까요? 저자들은 이 AI가 세계를 일관되게 유지하기 위해 필요한 '기억'이 마법 같은 초능력이 아니라, 컴퓨터 시스템이 실수로 삭제하고 있었던 몇 가지 특정한 데이터 조각이라는 것을 발견했습니다.
거대한 "너 잊어버렸니?" 미스터리
AI 비디오 생성의 세계에는 좌절스러운 글리치(glitch)가 있습니다. 당신이 AI에게 침대 위에서 점프하는 고양이를 보여달라고 한 뒤, 고양이가 걸어서 멀어지는 모습을 보여달라고 요청합니다. 그러고 나서 다시 고양이가 침대 위로 뛰어드는 모습을 보여달라고 합니다. 완벽한 세상이라면, 고양이는 정확히 같은 지점에, 털의 흐트러짐까지 똑같이 유지하며 착지해야 합니다. 하지만 2026년, 연구진들이 14개의 서로 다른 모델(MBench 사용)과 23개의 서로 다른 모델(WRBench 사용)을 사용하여 이를 테스트했을 때, 동일한 슬픈 결과가 나타났습니다. 고양이는 제대로 돌아오지 못했습니다. 세계는 "표류"해 있었습니다. 침대는 달라져 있었고, 고양이의 위치는 틀렸으며, 물리 법칙은 깨져 있었습니다.
전문가들은 이 망가진 세계들을 보고 이렇게 말했습니다. "AI 모델들이 너무 약하다. 더 많은 학습과 더 큰 뇌, 그리고 기억하는 법을 배우기 위한 특수한 메모리 모듈이 필요하다." 그들은 문제가 AI의 뇌 내부에 있다고 생각했습니다.
하지만 린전(Zhen Lin)이 이끄는 이 논문의 저자들은 탐정 놀이를 하기로 했습니다. 그들은 범인이 AI의 뇌가 아니라, AI를 실행하는 컴퓨터 시스템, 즉 "런타임(runtime)"일 것이라고 의심했습니다.
탐정의 실험: "시간 여행" 테스트
그들의 이론을 증명하기 위해, 연구진은 영리한 실험을 설계했습니다. 그들은 작동 중인 AI 모델을 가져와 장면을 생성하게 했습니다. 그러고 나서 장면이 복잡해지기 직전에, 컴퓨터가 보유하고 있던 두 가지 매우 구체적인 것의 "스냅샷"을 찍었습니다.
- AI가 마지막으로 본 사진 (단순한 숫자 리스트로 저장됨).
- "난수 생성기(RNG)" 상태. 이것은 AI의 내부 주사위 굴리기로 생각하면 됩니다. AI가 결정을 내리거나 새로운 디테일을 생성할 때마다 디지털 주사위를 던집니다. 만약 주사위가 떨어진 정확한 숫자를 저장하지 않는다면, 다음 번 굴리기는 달라질 것이고 세계는 변할 것입니다.
이 스냅샷을 찍은 후, 연구진은 AI에게 "여정"을 떠나도록 강제했습니다. 그들은 AI가 머릿속에 담으려고 노력하던 그 어떤 "암묵적(implicit)" 기억도 완전히 뒤섞어버릴 만큼 길고 거친 사건의 연속을 생성하게 했습니다. 그런 다음 여정을 멈추고, 컴퓨터가 들고 있던 모든 것을 버린 뒤, 스냅샷을 복구했습니다.
결과는 충격적이었습니다. AI가 스냅샷으로부터 다시 시작했을 때, 생성된 비디오는 AI가 떠난 적이 없었을 때의 비디오와 바이트 단위까지 동일했습니다. 완벽했습니다. 고양이는 정확히 같은 지점에 착지했습니다. 픽셀은 동일했습니다.
이것은 AI가 모든 것을 완벽하게 기억할 수 있다는 것을 증명했습니다. 문제는 AI가 건망증이 있는 것이 아니라, AI가 노트를 사용하기도 전에 컴퓨터 시스템이 그 노트(스냅샷)를 버려버렸다는 것이었습니다.
"요청(Request)" vs "세션(Session)"의 혼동
왜 컴퓨터는 노트를 버렸을까요? 알고 보니, 컴퓨터는 챗봇(숙제를 도와주는 챗봇 같은 것들)을 위해 설계된 규칙을 따르고 있었습니다. 챗봇은 "요청(request)" 단위로 작동합니다. 질문을 하면 컴퓨터가 답을 하고, 그다음 다른 사람을 맞이할 준비를 하기 위해 책상을 깨끗이 치웁니다. 이는 챗봇에게는 아주 잘 작동합니다. 왜냐하면 문맥을 잊어버리더라도 컴퓨터가 이전 대화 내용을 다시 읽어서 파악할 수 있기 때문입니다.
하지만 월드 모델은 다릅니다. 월드 모델은 "세션(session)" 단위로 작동합니다. 세션은 연속적인 이야기입니다. 만약 이야기를 잠시 멈췄다가 나중에 다시 시작한다면, 당신은 컴퓨터가 책을 다시 읽기를 원하는 것이 아니라, 정확히 멈췄던 지점에서 다시 시작하기를 원할 것입니다.
저자들은 이 빠진 조각을 **지속적 계산 상태(Persistent Computational State, PCS)**라고 부릅니다. 이것은 세계를 일관되게 유지하기 위해 반드시 저장되어야 하는 아주 작은 필수 데이터 리스트입니다.
- 단순한 모델의 경우, PCS는 마지막 사진과 주사위 굴리기 값만 있으면 됩니다 (약 1.38 MB).
- "메모리 뱅크"가 있는 더 복잡한 모델의 경우, 그 뱅크와 주사위 굴리기 값을 포함합니다 (약 185 KB).
- 과거 데이터를 사용하는 "윈도우(window)" 방식의 모델의 경우, 그 윈도우와 주사위 굴리기 값을 포함합니다 (약 1.67 GB).
논문은 모든 것을 저장할 필요는 없다(그러면 너무 크고 느려질 것입니다)는 것을 보여줍니다. 단지 PCS만 저장하면 됩니다. 그리고 더 좋은 점은? 이 데이터를 저장하고 복구하는 데는 단 0.012 밀리초밖에 걸리지 않는다는 것입니다. 이는 비디오의 한 단계를 생성하는 데 걸리는 시간(1.85초)보다 5단계나 빠른 속도입니다. 사실상 공짜나 다름없습니다.
"관련성(Relevance)" vs "최신성(Recency)"의 반전
논문은 또한 컴퓨터의 메모리가 가득 찼을 때 이 메모리를 관리하는 방법에 대해서도 놀라운 사실을 발견했습니다. 챗봇의 경우, 컴퓨터는 보통 "최신성(Recency)" 규칙을 사용합니다. 즉, 새로운 내용을 위해 가장 오래된 메시지를 버립니다. 하지만 월드 모델에게 이것은 재앙입니다.
당신이 영화를 보고 있는데, 컴퓨터가 10분 전의 장면이 "오래되었다"는 이유로 버리고, 1분 전의 장면만 남겨두기로 결정했다고 상상해 보십시오. 만약 그 영화의 결말을 이해하기 위해 10분 전의 사건을 기억해야 한다면, 영화는 망가집니다.
저자들은 메모리를 관리하는 다양한 방법을 테스트했습니다. 그들은 월드 모델의 경우 "최신성" 규칙이 아닌 "관련성(Relevance)" 규칙이 필요하다는 것을 발견했습니다. 카메라가 다시 돌아오는 순간(return)에 중요한 부분이라면, 설령 그것이 오래된 것이라도 유지해야 합니다.
- 컴퓨터가 메모리를 매우 인색하게 사용하도록 강제되었을 때(2 MB만 사용 가능), "최신성" 규칙은 16개의 세계 중 6개만을 살려냈습니다.
- 반면 "관련성" 규칙은 16개의 세계를 모두 살려냈습니다.
이것은 엄청난 변화입니다. 이는 세계를 살아있게 유지하려면, 챗봇처럼 생각하는 것을 멈추고, 어떤 플롯 포인트가 가장 중요한지 아는 스토리텔러처럼 생각해야 한다는 것을 의미합니다.
핵심 요약
이 논문은 결론적으로, AI 월드 모델의 "망각"은 AI의 뇌에 있는 버그가 아니라고 말합니다. 그것은 컴퓨터 시스템의 관리(housekeeping)에 있는 버그입니다. AI는 기억할 준비가 되어 있었지만, 시스템이 노트를 쓰레기통에 던져버린 것입니다.
시스템을 "지속적 계산 상태(스냅샷과 주사위 굴리기)"를 저장하도록 바꾸고, 메모리가 부족할 때 무엇을 유지할지 결정하는 더 스마트한 방법을 사용함으로써, 연구진은 다음을 입증했습니다:
- 세계를 완벽하게 복구할 수 있습니다. AI는 긴 여정 이후에도 이전과 정확히 동일한 상태로 돌아올 수 있습니다.
- 비용이 거의 들지 않습니다. 이 상태를 저장하는 데는 마이크로초 단위의 시간만 소요됩니다.
- 훨씬 더 많은 세션을 실행할 수 있습니다. 컴퓨터가 무거운 전체 메모리를 초고속 그래픽 카드에 계속 쥐고 있을 필요가 없기 때문에, "노트"를 일반 하드 드라이브에 저장할 수 있습니다. 이는 단일 그래픽 카드가 이전보다 약 2,300배 더 많은 활성 세션을 처리할 수 있음을 의미합니다.
저자들은 단순히 메모리를 고치는 방법을 찾은 것이 아니라, 컴퓨터의 시간과 공간을 관리하는 방식에 대한 간단한 변화가 곧 해결책임을 찾아냈습니다. 세계는 사라진 것이 아니라, 그저 누군가 집어 들기를 기다리고 있었을 뿐입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.