← 최신 논문
💻 computer science

WorldKV: Efficient World Memory with World Retrieval and Compression

WorldKV 는 전역 KV 캐시 접근 방식 대비 처리량을 두 배로 늘리면서 장기적인 세계 기억을 유지하기 위해 퇴출된 KV 캐시 조각의 선택적 검색과 토큰 압축을 결합함으로써 일관된 실시간 자기회귀 비디오 생성을 가능하게 하는 학습이 불필요한 프레임워크입니다.

원저자: Jung Yi, Minjae Kim, Paul Hyunbin Cho, Wooseok Jang, Sangdoo Yun, Seungryong Kim

게시일 2026-05-22
📖 4 분 읽기☕ 가벼운 읽기

원저자: Jung Yi, Minjae Kim, Paul Hyunbin Cho, Wooseok Jang, Sangdoo Yun, Seungryong Kim

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

가상현실 비디오 게임을 상상해 보세요. 이 게임의 세계는 매우 똑똑한 AI 가 실시간으로 생성합니다. 당신은 이 세계를 거닐고, 모퉁이를 돌며, 탐험할 수 있습니다. 목표는 이 세계가 "현실적"이고 일관되게 느껴지도록 하는 것입니다. 즉, 방에서 나와 5 분 후 다시 돌아왔을 때, 그 방은 완전히 똑같이 보아야 하며, 다른 방이거나 흐릿한 엉망진창처럼 보이면 안 됩니다.

이 논문인 WorldKV는 현재 이러한 AI 모델이 작동하는 방식에 존재하는 특정 문제를 다룹니다. 일상적인 비유를 사용하여 간단히 설명해 보겠습니다:

문제: "짧은 기억" 대 "거대한 배낭"

현재의 AI 비디오 모델은 기억을 처리하는 두 가지 주요 방식을 가지고 있으며, 둘 다 결점이 있습니다:

  1. "슬라이딩 윈도우" (짧은 기억): AI 가 방금 생성한 것의 마지막 몇 초만 볼 수 있는 눈가리개를 쓰고 있다고 상상해 보세요. 당신이 떠나 다시 돌아오면, AI 는 당신이 떠난 방을 "잊어버린" 상태입니다. AI 는 그곳에 무엇이 있는지 추측하려 하다가 종종 환각을 일으켜 (새로 만들어내어) 새로운 가구를 배치하거나 벽을 변경합니다. 이는 빠르지만, 세계는 일관성이 없습니다.
  2. "전체 기록" (거대한 배낭): 망각을 해결하기 위해 AI 는 과거에 본 모든 것을 기억에 보관할 수 있습니다. 이는 당신이 걸을 때마다 점점 더 무거워지는 배낭을 메고 다니는 것과 같습니다. 결국 배낭이 너무 무거워져 (데이터가 너무 많아져) AI 가 미끄러지듯 느려지거나, 컴퓨터의 공간이 완전히 고갈됩니다. 일관된 세계를 얻게 되지만, 실시간으로 실행되지 않게 됩니다.

해결책: WorldKV

저자들은 WorldKV를 제안합니다. 이는 "학습 없이" 작동하는 프레임워크입니다. 즉, AI 에게 다시 학습하는 법을 가르칠 필요가 없었고, 기존 메모리를 더 똑똑하게 조직하는 방법만 제공했을 뿐입니다. 그들은 두 가지 주요 트릭을 사용합니다:

1. 월드 검색: "똑똑한 사서"

낡은 기억을 버리는 것 (슬라이딩 윈도우처럼) 이나 모든 것을 즉시 작업 공간에 보관하는 것 (무거운 배낭처럼) 대신, WorldKV 는 똑똑한 사서처럼 작동합니다.

  • 작동 방식: AI 가 장면을 생성할 때, 그 기억의 "조각"을 선반 (컴퓨터의 메모리) 에 저장하고 카메라 각도나 수행된 행동 (예: "오른쪽으로 회전") 으로 레이블을 붙입니다.
  • 마법 같은 점: 나중에 그 방으로 다시 들어갈 때, AI 는 도서관의 "모든 것"을 보지 않습니다. 대신 레이블을 확인합니다: "아, 사용자가 다시 오른쪽으로 회전하고 있군." 그런 다음 해당 시야와 일치하는 특정 기억 조각만 선반에서 즉시 꺼내어 활성 작업 공간으로 되돌려 놓습니다.
  • 결과: AI 는 전체 기록의 무게를 한 번에 짊어질 필요 없이 방을 완벽하게 기억합니다.

2. 월드 압축: "중복 파일 정리기"

사서가 있더라도, 비디오 프레임은 매우 유사하기 때문에 기억 선반은 혼잡해질 수 있습니다. 당신이 천천히 걸으며 벽을 100 장 촬영하면, 그중 99 장은 거의 동일하게 보입니다.

  • 작동 방식: WorldKV 는 이러한 기억 조각들을 살펴보고 "이것이 새로운 정보인가, 아니면 내가 이미 가진 것의 복사본인가?"라고 묻습니다. 그들은 "앵커" 프레임 (가장 중요한 것들) 을 찾는 수학적 트릭을 사용하여 다른 프레임의 중복된 부분을 삭제합니다.
  • 결과: 각 기억 조각의 크기를 약 절반으로 줄입니다. 이는 중복된 사진 폴더를 압축 (zip) 하는 것과 같습니다. 이제 AI 는 공간이 부족해지지 않고도 같은 선반에 두 배 많은 기록을 담을 수 있습니다.

결과: 양쪽 세계의 장점을 모두 취함

이 논문은 두 가지 다른 AI 모델 (작은 모델과 큰 모델) 에서 이를 테스트했고, WorldKV가 "골디락스" (적당함) 구역을 달성함을 발견했습니다:

  • 일관성: 전체 기록 (Full KV) 을 유지한 것처럼 세계를 거의 완벽하게 기억하며, 무언가를 잊어버리는 "슬라이딩 윈도우" 방식보다 훨씬 뛰어납니다.
  • 속도: 전체 기록을 유지하는 것보다 약 2 배 빠르며, 실시간 속도를 유지합니다.
  • 추가 학습 불필요: 기존 모델과 바로 호환되어 작동하며, 재학습이 필요하지 않습니다.

요약 비유

AI 를 긴 여행을 떠나는 관광객이라고 생각해 보세요.

  • 슬라이딩 윈도우: 관광객은 여행의 마지막 5 분만 기억합니다. 한 시간 전에 방문한 곳으로 돌아가려 하면 길을 잃습니다.
  • 전체 KV: 관광객은 여행의 모든 초에 대한 모든 세부 사항을 거대한 저널에 적어냅니다. 길을 잃지 않지만, 500 파운드짜리 책을 들고 다니느라 너무 느려서 걸을 수 없습니다.
  • WorldKV: 관광객은 마지막 5 분을 위한 작고 활동적인 노트를 보관합니다. 하지만 여행의 나머지 부분에 대한 압축된 요약들을 저장하는 똑똑한 파일 캐비닛도 가지고 있습니다. 특정 장소를 기억해야 할 때, 그들은 캐비닛에서 올바른 요약을 빠르게 꺼내어 노트에 추가합니다. 그들은 길을 잃지 않으면서도 정상적인 속도로 걸을 수 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →