← 최신 논문
🤖 machine learning

WorldPack: Dynamic Frame Compression for Long-context Video World Modeling

WorldPack은 궤적 패킹(trajectory packing)과 기하학적 선택(geometric selection)을 통해 3D 시점 관련도에 따라 압축률을 동적으로 할당함으로써 유효 컨텍스트를 4프레임에서 22프레임으로 확장하고, 공간 인지적 압축 메모리(spatially-aware compressed memory)를 도입하여 장기적 공간 일관성을 향상시키는 비디오 월드 모델이다.

원저자: Yuta Oshima, Yusuke Iwasawa, Masahiro Suzuki, Yutaka Matsuo, Hiroki Furuta

게시일 2026-07-23
📖 3 분 읽기☕ 가벼운 읽기

원저자: Yuta Oshima, Yusuke Iwasawa, Masahiro Suzuki, Yutaka Matsuo, Hiroki Furuta

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 로봇에게 거대하고 끝없는 미로를 탐색하는 법을 가르치고 있다고 상상해 보세요. 이를 위해 로봇은 '세계 모델(world model)'을 가져야 합니다. 이는 현재 위치와 계획한 경로를 바탕으로 몇 단계 뒤에 미로가 어떤 모습일지 예측할 수 있는 정신적 시뮬레이션입니다. 마치 비디오 게임 캐릭터가 실제로 일어나기 전 다음 프레임을 예측하는 것과 같습니다. 오랫동안 이러한 디지털 지능들은 심각한 문제에 직면해 있었습니다. 바로 기억력이 너무 짧다는 것이었습니다. 만약 로봇이 원을 그리며 돌다가 10분 전에 방문했던 지점으로 돌아온다면, 로봇은 그곳이 어떻게 생겼었는지 이미 잊어버린 상태였습니다. 이는 누군가가 당신이 이미 맞춰 놓은 퍼즐 조각들을 계속 지우면서 퍼즐을 풀라고 하는 것과 같습니다.

문제는 컴퓨터가 과거의 이미지들을 간직할 수 있는 '뇌 공간'(또는 컨텍스트 윈도우)이 제한되어 있다는 점입니다. 만약 너무 많은 사진을 이 공간에 억지로 집어넣으려 하면, 컴퓨터는 과부하가 걸려 느려집니다. 반대로 새로운 사진을 위한 공간을 만들기 위해 오래된 사진들을 버린다면, 로봇은 길을 잃고 자신이 어디에 있었는지 기억하지 못하게 됩니다. 과학자들은 로봇의 뇌가 다운되지 않으면서도 복잡한 여정을 처리할 수 있을 만큼 충분히 긴 기억을 유지하는 방법을 찾아내기 위해 노력해 왔습니다. 이것이 바로 "WorldPack"이라는 논문이 해결하고자 하는 퍼즐입니다.

WorldPack의 연구진은 기존의 메모리 관리 방식이 마치 여행을 위해 짐을 싸면서 방금 입었던 옷 몇 벌만 던져 넣고 나머지는 무시하는 것과 같다는 점을 깨달았습니다. 그들은 이렇게 물었습니다. "만약 우리가 더 많은 것을 챙길 수 있다면, 단지 지금 당장 중요하지 않은 것들을 압축하면 어떨까?" 그들의 해결책은 WorldPack이라 불리는 영리한 2단계 기법입니다.

첫째, 그들은 기하학적 선택(Geometric Selection) 기술을 사용합니다. 당신이 여정의 지도를 보고 있다고 상상해 보세요. 단순히 마지막에 이동한 몇 단계만을 기억하는 대신, 로봇은 자신의 현재 위치를 확인하고 다음과 같이 질문합니다. "내가 지금 바라보고 있는 과거의 장소는 어디인가?" 만약 로봇이 몇 시간 전에 방문했던 방에 서 있다면, 그 오래된 기억은 갑자기 매우 중요해집니다. 시스템은 이 오래된 기억에 '높은 점수'를 부여하고 고해상도로 유지합니다. 반면, 로봇이 전혀 근처에 있지 않은 곳에서 온 과거의 기억은 '낮은 점수'를 받게 됩니다.

둘째, 그들은 **궤적 패킹(Trajectory Packing)**을 사용합니다. 여기서 마법이 일어납니다. 점수가 낮은 기억들을 삭제하는 대신, 로봇은 그것들을 축소합니다. 이는 마치 멀리 있는 산의 고해상도 사진을 아주 작은 썸네일 이미지로 만드는 것과 같습니다. 세부적인 모습은 볼 수 없지만, 산이 그곳에 있다는 사실은 여전히 알 수 있습니다. 중요하지 않은 기억들을 축소함으로써, 로봇은 제한된 뇌 공간 안에 훨씬 더 많은 기억을 담을 수 있게 됩니다. 실험에서 그들은 보통 4개의 프레임만 담을 수 있는 공간에 22개의 과거 프레임을 구겨 넣는 데 성공했습니다.

논문은 이 접근 방식이 매우 효과적임을 보여줍니다. 연구진이 마인크래프트와 유사한 세계(연구용으로 사용되는 디지털 샌드박스)에서 WorldPack을 테스트했을 때, 로봇은 긴 루프를 항해하고 아주 오래전에 방문했던 장소로 돌아오더라도 혼란을 겪지 않았습니다. 로봇은 이전 모델들보다 세계의 구조를 훨씬 더 잘 기억했습니다. 이전 모델들은 과거를 잊어버리거나 생각하는 속도가 너무 느려졌던 반과 대조적이었습니다. 연구진은 로봇이 이 압축된 기억들을 처리하는 데 시간이 아주 조금 더 걸리긴 했지만(약 16% 더 긴 시간), 과거를 훨씬 더 멀리 내다볼 수 있다는 점에서 그 대가로 치를 만한 가치가 있다고 밝혔습니다.

하지만 논문은 이 방식이 모든 것을 해결해 주는 완벽한 마법은 아니라는 점도 지적합니다. 이 시스템은 로봇의 카메라가 정확히 어디를 향하고 있는지(포즈, pose)를 아는 것에 의존합니다. 만약 로봇이 자신의 위치에 대해 혼란을 느낀다면, 시스템은 잘못된 기억을 축소하거나 엉뚱한 기억을 남겨둘 수 있습니다. 저자들은 카메라가 흔들리거나 위치 추적을 놓칠 수 있는 실제 환경에서는 이 방식이 정확성을 유지하기 위해 추가적인 도움이 필요할 수 있다고 제안했습니다.

요약하자면, WorldPack은 똑똑한 장기 기억의 비결이 단순히 더 큰 뇌를 갖는 것이 아니라, 어떻게 짐을 싸느냐에 달려 있음을 시사합니다. 중요한 과거의 순간들은 선명하게 유지하고, 덜 중요한 것들은 작게 만듦으로써, 디지털 지능은 시작했던 곳을 잊지 않고 훨씬 더 멀리 여행할 수 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →