ReWorld: An Interactive World Model with Long-Horizon Memory
ReWorld는 혼합 어텐션 메커니즘을 통해 훈련 단계에서 단기 제어와 장기 기억 사이의 구조적 긴장을 분리하고, 포즈 인덱스 기반의 랜드마크 검색 시스템을 통해 추론 시 이를 통합함으로써 다양한 시각적 도메인 전반에 걸쳐 탁월한 동작 충실도, 비디오 품질, 그리고 분 단위의 시간적 일관성을 달성하는 상호작용형 월드 모델이다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
컴퓨터가 비디오를 관찰한 뒤, 마치 그 장면 속에 살고 있는 것처럼 다음 장면을 프레임 단위로 예측할 수 있다고 상상해 보십시오. 이것이 바로 '월드 모델(world model)'의 약속입니다. 월드 모델은 에이전트가 움직이고 행동할 수 있는 환경을 시뮬레이션하도록 설계된 인공지능의 한 유형입니다. 이러한 시스템이 진정으로 살아있는 것처럼 느껴지려면 세 가지 어려운 과제를 동시에 수행해야 합니다. 즉, 사용자의 명령에 즉각적으로 반응해야 하고, 사용자가 떠났다가 돌아왔을 때 그 장소가 어떤 모습이었는지 정확히 기억해야 하며, 메모리가 부족해지지 않으면서 실시간으로 새로운 비디오를 계속 생성해내야 합니다. 문제는 이러한 목표들이 서로 충돌한다는 점이었습니다. 빠르게 반응하려면 직전의 과거에만 집중해야 하지만, 먼 곳을 기억하려면 방대한 기록을 보유해야 합니다. 만약 시스템이 동일한 단순한 방식으로 이 두 가지를 모두 하려 한다면, 과거를 잊어버리거나 현재 상황에서 비틀거리며 둘 중 하나에서 반드시 실패하게 됩니다.
연구진은 이제 컴퓨터가 두 가지 다른 방식으로 동시에 생각하도록 가르침으로써 이 긴장 상태를 해결하는 'ReWorld'라는 시스템을 구축했습니다. 홍콩과 알리바바 소속 기관들과 협력한 연구팀은 사용자의 카메라 움직임을 따라가고, 실사 같은 풍경이나 게임 같은 세계의 고화질 비디오를 스트리밍하며, 카메라가 멀리 이동했다가 다시 돌아온 후에도 몇 분 전의 특정 장면을 회상할 수 있는 모델을 만들어냈습니다. 핵심적인 발견은 시스템이 단기적 반응과 장기적 기억 사이에서 선택할 필요가 없다는 것입니다. 대신, 학습 과정에서 이 작업들을 분리한 다음 실제 구동 시 이를 정교하게 관리하도록 만든 것입니다.
ReWorld의 성공 핵심은 주의력(attention)을 조직하는 방식에 있습니다. 많은 인공지 intelligence 모델에서는 시스템이 다음에 무엇을 생성할지 결정하기 위해 지금까지 본 모든 정보를 살펴봅니다. 하지만 ReWorld는 이 작업을 뇌의 서로 다른 부분들로 나눕니다. 어떤 부분은 버튼 입력에 따른 즉각적이고 정확한 카메라 움직임을 보장하기 위해, 아마도 지난 몇 초간의 아주 최근 과거만을 보도록 훈련됩니다. 다른 부분은 비디오의 전체 이력을 살펴보도록 훈련되어, 아주 오래전에 보았던 특정 바위 형상이나 건물이 지금 보고 있는 것과 동일한 것임을 인식할 수 있게 합니다. 결정적으로, 연구진은 이 역할들을 시스템의 고정된 부분에 할당하지 않았습니다. 대신 학습 중에 역할을 무작위로 섞음으로써, 모든 부분이 즉각적인 반응과 먼 기억을 모두 처리하는 방법을 배우도록 했습니다. 이는 시스템이 특정 방식의 과거 관찰에 의존하게 되는 것을 방지하며, 이는 현실 세계에서 시스템이 자신의 전체 이력을 영원히 메모리에 간직할 수 없다는 점을 고려할 때 매우 중요합니다.
시스템이 실제로 작동할 때, 시스템은 한 번에 보유할 수 있는 정보량에 엄격한 제한을 받게 됩니다. 이를 처리하기 위해 ReWorld는 영리한 파일링 시스템을 사용합니다. 비디오가 재생되는 동안, 시스템은 가장 최근의 프레임들을 담은 작고 지속적으로 업데이트되는 창(window)을 유지합니다. 오래된 프레임이 이 창에서 벗어날 때, 그것들은 단순히 삭제되지 않습니다. 대신, 시스템은 카메라가 해당 위치를 저장할 만큼 충분히 멀리 이동했는지 확인합니다. 만약 그렇다면, 시스템은 그 장면의 고화질 '랜드마크(landmark)'를 저장합니다. 이 랜드마크들은 별도의 제한된 뱅크에 저장됩니다. 카메라가 방향을 돌려 이전에 방문했던 곳으로 향할 때, 시스템은 현재의 뷰와 일치하는 랜드마크를 이 뱅크에서 찾아 현재의 활성 메모리로 다시 불러옵니다. 이를 통해 시스템은 그 사이에 있었던 모든 프레임을 저장할 필요 없이, 불과 1분 전의 장면을 기억할 수 있습니다.
이를 구현하기 위해 연구진은 매우 특정한 종류의 데이터로 모델을 가르쳐야 했습니다. 그들은 실제 영상, 비디오 게임, 그리고 컴퓨터 생성 환경의 푸티지를 결합했지만, 한 가지 독특한 작업을 수행했습니다. 바로 앞으로 이동하기 위해 키를 누르는 것과 같은 단일 명령이 모든 종류의 푸티지에서 정확히 동일한 물리적 거리를 이동하도록 만든 것입니다. 이를 통해 통일된 움직임의 언어를 구축했습니다. 또한, 모델로부터 비디오 이력의 일부를 의도적으로 숨겨서, 기억이 불완전한 상황에서도 장면을 재구성하는 법을 배우도록 하는 특수한 훈련 기법을 사용했습니다. 이는 모델이 연속적인 데이터 스트림 대신 몇 개의 핵심 랜드마크에 의존해야 할 때 혼란을 겪지 않도록 준비시키는 과정이었습니다.
이러한 접근 방식의 결과는 놀랍습니다. 카메라가 멀어졌다가 출발점으로 돌아오는 테스트에서, ReWorld는 카메라가 1분 이상 이동한 후에도 원래의 뷰를 놀라운 정확도로 재생해 냈습니다. 단순한 슬라이딩 윈도우 방식의 최근 프레임에 의존하는 다른 시스템들은, 해당 프레임이 윈도우에서 벗어나자마자 출발점을 기억하지 못하고 실패했습니다. ReWorld 역시 명령을 따르는 데 있어 우수함을 증명했는데, 카메라가 경로를 벗어나지 않고 의도한 대로 정확히 움직였습니다. 시스템은 704 x 1280 해상도의 비디오를 생성할 수 있으며, 상호작용이 가능할 만큼 빠르고, 실사 풍경부터 양식화된 게임 세계에 이르기까지 다양한 스타일 전반에서 이 품질을 유지합니다.
연구진은 자신들의 방법이 제어와 기억이라는 서로 다른 요구 사항을 존중하기 때문에 작동한다는 것을 발견했습니다. 단기 명령 처리와 장기 회상을 분리하여 훈련하고, 스마트한 검색 시스템을 사용하여 필요할 때만 오래된 기억을 불러오도록 함으로써, 제어력과 일관성을 모두 갖춘 월드 모델을 만들어냈습니다. 시스템은 과거를 기억하기 위해 거대하고 모든 것을 아는 존재가 될 필요가 없습니다. 그저 필요할 때 적절한 과거의 조각을 찾는 법을 알면 됩니다. 이러한 접근 방식은 모델이 상호작적인 비디오 생성을 위해 이전에는 불가능했던 연속성을 유지하면서도 표준 컴퓨터 하드웨어에서 실행될 수 있게 합니다. 이 연구는 상호작용형 AI의 미래가 단순히 모델을 더 크게 만드는 것이 아니라, 이미 학습한 정보를 어떻게 조직하고 접근하느냐에 대한 더 똑똑한 전략에 달려 있음을 시사합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.