PAN: A World Model for General, Actionable, and Long-Horizon World Simulation
이 논문은 상태 유지 잠재 표현(stateful latent representations), 폐루프 정보 흐름(closed-loop information flow), 그리고 고급 시뮬레이션 추론과 계획을 가능하게 하는 혼합 LLM/디퓨전 백본을 결합함으로써 일반적인 오픈 도메인 행동 기반 예측 및 장기적 일관성의 기존 한계를 극복하는 생성적 잠재 예측(Generative Latent Prediction, GLP) 아키텍처 기반의 월드 모델인 PAN을 소개한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
단순히 세상에 반응하는 것이 아니라, 세상을 예측하는 마음을 상상해 보십시오. 수십 년 동안 과학자들은 사진 속의 고양이를 인식하거나 시를 쓰는 수준을 넘어, 컵을 밀거나, 운전대를 돌리거나, 문을 열 때 물리적 세계가 어떻게 변하는지를 이해할 수 있는 인공지능을 구축하고자 노력해 왔습니다. 현재의 행동을 바탕으로 미래를 예측하는 이 능력은 '월드 모델(world model)'이라고 알려져 있습니다. 이는 생명체가 계획을 세우고, "만약 ~한다면 어떻게 될까"를 상상하며, 위험이 닥치기 전에 이를 피할 수 있게 해주는 인지적 엔진입니다. 현대의 컴퓨터는 이미지와 텍스트를 생성하는 데 매우 뛰어나졌지만, 현실의 인과관계 논리를 시뮬레이션하는 데는 종종 어려움을 겪습니다. 자동차가 달리는 아름다운 영상을 만들 수는 있지만, 그 자동차가 갑자기 포트홀을 피하기 위해 방향을 틀었을 때 어떤 일이 일어날지를 신뢰성 있게 예측하지는 못합니다. 이러한 예측력이 없다면, 인공지능은 복잡하고 변화하는 환경에서 결정을 내릴 수 있는 능동적인 참여자가 아닌, 수동적인 관찰자로 남게 됩니다.
모하메드 빈 자이드 인공지능 대학교(Mohamed bin Zayed University of Artificial Intelligence)의 연구진은 이 간극을 메우기 위해 설계된 PAN이라는 새로운 시스템을 선보였습니다. 단순히 처음부터 영상을 생성하는 대신, PAN은 특정 지시에 따라 세상이 어떻게 진화하는지를 학습하는 시뮬레이터 역할을 합니다. 연구진은 '생성적 잠재 예측(Generative Latent Prediction)'이라는 토대 위에 이 시스템을 구축했는데, 이는 컴퓨터가 미래를 예측하는 동안 세상에 대한 일관된 내부 기억을 유지하도록 강제하는 방법입니다. 미래의 모든 픽셀을 한꺼번에 추측하려고 시도하는 대신(이는 종종 혼란과 오류를 초래합니다), PAN은 이 과업을 세분화합니다. 먼저 현재의 장면과 취해지는 행동에 대한 압축적이고 추상적인 요약을 만듭니다. 그다음 강력한 언어 기반 추론 엔진을 사용하여 그 요약이 어떻게 변할지를 예측합니다. 마지막으로, 그 새로운 요약을 다시 영상으로 변환합니다. 이 3단계 프로세스를 통해 시스템은 사물, 사람, 물리학을 장기간 추적할 수 있으며, 시뮬레이션된 시간이 여러 초가 흐른 뒤에도 나무는 나무로, 자동차는 자동차로 유지되도록 보장합니다.
연구진은 800만 개의 비디오 클립과 그 안에서 일어나는 동작에 대한 상세한 설명을 쌍으로 묶은 방대한 데이터셋을 통해 PAN을 학습시켰습니다. 이 비디오들은 일상적인 인간의 활동부터 사람과 주변 환경 사이의 복잡한 상호작용까지 모두 다룹니다. "눈 내리는 숲을 운전하라" 또는 "파란색 컵을 집어 들어라"와 같은 언어 명령에 기반하여 비디오의 다음 순간을 예측하도록 가르침으로써, 연구진은 PAN이 물리적 인과관계의 규칙을 학습할 수 있게 했습니다. 테스트 결과, 이 시스템은 긴 시퀀스 동안 일관성을 유지하는 놀라운 능력을 보여주었습니다. 한 실험 세트에서 연구진은 로봇이 쟁반 사이로 물체를 옮기는 것과 같은 일련의 동작을 시뮬레이션하도록 요청했습니다. 다른 시스템들이 몇 단계 후에 물체를 놓치거나 불가능한 물리학을 환각처럼 만들어내는 반면, PAN은 10단계 이상의 과정 동안 일관되고 논리적인 결과를 계속해서 생성했습니다. PAN은 로봇이 노란색 캔을 잡고 새로운 쟁반으로 옮기면, 다음 프레임에서 캔이 그 새로운 쟁반에 나타나고 이전 쟁반은 비어 있게 될 것임을 성공적으로 예측했습니다.
연구진은 PAN이 단순히 예쁜 그림을 만드는 것이 아니라 진정으로 현실을 시뮬레이션하고 있는지 확인하기 위해, '월드 리즈닝 아레나(World Reasoning Arena)'라고 불리는 엄격한 벤치마크를 통해 검증했습니다. 이 테스트는 세 가지 특정 기술을 측정했습니다: 시스템이 동작의 즉각적인 결과를 얼마나 정확하게 시뮬레이션하는지, 장기간 동안 얼마나 일관된 세계를 유지하는지, 그리고 그 예측이 별도의 컴퓨터 프로그램이 더 나은 결정을 내리는 데 도움이 되는지 여부입니다. 결과에 따르면, PAN은 다른 오픈 소스 모델들을 능가했으며 선도적인 상용 시스템들과도 밀접하게 경쟁했습니다. 테이블 위의 물건을 분류하는 것과 같이 목표를 달いて내기 위한 일련의 움직임을 계획해야 하는 작업에서, PAN을 통합했을 때 계획 에이전트의 성공률이 표준 모델을 사용할 때보다 20% 이상 향상되었습니다. 이는 시스템의 예측이 단순히 시각적으로 그럴듯할 뿐만 아니라 인과적으로도 정확하며, 의사 결정 에이전트가 신뢰할 수 있는 믿을만한 미래의 지도를 제공한다는 것을 시사합니다.
또한 이 연구는 이러한 시스템에서 핵심 요소가 누락되었을 때 어떤 일이 발생하는지도 강조했습니다. 연구진은 언어 기반 추론 엔진이나 비디오 세그먼트 간의 전환을 부드럽게 만드는 특수 방법을 제거한 테스트를 수행했습니다. 추론 엔진이 없으면 시스템은 사람이나 로봇과 같은 에이전트가 포함된 복잡한 지시를 이해하는 데 어려움을 겪었고, 비디오 전환이 끊기는 현상이 발생했습니다. 부드러운 전환 메커니즘이 없으면 시뮬레이션이 길어짐에 따라 영상의 품질이 급격히 저하되어 사물이 왜곡되거나 사라졌습니다. 이러한 발견은 추론하는 뇌와 세심한 단계별 생성 과정의 결합이 장기적인 안정성에 필수적임을 확인시켜 주었습니다. 이 시스템은 단 하나의 기술에 의존하는 것이 아니라, 예측이 실제 관찰 가능한 변화와 일치해야 한다는 요구 사항에 대해 지속적으로 점검되는 폐쇄 루프(closed loop)에 의존합니다.
성공에도 불구하고, 연구진은 시스템의 현재 한계에 대해 명확히 밝히고 있습니다. PAN은 "왼쪽으로 회전하라" 또는 "문을 열어라"와 같이 자연어로 설명될 때 가장 잘 작동합니다. 아직 정밀한 로봇 작업을 위해 필요한 미세하고 연속적인 근육 명령을 처리하도록 설계되지 않았습니다. 또한, 시스템이 이전 시도들보다 훨씬 안정적이긴 하지만, 매우 긴 시간 동안은 여전히 편차가 발생하여 때때로 작은 세부 사항을 놓치거나 존재하지 않는 물체를 만들어내기도 합니다. 저자들은 이 시스템이 시각적 사실성을 물리적 완벽함보다 우선시하는 기반 비디오 생성 모델의 시각적 습관을 물려받았다고 언급했습니다. 이는 시뮬레이션이 일반적으로 신뢰할 만하지만, 아직 물리학을 완벽하게 구현하는 단계는 아니라는 것을 의미합니다.
이 연구는 기계에게 미래를 생각하는 법을 가르치는 데 있어 중요한 진전을 의미합니다. 언어를 통한 추론 능력과 시각적 시퀀스 생성 능력을 결가함으로써, PAN은 인공지능이 실제 세계의 결과에 따른 위험 없이 가능성을 탐색할 수 있는 새로운 방법을 제시합니다. 이는 에이전트가 원하는 결과를 얻기 위해 다양한 행동 경로를 테스트하는 '사고 실험'을 수행할 수 있게 해줍니다. 연구진은 코드와 데이터를 공개하여 다른 이들이 이 토대 위에 구축할 수 있도록 초대할 계획입니다. 이 분야가 발전함에 따라, 궁극적인 목표는 단순히 세상을 보는 것을 넘어 세상이 어떻게 작동하는지를 이해하여, 인간이 매일 사용하는 것과 같은 선견지명을 가지고 항해하고, 계획하고, 행동할 수 있는 지능형 기계를 만드는 것입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.