← 최신 논문
💻 computer science

ActSWM: Action-Sensitive World Models for Long-Horizon Planning in Open-World Games

이 논문은 서로 다른 행동 시퀀스에 따라 장기 롤아웃(long-horizon rollouts)이 구별 가능한 상태로 유지되도록 전이 분리 원칙(transition-separation principle)을 강제함으로써 '컨텍스트 붕괴(Context Collapse)' 실패 모드를 해결하고, 이를 통해 오픈 월드 게임에서의 계획 성능을 향상시키며 오프라인 비디오로부터의 행동 복구를 가능하게 하는 행동 민감형 잠재 세계 모델인 ActSWM을 소개한다.

원저자: Zhenfeng Gan, ZiTong Zeng, Jiajun Cheng, Yeke Song, Yongyi Tang, Xueqian Wang

게시일 2026-07-30
📖 5 분 읽기🧠 심층 분석

원저자: Zhenfeng Gan, ZiTong Zeng, Jiajun Cheng, Yeke Song, Yongyi Tang, Xueqian Wang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. ✨ 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 로봇에게 비디오 게임을 하는 법을 가르치려 한다고 상상해 보세요. 하지만 로봇이 모든 움직임마다 컨트롤러를 직접 만지게 할 수는 없습니다. 대신 당신은 로봇이 머릿속에 게임의 '꿈'을 구축하게 하고 싶습니다. 로봇은 화면을 보고, 점프했을 때 어떤 일이 일어날지, 달렸을 때 어떤 일이 일어날지를 상상한 다음, 벽에 부딪히지 않고 가장 좋은 경로를 선택합니다. 이것이 바로 인공지현의 한 분야인 **월드 모델(World Models)**의 세계입니다. 여기서 기계는 압축된 수학적 '꿈의 공간' 안에서 미래를 시뮬레이션함으로써 미래를 예측하는 법을 배웁니다.

이것이 제대로 작동하려면, 로봇의 꿈은 자신의 선택에 민감하게 반응해야 합니다. 만약 로봇이 점프를 상상한다면, 꿈속에서도 위로 날아올라야 합니다. 만약 달리는 것을 상상한다면, 꿈속에서도 앞으로 속도를 내야 합니다. 큰 문제는 과학자들이 직면해 온 난제인데, 로봇의 꿈이 종종 '게으르게' 변한다는 것입니다. 로봇은 완벽해 보이는 미래를 예측할 수도 있지만, 정작 자신이 무엇을 하기로 '결정'했는지에 따라 결과가 바뀌지 않을 수 있습니다. 이는 마치 줄거리가 이미 정해진 영화를 보는 것과 같습니다. 캐릭터가 아무리 왼쪽으로 돌려고 해도 카메라는 그냥 오른쪽을 비추는 식이죠. 이 논문은 바로 그 결함을 다룹니다. 즉, 로봇의 행동에 따라 미래가 실제로 반응하도록 로봇에게 꿈을 꾸는 법을 가르칠 수 있는가? 라는 질문을 던집니다.


"게으른 꿈" 문제

로봇들이 '게으른 꿈'을 꾸는 것을 막기 위해 설계된 새로운 종류의 AI 뇌, ActSWM을 만나보세요. 마인크래프트와 같은 오픈 월드 게임의 세계에서 에이전트(로봇)들은 먼 미래를 계획해야 합니다. 그들은 "지금 이 돌을 캐면, 나중에 집을 지을 수 있을까?"와 같은 문제를 해결해야 합니다. 이를 위해 그들은 **잠재 세계 모델(Latent World Model)**을 사용합니다. 이 모델을 배경에서 실행되는 초고속 시뮬레이터라고 생각하세요. 게임 화면의 모든 픽셀을 처리하는 대신, 이 모델은 세상을 단순화된 '잠재(latent)' 코드, 즉 정신적인 약어로 압축합니다.

목표는 에이전트가 최선의 움직임을 찾기 위해 순식간에 수천 번의 정신적 시뮬레이션을 실행하는 것입니다. 하지만 여기에는 함정이 있습니다. 기존의 많은 시뮬레이터는 저자들이 **컨텍스트 붕괴(Context Collapse)**라고 부르는 버그를 겪습니다.

당신이 친구에게 이야기를 하고 있다고 상상해 보세요. 만약 당신이 "나는 공원에 갔어"라고 말하면, 친구는 화창한 날을 상상할 것입니다. 만약 당신이 "나는 공원에 갔는데 비가 왔어"라고 말하면, 친구는 비 오는 날을 상상할 것입니다. 이것은 좋습니다. 하지만 컨텍스트 붕패는 당신이 무슨 말을 하든 상관없이 항상 똑같이 화창한 날만을 상상하는 친구와 같습니다. 그들은 '공원'이라는 일반적인 개념에 너무 집중한 나머지, 비가 온다는 당신의 구체적인 디테일에는 귀를 기울이지 않습니다. AI의 세계에서 이는 시뮬레이터가 그럴듯한 미래(화창한 공원)를 예측하지만, 로봇이 취하는 구체적인 행동에 따라 그 예측을 바꾸지 못한다는 것을 의미합니다. 로봇은 "내가 점프를 하든 달리기를 하든 미래는 똑같네"라고 생각하게 되며, 이는 계획을 불가능하게 만듭니다.

해결책: 얼어붙은 "행동 탐정"

저자들은 이를 해결하기 위해 ActSWM(Action-Sensitive World Model)을 제안합니다. 그들의 핵심 비결은 **전이 분리(Transition Separation)**라고 부르는 원칙입니다. 그들은 로봇이 서로 다른 두 경로를 택한다면, 그 결과로 나타나는 꿈은 반드시 달라져야 한다는 것을 보장하고자 합니다.

이를 강제하기 위해 그들은 영리한 트릭인 **고정된 행동 판독기(Fixed Action Readout)**를 도입합니다. 어떤 장면을 보고 방금 어떤 행동이 일어났는지 추측하는 것이 임무인 탐정이 있다고 상상해 보세요. 보통 이 탐정이 장면과 함께 학습한다면, 탐정은 속임수를 쓸 수 있습니다. 만약 두 가지 서로 다른 행동에 대해 장면이 너무 비슷해 보인다면, 탐정은 장면을 다르게 만들려고 노력하는 대신, 단순히 '점프'의 정의를 그 장면에 맞춰 바꿔버릴 수도 있습니다.

ActSWM은 **탐정을 얼려버림(freezing the detective)**으로써 이 속임수를 막습니다. 그들은 AI에게 고정되고 변하지 않는 규칙 책을 가진 탐정을 부여합니다. 그러면 AI는 이 고정된 탐정이 이들을 정확히 구별해 낼 수 있도록 자신의 '꿈'(잠재 전이)을 매우 뚜렷하게 만들어야만 합니다. 만약 AI가 '점프' 꿈과 '달리기' 꿈을 똑같이 만들려고 시도하면, 고정된 탐정이 행동을 맞추지 못하게 되고, AI는 벌점을 받게 됩니다. 이는 AI가 모든 구체적인 버튼 입력에 대해 미래 예측을 날카롭고 민감하게 유지하도록 강제합니다.

연구 결과

연구팀은 이 새로운 뇌를 혼란스러운 블록 세계인 마인크래프트와 세 가지 다른 게임(카운터 스트라이크 2, GTA V, 에이펙스 레전드)에서 테스트했습니다.

1. 붕괴 방지:
ActSWM을 기존 모델들과 비교했을 때 차이는 극명했습니다. AI에게 실제 행동이 포함된 미래와 로봇이 아무것도 하지 않은 미래(모두 0인 행동)를 상상하도록 요청하는 테스트에서, 기존 모델들은 거의 동일한 미래를 생성했습니다. 그러나 새로운 ActSWM은 거대한 격차를 만들어냈습니다. 저자들은 이 "행동 격차(action gap)"를 측정했으며, ActSWM이 가장 강력했던 이전 베이스라인보다 약 380배 더 큰 분리도를 생성한다는 것을 발견했습니다. 로봇의 꿈이 마침내 컨트롤러의 명령에 귀를 기울이게 된 것입니다.

2. 더 나은 계획:
꿈이 더 정확해졌기 때문에 로봇은 게임을 더 잘 플레이하게 되었습니다. 마인크래프트에서 횃불 놓기, 돌 블록 캐기, 기둥 쌓기와 같은 과업을 수행하도록 요청했을 때, ActSWM은 성공률을 크게 향 향상시켰습니다. 예를 들어, 돌 블록을 캐는 성공률은 베이스라인 대비 90.0%, 기둥을 쌓는 성공률은 54.5% 개선되었습니다. 이제 로봇은 집으로 이어지는 길과 절벽으로 이어지는 길을 확실히 구분할 수 있게 되었습니다.

3. 비디오로부터 마음 읽기:
마지막으로, AI가 인간이 플레이하는 영상을 보고 어떤 버튼을 누르고 있는지 맞출 수 있는지 테스트했습니다. 이는 영화를 보고 배우의 움직임을 추측하는 것과 같습니다. 교차 엔트로피 최소화(Cross-Entropy Minimization, CEM)라는 방법을 사용하여, ActSWM은 오프라인 영상으로부터 올바른 행동을 무작위 추측보다 훨씬 더 잘 복구해 냈습니다. GTA V에서 ActSWM은 무작위 탐색에 비해 올바른 행동을 찾는 "비용"을 252.38만큼 개선했으며, 활성화된 키 입력(플레이어가 실제로 버튼을 누를 때)을 최대 0.711의 정확도 향상와 함께 정확히 식별했습니다.

요약

이 논문은 AI 에이전트가 복잡하고 개방적인 게임을 진정으로 마스터하기 위해서는 단순히 미래를 정확하게 예측하는 것 이상의 것이 필요하다고 시사합니다. 즉, 행동에 민감한 예측이 필요합니다. 만약 당신의 마음을 바꿨을 때 미래가 변하지 않는다면, 당신은 계획을 세울 수 없습니다. 단순한 "행동 탐정"을 얼려두고 AI가 자신의 미래 시나리오를 뚜렷하게 유지하도록 강제함으로써, ActSWM은 월드 모델이 단순히 백일몽을 꾸는 것이 아니라 실제로 플레이어의 말에 귀를 기울일 수 있음을 증명했습니다. 이것은 단순한 미세 조정이 아니라, 기계에게 자신의 선택에 따른 결과를 상상하도록 가르치는 방식의 근본적인 변화입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →