WorldMind: Decoupled Game World Model for State-Aware NPC Behavior
이 논문은 상태 인지형 NPC 행동을 가능하게 하기 위해 게임 세계 모델링을 이해, 결정, 제어 및 생성 계층으로 분리하는 디커플링 프레임워크인 WorldMind을 소개하며, 이는 BOSS-140K 데이터셋에 의해 지원되고 기존 베이스라인보다 우수한 전술적 일관성을 입증한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
비디오 게임의 디지털 풍경 속에서, 세계는 종종 단 한 명의 플레이어를 위한 여정의 무대가 됩니다. 그러나 가장 기억에 남는 순간들은 흔ertly 플레이어 자신의 행동이 아니라, 그들이 여정 중에 만나는 캐릭터들의 반응으로부터 발생합니다. 이러한 비플레이어 캐릭터, 즉 NPC는 게임 세계의 거주자로서 환경이 살아있는 것처럼 느껴지도록 하는 임무를 맡습니다. 수십 년 동안 게임 디자이너들은 이러한 캐릭터가 움직이고 행동하도록 경직된 스크립트에 의존해 왔으며, 이는 예측 가능하고 종종 반복적인 행동을 만들어냈습니다. 최근에는 인공지능이 게임플레이의 전체 비디오 시퀀스를 생성할 수 있는 모델을 사용하여 새로운 돌파구를 제시하기 시작했습니다. 하지만 중대한 장애물이 남아 있습니다. 이러한 새로운 AI 시스템에서 캐릭터의 행동은 종 often 비디오가 생성되는 과정의 부산물일 뿐이거나, 시스템 외부의 지시를 따르도록 강제된다는 점입니다. 이는 캐릭터가 주변의 변화하는 상황을 진정으로 '보고' 그 순간에 어떻게 반응할지 결정할 수 없음을 의미합니다. 그들에게는 화면에서 일어나는 일과 다음에 무엇을 해야 할지를 연결하는 마음이 결여되어 있습니다.
Tencent와 싱가포르 국립대학교의 연구진은 WorldMind라고 불리는 새로운 프레임워크를 도입함으로써 이 간극을 해결했습니다. 그들의 작업은 게임 세계를 모델링하는 방식의 변화를 나타내며, 캐릭터의 행동이 비디오 생성 과정 내부에 숨겨져 있는 시스템에서 벗어나고 있습니다. 대신, 그들은 게임 상태를 이해하는 행위와 비디오를 생성하는 행위를 명시적으로 분리하는 시스템을 구축했습니다. 컴퓨터가 먼저 플레이어와 몬스터 사이의 거리를 측정하고, 몬스터가 사용할 수 있는 능력이 무엇인지 확인한 다음, 다음 프레임을 그리기 전에 의식적으로 특정 동작을 결정하는 게임을 상상해 보십시오. 이것이 WorldMind의 핵심입니다. 연구진은 과정을 장면 이해, 반응에 대한 추론, 그리고 시각적 결과 생성이라는 별도의 단계로 나눔으로써, 생성형 모델에서 이전에 볼 수 없었던 수준의 전술적 인식을 갖춘 비플레이어 캐릭터를 만들 수 있음을 입증했습니다.
이 새로운 접근 방식의 기초는 지각과 행동의 순환을 모방하는 4단계 구조에 있습니다. 첫 번째 레이어는 시스템의 눈 역할을 하며, 지금까지 생성된 비디오 프레임을 받아 현재 상황에 대한 압축된 디지털 요약을 재구성합니다. 이 요약에는 플레이어와 보스 사이의 거리, 서로 마주 보는 각도, 보스가 최근에 사용한 기술의 이력과 같은 구체적인 세부 정보가 포함됩니다. 이는 매우 중요한 단계인데, 이전 모델에서는 AI가 비디오를 그리려는 동시에 이러한 세부 정보를 추측해야 했기 때문에 종종 혼란스럽거나 반응이 없는 행동으로 이어졌기 때문입니다. 이 명확하고 분리된 상태 요약을 만듦으로써, 시스템은 의사 결정 과정이 확고한 사실 기반을 가질 수 있도록 보장합니다.
이 압축된 상태가 설정되면, 이는 운영의 두뇌 역할을 하는 두 번째 레이어로 전달됩니다. 여기서 대규모 언어 모델(인간의 언어를 이해하고 생성하도록 훈련된 유형의 인공지능)은 게임 상태의 요약본과 보스의 사용 가능한 기술 목록 및 그 설명을 읽습니다. 그런 다음 모델은 상황을 추론하여 다음 움직임을 계획합니다. 모델은 "플레이어가 매우 가까우므로 거리를 좁히는 공격이 필요하다"라거나 "플레이어가 멀리 있으므로 원거리 기술을 사용해야 한다"와 같은 질문을 스스로에게 던집니다. 이 레이어는 단순히 추측하는 것이 아니라, 게임의 메커니즘과 장면의 현재 현실에 기반하여 전술적 계획을 수립합니다. 연구진은 이 추론이 단순히 훈련 데이터의 패턴을 모방하는 것이 아니라 실제 게임 규칙에 근거하도록 주의를 기울였습니다. 그들은 기술의 설명이나 게임의 상태를 변경했을 때 모델이 그에 따라 결정을 변경하는 것을 발견했으며, 이는 모델이 단순히 결과를 암기하는 것이 아니라 실제로 메커니즘을 이해하고 있음을 증명했습니다.
세 번째 레이어는 번역기 역할을 하여, 두뇌로부터 나온 고차원 계획을 비디오 생성기가 이해할 수 있는 일련의 지침으로 변환합니다. 이는 선택된 행동과 플레이어의 움직임을 시간 순서에 따른 자연어 프롬프트 세트로 바꿉니다. 예를 들어, "플레이어가 공격을 수행하는 동안 보스가 점프 슬램을 수행함"과 같은 문구를 생성할 수 있습니다. 이는 시각적 생성 레이어인 네 번째이자 마지막 구성 요소가 정밀하게 시간적으로 정렬된 지침을 받도록 보장합니다. 그러면 비디오 생성기는 이러한 프롬프트를 바탕으로 다음 게임플레이 비디오 세그먼트를 생성합니다. 결정적으로, 생성된 프레임은 끝이 아닙니다. 이 프레임들은 다시 첫 번째 레이어로 피드백되어 순환을 시작합니다. 이를 통해 세계가 끊임없이 관찰되고, 분석되고, 업데이트되는 폐쇄 루프가 생성되어, 비플레이어 캐릭터가 자신의 이전 행동의 결과에 실시간으로 반응할 수 있게 합니다.
이 시스템을 훈련하고 테스트하기 위해 연구진은 상당한 데이터 과제에 직면했습니다. 표준 비디오 게임 녹화물은 보통 플레이어가 하는 행동과 화면에 보이는 것만을 포착하며, AI가 의사 결정을 내리는 방법을 배우는 데 필요한 게임의 내부 상태에 대한 데이터가 부족합니다. 이를 해결하기 위해 그들은 BOSS-140K라는 거대한 새로운 데이터셋을 수집하는 자동화된 파이프라인을 구축했습니다. 이 데이터셋은 3개의 서로 다른 게임에서 14종의 다양한 보스와의 전투를 특징으로 하는, 총 200시간 이상의 14만 개 이상의 게임플레이 클립을 포함하고 있습니다. 이전 데이터셋과 달리, 이 데이터셋은 비디오 푸티지와 함께 거리, 기술 쿨다운, 플레이어 입력을 포함한 상세한 프레임 단위의 내부 게임 상태 주석을 쌍으로 제공합니다. 그들은 특수 에이전트를 사용하여 게임을 자동으로 플레이하게 함으로써, 인간 운영자가 모든 움직임을 수동으로 제어할 필요 없이 매우 다양한 상호작용이 기록되도록 했습니다. 이 풍부하고 구조화된 데이터는 시스템이 시각적 세계를 게임의 근저에 깔린 규칙과 연결하는 방법을 가르치는 데 필수적이었습니다.
연구진이 WorldMind를 테스트했을 때, 결과는 비플레이어 캐릭터의 행동 방식에서 뚜렷한 개선을 보여주었습니다. 캐릭터가 비디오 내에서 암묵적으로 행동하거나 외부 명령을 따르는 기존 방식들과의 대결 비교에서, 새로운 시스템이 약 70%의 사례에서 평가자들의 선호도를 얻었습니다. WorldMind가 생성한 캐릭터들은 전술적으로 더 적절할 뿐만 아니라 더 일관적이었으며, 전투 내내 일관된 전략을 유지했습니다. 그들은 플레이어의 움직임에 적응하여 필요할 때 거리를 좁히거나 원거리 공격을 사용하기 위해 물러나는 등의 행동을 할 수 있었으며, 이 모든 과정에서 비디오 생성은 초당 약 20프레임의 속도를 유지했습니다. 이 속도는 실시간 상호작용에 충분하며, 이는 시스템이 인간이 플레이하는 동안 매끄럽게 실행될 수 있음을 의미합니다. 또한 연구는 시스템이 훈련 중에 보지 못한 게임에 대해서도 올바른 내부 상태 정보가 주어진다면 그 이해를 일반화할 수 있음을 확인했으며, 이는 이 접근 방식이 연구에 사용된 특정 게임을 넘어 적용될 수 있을 만큼 견고함을 시사합니다.
이 논문에 제시된 작업은 인공지능이 단순히 시각적 생성기가 아니라 게임 세계의 논리적 참여자가 되는 인터랙티브 엔터테인먼트의 새로운 경로를 제시합니다. 상태 이해를 비디오 생성으로부터 분리함으로써, 연구진은 비플레이어 캐릭터가 일종의 상황 인식을 가질 수 있는 프레임워크를 만들었습니다. 그들은 더 이상 미리 작성된 스크립트나 단일 생성 프로세스의 제한에 묶여 있지 않습니다. 대신, 그들은 세계를 관찰하고, 옵션을 추론하며, 의도를 가지고 행동할 수 있습니다. 현재 시스템은 보스 전투와 특정 게임 장르에 집중되어 있지만, 상태 이해와 행동 생성을 분리하는 근본적인 원칙은 미래에 더욱 역동적이고 반응적인 디지털 세계를 만들기 위한 유망한 방향을 제시합니다. 연구진은 AI에게 게임 상태에 대한 명확한 시야와 그것에 대해 생각할 방법을 제공할 때, 그 AI가 만드는 캐릭터가 진정으로 살아 움직일 수 있음을 보여주었습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.