← 최신 논문
💻 computer science

SCOPE: Simulating Cross-game Operations in Playable Environments for FPS World Models

본 논문은 세그멘테이션 레이블 없이 공간적으로 선택적인 행동 반응을 달성하기 위해 트랜스포머 블록에 조건부 모듈을 통합하여 1 인칭 슈팅 게임의 세계 모델을 개선하는 새로운 프레임워크인 SCOPE 와 함께, 여러 게임 타이틀 간에 강력한 제로샷 일반화를 가능하게 하는 CrossFPS 데이터셋을 소개합니다.

원저자: Zizhao Tong, Hongfeng Lai, Zeqing Wang, Zhaohu Xing, Kexu Cheng, Haoran Xu, Zhao Pu, Shangwen Zhu, Ruili Feng, Jian Zhao, Yan Zhang, Hao Tang, Yeying Jin, Ling Shao

게시일 2026-05-25
📖 3 분 읽기☕ 가벼운 읽기

원저자: Zizhao Tong, Hongfeng Lai, Zeqing Wang, Zhaohu Xing, Kexu Cheng, Haoran Xu, Zhao Pu, Shangwen Zhu, Ruili Feng, Jian Zhao, Yan Zhang, Hao Tang, Yeying Jin, Ling Shao

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

1 인칭 슈팅 (FPS) 비디오 게임인 콜 오브 듀티할로를 보고 있다고 상상해 보세요. 이러한 게임에서 당신의 캐릭터는 끊임없이 움직이고, 주변을 살피며, 총을 쏩니다.

이제 당신의 컨트롤러 입력을 바탕으로 게임에서 다음에 정확히 무슨 일이 일어날지 컴퓨터에게 예측하도록 가르쳐 보려고 상상해 보세요. 이것이 바로 해당 논문이"월드 모델 (World Model)"이라고 부르는 것입니다.

문제:"스프레이 앤 프레이 (Spray and Pray)"실수

컴퓨터에게 이 기술을 가르치기 위한 이전 시도들은 캔버스에 꽃 한 송이를 그려달라고 요청했을 때, 실수로 전체 그림에 페인트를 튀겨버리는 서툰 화가와 같았습니다.

기술적인 용어로 말하자면, 구식 모델들은 화면의 모든 부분을 동일하게 취급했습니다. "발사"버튼을 누르면 모델은 하늘, 먼 산, 그리고 당신 뒤의 벽까지 화면 전체를 업데이트하려고 시도했습니다. 이로 인해 비디오가 끊기거나, 왜곡되거나, 멈추는 현상이 발생했습니다. 왜냐하면 컴퓨터는 총을 쏘았을 때 총과 즉각적인 표적 영역만 변해야 하고 나머지 세계는 안정적으로 유지되어야 한다는 점을 이해하지 못했기 때문입니다.

해결책:SCOPE(스마트 스포트라이트)

저자들은 SCOPE(Playable Environments 에서의 교차 게임 작업 시뮬레이션, Simulating Cross-game Operations in Playable Environments) 라는 새로운 시스템을 개발했습니다.

SCOPE 를 정확히 어디에 빛을 비춰야 할지 아는 스마트 스포트라이트라고 생각하세요.

  • 스코프 (In-Scope): 당신이 총을 쏘거나, 장전하거나, 점프할 때, SCOPE 은 오직 무기 바로 앞의 영역과 무기 자체에만 스포트라이트를 비춥니다. "알겠다, 폭발이 일어나는 곳은 여기야; 이 부분만 애니메이션으로 만들어 보자"라고 인식하는 것입니다.
  • 나머지 (Out-of-Scope): 하늘, 바닥, 먼 건물 등 그 외의 모든 것은 그대로 두거나, 안정적인 방을 가로지르는 카메라 팬처럼 부드럽게 움직입니다.

마법 같은 점은 SCOPE 에게 총의 위치를 알려주는 지도를 사람이 그려줄 필요가 없다는 것입니다. 시각적 단서를 관찰함으로써 스스로 이를 학습합니다. "아, 여기에 총이 있구나. 그렇다면 플레이어가'발사'를 누르면 픽셀만 반응해야겠구나"라고 깨닫는 것입니다.

학습 데이터:"CrossFPS"데이터셋

이 시스템을 가르치기 위해 연구자들은 하나의 게임만 사용할 수 없었습니다. 컴퓨터에게 콜 오브 듀티의 특정 규칙이 아니라, 총을 쏘는 보편적인 규칙을 가르치기 위해 다양한 게임의 거대한 라이브러리가 필요했습니다.

그들은 7 개의 다른 게임에서 가져온 69,000 개의 비디오 클립으로 구성된 CrossFPS데이터셋을 구축했습니다.

  • 그들은 (항상 같은 적을 쏘는 것과 같은) "게임적인"전략들을 제거하여 컴퓨터가 특정 레벨을 외우는 것이 아니라 게임의 물리 법칙(예:"스틱을 왼쪽으로 움직이면 세계가 오른쪽으로 움직인다") 을 학습하도록 했습니다.
  • 비디오를 정밀한 컨트롤러 움직임 (10 개의 다른 버튼과 스틱) 과 동기화하여 컴퓨터가 인과 관계를 완벽하게 파악할 수 있도록 했습니다.

작동 원리:"셰프"비유

표준 요리를 잘하는 수석 셰프 (주요 AI 모델) 가 있다고 상상해 보세요.

  • 구식 방법: 부셰프 (작업 입력) 가"소금 넣어!"라고 외치면, 수석 셰프는 스토브 위의 모든 냄비에 소금을 부어 국, 샐러드, 스테이크를 망쳐버립니다.
  • SCOPE 방법: 부셰프가"소금 넣어!"라고 외치지만, 이제 주방에는 스마트 배달 시스템이 갖춰져 있습니다. 시스템은 국이 들어있는 냄비를 식별하고 소금을 그 냄비에만 배달합니다. 샐러드와 스테이크는 손대지 않은 채로 남습니다.

논문에서 이"스마트 배달 시스템"은 AI 의 뇌에 삽입된 특수 모듈로, 모든 픽셀을 개별적으로 처리하여 다음과 같이 결정합니다:"내가 행동 영역의 일부인가? 그렇다면 반응해. 아니면? 차분하게 있어."

결과

SCOPE 을 테스트했을 때:

  1. 혼란을 처리함: 비디오가 흐릿한 엉망진창으로 변하지 않으면서도 빠른 사격, 점프, 회전 등을 동시에 처리할 수 있었습니다.
  2. 일반화 능력: 한 번도 본 적 없는 게임 (새로운 게임 세계의 AI 생성 이미지를 사용) 을 보여주었을 때도 여전히 올바르게 반응하는 방법을 알았습니다. 재학습이 필요하지 않았으며, 7 개 게임에서 배운 규칙을 새로운 게임에 적용했을 뿐입니다.
  3. 정밀함: 배경은 안정적으로 유지된 채로 행동은 정확히 발생해야 할 곳에서 발생했습니다.

요약

이 논문은 AI 가 비디오 게임을 이해하도록 하는 새로운 방식을 제시합니다. 전체 화면을 한 번에 모두 변하는 하나의 거대한 덩어리로 취급하는 대신, SCOPE 은 AI 가 정밀 외과 의사가 되어 플레이어의 행동이 일어나는 곳에만 작고 정확한 변화를 가하도록 가르칩니다. 반면 나머지 세계는 안정적으로 유지됩니다. 이를 통해 매번 처음부터 가르칠 필요 없이 다양한 유형의 게임에서 작동하는 사실적이고 상호작용적인 게임 시뮬레이션이 가능해집니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →