← 최신 논문
💻 computer science

Game2World Engine: Unlocking In-the-Wild Gameplay Videos for World Model Training

이 논문은 UI 자산 추출을 위한 G2WEngine과 마스크 없는 HUD 제거를 위한 GameCleaner 모델을 특징으로 하는 포괄적인 프레임워크인 Game2World를 소개하며, 이는 가공되지 않은 게임플레이 영상을 월드 모델 성능을 크게 향상시키는 고품질의 UI가 없는 훈련 데이터로 변환합니다.

원저자: Wenxuan Shen, Dongna Jin, Dongping Chen

게시일 2026-08-26
📖 4 분 읽기☕ 가벼운 읽기

원저자: Wenxuan Shen, Dongna Jin, Dongping Chen

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

컴퓨터에게 물리적 세계가 어떻게 움직이고 변화하는지를 이해하도록 가르치는 과정을 상상해 보십시오. 이를 위해 연구자들은 사물이 어떻게 상호작용하는지, 빛이 어떻게 변화하는지, 그리고 장면이 시간이 흐름에 따라 어떻게 진화하는지를 보여주는 방대한 양의 영상이 필요합니다. 수년 동안 과학자들은 비디오 게임을 완벽한 데이터 소스로 주목해 왔습니다. 게임은 모든 행동에 명확한 결과가 따르는 무한하고 다양한 환경을 제공하며, 현실 세계에서는 포착하기 어려운 풍부한 시각적 경험의 라이브러리를 제공합니다. 그러나 이러한 게임의 원본 영상을 사용하는 데에는 중대한 문제가 있습니다. 사람이 게임을 플레이할 때, 화면에는 체력 바, 지도, 탄약 수량, 채팅창와 같은 디지털 오버레이가 가득 차 있습니다. 이러한 요소들은 게임 세계의 일부가 아니라 플레이어의 편의를 위해 추가된 스크린 공간의 장식물입니다. 만약 컴퓨터가 이러한 오버레이가 가득한 영상으로부터 학습한다면, 게임의 규칙과 인터페이스의 규칙을 혼동하게 됩니다.

연구진은 이 문제를 해결하기 위해 디지털 불순물을 제거하여 그 아래에 숨겨진 순수한 게임 세계를 드러내는 새로운 시스템을 개발했습니다. 그들은 디지털 오버레이를 자동으로 식별하고, 영상에서 이를 제거하며, 심지어 누락된 배경을 채워 넣어 장면이 완전하고 자연스럽게 보이도록 만드는 프레임워크를 구축했습니다. 이를 통해 그들은 수백만 시간의 지저분한 게임플레이 영상을 깨끗하고 고품질인 학습 데이터로 변환했습니다. 이들의 연구는 컴퓨터가 정제된 영상을 통해 학습할 때, 움직임과 시각적 품질을 예측하는 능력이 유의미한 수준으로 향상되어 세계가 작동하는 방식을 훨씬 더 잘 이해하게 된다는 것을 보여줍니다. 이러한 돌파구는 인터넷에 존재하는 방대한 양의 미개척 게임플레이 영상이 더 지능적이고 유능한 인공지능 시스템을 구축하는 데 마침내 사용될 수 있음을 시사합니다.

이 프로젝트의 핵심은 G2WEngine이라는 새로운 데이터 엔진입니다. 연구진은 컴퓨터에게 세상에 대해 가르치기 위해서는 먼저 무엇이 세상이 아닌지를 먼저 가르쳐야 한다는 점을 깨달았습니다. 그들은 나침반과 체력 바부터 채팅 로그와 팝업 알림에 이르기까지 모든 것을 특정 범주로 분류하는 상세한 인터페이스 분류 체계를 만드는 것으로 시작했습니다. 이 시스템을 사용하여 엔진은 수백 개의 서로 다른 게임에서 추출한 수천 개의 실제 게임플레이 영상을 스캔합니다. 엔진은 체력 바나 지도와 같은 실제 디지털 자산을 주의 깊게 추출하여 재사용 가능한 투명한 조각들로 변환합니다. 이를 통해 시스템은 이러한 인터페이스가 정확히 어떻게 생겼으며 화면의 어디에 위치하는지를 이해할 수 있게 됩니다.

시스템이 인터페이스를 이해하고 나면, 역방향으로 작동하여 거대한 새로운 데이터셋을 생성합니다. 시스템은 인터페이스가 없는 깨끗한 게임 세계 영상 클립을 가져온 다음, 추출된 인터페이스를 인위적으로 다시 추가하여 완벽한 '전'과 '후'의 영상 쌍을 만들어냅니다. 이 과정은 컴퓨터가 깨끗한 세계가 어떤 모습인지와 혼란스러운 버전이 어떤 모습인지를 정확히 알 수 있는 96,000개의 합성 비디오 쌍을 생성합니다. 시스템이 실제 데이터에서도 제대로 작동하는지 확인하기 위해, 그들은 또한 303개의 서로 다른 게임을 아우르는 1,000개 이상의 실제 인터넷 영상 클립을 수집했습니다. 이러한 합성 데이터와 실제 데이터의 결합은 제거 과정이 압박 속에서도 잘 작동하는지 확인하는 엄격한 테스트 장을 제공합니다.

연구진은 이후 제거 작업을 수행하기 위해 GameCleaner라고 명명한 특화된 모델을 훈련시켰습니다. 사용자가 제거하고 싶은 요소를 수동으로 박스를 그려 지정해야 했던 기존 방식과 달리, GameCleaner는 자동으로 작동합니다. 이 모델은 시각적 문맥에 대한 깊은 이해를 사용하여 이미지의 어느 부분이 게임 세계이고 어느 부분이 디지털 오버레이인지 식별합니다. 체력 바나 지도를 제거할 때, 단순히 픽셀을 지우는 것이 아니라 그 뒤에 숨겨진 장면을 재구성하여 배경이 일관되게 유지되고 캐릭터의 움직임이 부드럽게 유지되도록 합니다. 이 모델은 다른 비디오 편집 도구들과 비교 테스트를 거쳤으며, 인터페이스를 성공적으로 제거하면서도 밑바탕이 되는 장면을 높은 정확도로 보존함으로써 훨씬 우수한 성능을 입증했습니다.

이 작업의 결과는 정제된 데이터가 실제로 차이를 만드는지 확인하기 위해 통제된 실험에서 테스트되었습니다. 연구진은 두 개의 동일한 비디오 생성 모델을 훈련시켰습니다. 하나는 원래의 혼란스러운 게임플레이 영상으로 훈련시켰고, 다른 하나는 새로 정제된 버전으로 훈련시켰습니다. 정제된 데이터로 훈련된 모델은 훨씬 더 뛰어난 성능을 보였습니다. 이 모델은 훨씬 더 높은 움직임 품질과 전반적으로 더 나은 시각적 충실도를 구현했습니다. 구체적으로, 정제된 데이터로 훈련된 모델은 움직임을 포착하는 능력에서 18.8% 개선되었고, 전체적인 성능 점수에서 6.83% 향상되었습니다. 이는 디지털 오버레이가 단순한 시각적 노이즈가 아니라, 컴퓨터가 환경의 역동성을 진정으로 이해하는 것을 방해하는 지름길 역할을 하여 학습 과정을 적극적으로 혼란스럽게 만들었음을 증명합니다.

이 연구의 영향은 단순히 영상을 더 깔끔하게 만드는 것에 그치지 않습니다. 인터페이스를 세계로부터 성공적으로 분리함으로써, 연구진은 더 나은 월드 모델(world models)을 만들기 위한 확장 가능한 경로를 열었습니다. 이러한 모델은 복잡한 환경을 탐색하고, 물리적 상호작용을 시뮬레이션하며, 심지어 로봇을 제어할 수 있는 미래 인공지능의 토대입니다. 비싼 맞춤형 시뮬레이터 없이도 방대한 인터넷 게임플레이 데이터를 처리할 수 있는 능력 덕분에, 이러한 시스템을 위한 학습 데이터의 풀(pool)은 이제 사실상 무제한이 되었습니다. 팀은 자신들의 데이터셋, 코드, 모델을 공개하여 다른 과학자들이 이 토대 위에 구축할 수 있도록 초대했습니다. 이들의 연구는 적절한 도구가 있다면 인터넷의 혼란스럽고 인터페이스가 많은 영상들이 기계에게 세상이 실제로 어떻게 움직이는지를 가르치는 정교하고 구조화된 자원으로 변모할 수 있음을 보여줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →