← 最新の論文
💻 computer science

Game2World Engine: Unlocking In-the-Wild Gameplay Videos for World Model Training

本論文は、UIアセット抽出のためのG2WEngineと、マスクフリーのHUD除去を実現するGameCleanerモデルを特徴とする包括的なフレームワークであるGame2Worldを紹介するものであり、これは生のゲームプレイ動画を高品質なUIフリーの学習データへと変換し、ワールドモデルの性能を大幅に向上させるものである。

原著者: Wenxuan Shen, Dongna Jin, Dongping Chen

公開日 2026-08-26
📖 1 分で読めます☕ さくっと読める

原著者: Wenxuan Shen, Dongna Jin, Dongping Chen

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

コンピュータに、物理的な世界がどのように動き、変化するかを理解させる方法を想像してみてください。これを行うために、研究者たちは、物体がどのように相互作用し、光がどのように変化し、シーンが時間の経過とともにどのように進化するかを示す膨大な量のビデオを必要としています。長年、科学者たちはビデオゲームを、このデータの完璧な供給源として注目してきました。ゲームは、あらゆるアクションに明確な結果が伴う、無限に多様な環境を提供しており、現実の世界では捉えることが難しい、豊かな視覚体験のライブラリを提供しています。しかし、これらのゲームの生の映像を使用することには、重大な問題があります。人がゲームをプレイしているとき、画面はデジタル・オーバーレイ、つまり体力バー、マップ、弾薬カウンター、チャットウィンドウなどで乱雑になっています。これらの要素はゲームの世界そのものではなく、プレイヤーの便宜のために追加されたスクリーン空間の装飾です。もしコンピュータがこれらのオーバーレイが含まれたビデオから学習してしまうと、ゲームのルールとインターフェースのルールを混同してしまい、混乱してしまいます。

ある研究チームは、この問題を解決するために、デジタルな乱雑さを取り除き、その下にある純粋なゲームの世界を明らかにする効果的な新システムを開発しました。彼らは、デジタル・インターフェースを自動的に特定し、それらをビデオから除去し、さらに欠落した背景を補完して、シーンが完全で自然に見えるようにするフレームワークを作成しました。これにより、彼らは、数百万時間の乱雑なゲームプレイ映像を、クリーンで高品質なトレーニングデータへと変貌させたのです。彼らの研究は、コンピュータがこれらのクリーンアップされたビデオから学習すると、動きの予測や視覚的な品質において、測定可能な範囲でパフォーマンスが向上し、世界の仕組みを理解する能力が大幅に向上することを示しています。この画期的な成果は、インターネット上の膨大な、未開拓のゲームプレイビデオのライブラリが、より知的で有能な人工知能システムを構築するためにようやく利用可能になったことを示唆しています。

このプロジェクトの核となるのは、「G2WEngine」と呼ばれる新しいデータエンジンです。研究者たちは、コンピュータに世界について教えるためには、まず「何が世界ではないのか」を教えなければならないと気づきました。彼らはまず、コンパスや体力バーから、チャットログやポップアップ通知に至るまで、あらゆるものを特定のカテゴリーに分類する詳細なインターフェース分類システムを作成することから始めました。このシステムを使用して、エンジンは数百種類の異なるゲームからの数千の実際のゲームプレイビデオをスキャンします。それは、デジタル資産(体力バーやマップの実際の画像)を注意深く抽出し、再利用可能な透明なパーツへと変換します。これにより、システムはこれらのインターフェースがどのような見た目であり、画面のどこに通常表示されるかを正確に理解することができます。

システムがインターフェースを理解すると、次は逆のプロセスを行って、大規模な新しいデータセットを作成します。インターフェースのないクリーンなゲーム世界のビデオクリップを取り出し、そこに抽出されたインターフェースを人工的に再び追加することで、完璧な「前後」の映像ペアを作成します。このプロセスにより、コンピュータがクリーンな世界と、乱雑なバージョンの両方を正確に把握できる96,000組の合成ビデオペアが生成されます。システムが現実世界のデータでも機能することを確認するために、彼らは303種類の異なるゲームをカバーする、実際のインターネットビデオから1,000以上のクリップも収集しました。この合成データと現実データの組み合わせは、除去プロセスが圧力の下でも維持されるかどうかを確認するための厳格なテスト場となります。

研究者たちはその後、「GameCleaner」と名付けた特化したモデルを訓練し、除去タスクを実行させました。ユーザーが削除したい要素の周囲に手動でボックスを描く必要があった従来の方法とは異なり、GameCleanerは自動的に動作します。これは、視覚的なコンテキストに対する深い理解を用いて、画像のどの部分がゲームの世界であり、どの部分がデジタル・オーバーレイであるかを識別します。体力バーやマップを除去するとき、それは単にピクセルを消去するのではなく、隠れた風景を再構成し、背景の一貫性を保ち、キャラクターの動きがスムーズに保たれるようにします。このモデルは他のビデオ編集ツールと比較され、インターフェースを正常に除去しながら、高い精度で基礎となるシーンを保持できることが証明されました。

この研究の結果は、クリーンなデータが実際に違いをもたらすかどうかを確認するために、制御された実験の中でテストされました。研究者たちは、2つの同一のビデオ生成モデルを訓練しました。一方は元の乱雑なゲームプレイビデオを用いて、もう一方は新しくクリーンアップされたバージョンを用いて訓練されました。クリーンなデータで訓練されたモデルは、大幅に優れた性能を示しました。それは、より高い動きの品質と、より優れた全体的な視覚的忠実度を持つビデオを生成しました。具体的には、クリーンなデータで訓練されたモデルは、動きの捕捉において18.8パーセントの向上、および全体的なパフォーマンススコアにおいて6.83パーセントの向上を示しました。これは、デジタル・オーバーレイが単なる視覚的なノイズではなく、環境のダイナミクスを真に理解することを妨げるショートカットとして機能し、学習プロセスを積極的に混乱させていたことを証明しています。

この研究の影響は、単にビデオをより綺麗に見せることにとどまりません。インターフェースを世界から分離することに成功したことで、研究者たちは、より優れた「ワールドモデル」を作成するためのスケーラブルな道筋を切り開きました。これらのモデルは、複雑な環境をナビゲートし、物理的な相互作用をシミュレートし、さらにはロボットを制御することができる、将来の人工知能の基礎となるものです。膨大な、カスタムメイドのシミュレーターを必要としないインターネットのゲームプレイ・データを処理できる能力により、これらのシステムで利用可能なトレーニングデータのプールは、事実上無限となりました。チームは、他の科学者がこの基礎の上に構築できるよう、データセット、コード、およびモデルを一般に公開しています。彼らの研究は、適切なツールがあれば、インターネット上の混沌としたインターフェースの多いビデオが、機械に世界の真の動きを教えるための、清浄で構造化されたリソースへと変えられることを示しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →