VideoGameBench: Can Vision-Language Models complete popular video games?
本論文は、視覚言語モデルが生の視覚入力と高レベルの指示のみを用いて 1990 年代のビデオゲームをプレイするベンチマーク「VideoGameBench」を導入し、知覚、空間ナビゲーション、推論遅延の制限により、最先端のモデルでさえリアルタイムのゲームプレイにおいて著しく困難に直面していることを明らかにする。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
非常に賢く、図書館のすべての本を読み込み、複雑な数学の問題を解くことができるロボットを想像してみてください。「素晴らしい!では、このロボットがビデオゲームをプレイできるか試してみよう」と思うかもしれません。
プリンストン大学の研究者たちは、まさにそれを行いました。彼らは、これらの高度な AI モデル(ビジョン・ランゲージモデルと呼ばれる)が、人間と同様に 1990 年代の人気のビデオゲームを実際にプレイできるかどうかを確認するための新しいテスト「VideoGameBench」を作成しました。
以下に、彼らの実験の概要、結果、そしてその意味を、簡単なアナロジーを用いて解説します。
設定:「目隠しゲーマー」テスト
通常、科学者が AI をゲームでテストする際、AI にカンニングペーパーを与えます。「敵は座標 X, Y にいる」と伝えたり、レベルのマップを与えたりします。これは、膝の上にガイドブックを開いたままビデオゲームをプレイしているようなものです。
VideoGameBench は、このルールを変更しました。
- ルール: AI に与えられるのは、画面の生々しい画像(あなたがテレビを見ているようなもの)と、ボタンの機能に関する簡単なテキスト説明(例:「'A' を押すとジャンプする」)のみです。
- 課題: AI は、ゲームを理解し、どこを移動したかを記憶し、リアルタイムで敵に対応しなければなりません。これは人間プレイヤーが行うことと同じです。
- ゲーム: 彼らは 1990 年代のクラシックなゲーム 10 作品を選びました。高速シューティングゲーム『Doom II』から、ゆっくりとした戦略ゲーム『Civilization』、そしてロールプレイングアドベンチャー『Pokémon』まで多岐にわたります。
さらに、彼らは AI から3 つの秘密のゲームを隠しました。これは、AI が単にトレーニングデータから答えを暗記しているのではなく、実際に新しいものをその場で学習してプレイしていることを確認するためでした。
結果:「新生児」の問題
結果は驚くべきものでした。現在利用可能な最も賢く、最も強力な AI モデル(Gemini 2.5 Pro や Claude 3.7 など)さえも、非常に苦労しました。
- スコア: 最善のモデルでも、ゲームの約**0.48%**しかクリアできませんでした。
- 現実: 平易な英語で言えば、これは AI がゲームの序盤で立ち往生したことを意味します。最初のレベルさえクリアできませんでした。
次のように考えてみてください。ある天才数学者に、新品のビデオゲーム機を渡します。彼らはロケットの軌道を計算することはできますが、『スーパーマリオ』をプレイしようとすると、「画面の『下』が『落下』を意味する」ということが理解できず、崖から転落し続けたり、3 分前に鍵を拾ったことを忘れてしまったりします。
なぜ失敗したのか?
論文は、AI が立ち往生した主な 3 つの理由を特定しています。
- 「知っている」と「実行する」のギャップ: AI はしばしば「何をするべきか」を知っていました(例:「ドアに行く必要がある」)が、間違ったボタンを押し続けていました。これは、店に行くために左に曲がる必要があると知っているのに、足が右に踏み出してしまっている人のようなものです。
- 視覚的混乱: AI は時折、何を見ているのかを判別できませんでした。『Doom II』では、AI が岩の山のように見える死んだ敵を撃ち、すべての弾薬を無駄にすることがありました。『ゼルダ』では、会話が発生していなくても隣に立っただけで、キャラクターと話したと誤解することがありました。
- 短期記憶: ビデオゲームでは、長い間何かを記憶する必要があります(例:「赤い扉を開けるために青い鍵を見つける必要がある」)。AI は数ステップ後には主要な目標を忘れ、新しいかつ重要度の低い思考で記憶を上書きしてしまいました。
「一時停止ボタン」実験
研究者たちは、一部のゲームが非常に高速(リアルタイム)であり、AI の思考は遅いことに気づきました。AI がボタンを押すかどうかを決める頃には、ゲームはすでに変化しており、その行動が無意味になっていました。
これを解決するために、彼らはVideoGameBench Liteを作成しました。
- 変更点: AI が思考している間、ゲームの「一時停止」ボタンを押しました。ゲームは AI が指示を出したときのみ進行しました。
- 結果: スコアはわずかに上昇しましたが(約 1.6% まで)、AI は依然としてゲームをクリアできませんでした。これは、問題が単に AI が遅いことではなく、AI がゲームの論理を効果的に推論できないことにあることを証明しました。
「練習テスト」**
AI が基本的なタスクを処理できるかどうかを確認するために、彼らは 3 つの小さくシンプルな練習ゲームを作成しました。
- クリック: 移動するドットをクリックする。
- ドラッグ: ドットを線に沿ってドラッグする。
- 迷路: 正方形をシンプルな迷路の中で移動させる。
ここでも、AI は苦労しました。いくつかのモデルはドットをクリックできましたが、ほぼすべてのモデルがドラッグや迷路のナビゲーションに失敗しました。これは、AI が複雑なゲームの論理だけでなく、基本的な物理的相互作用や空間的推論にも困難を抱えていることを示唆しています。
結論
この論文は、AI が数学やコーディングにおいては驚異的である一方で、視覚情報と自身の記憶のみに頼ってビデオゲームをプレイする際には、現在極めて不得意であると結論付けています。
研究者たちは、この困難なテストを作成することで、AI 開発者が以下の点において優れたシステムを構築するよう促すことを期待しています。
- 何を見ているかを理解すること(知覚)。
- 以前に何が起こったかを記憶すること(記憶)。
- 先を見越してステップを計画すること(戦略)。
AI がカンニングペーパーなしで『Doom』や『Pokémon』を攻略できるようになるまで、それは新しい複雑な環境を学習し適応する人間の能力を完全にマスターしたとは言い難いでしょう。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。