← 最新の論文
💬 NLP

GameEngineBench: Evaluating Coding Agents on Real C++ Runtime Environments

本論文は、9つのゲームリポジトリに由来するUnreal Engine 5プロジェクト内の110個の実世界のC++タスクで構成されるベンチマークであるGameEngineBenchを紹介するものであり、これは複雑で状態を持つリアルタイムシステムにおいて機能的な変更を実装しコンパイルするコーディングエージェントの能力を評価するものであり、そして最強のモデルであっても深く統合されたゲームエンジン開発には苦慮することを明らかにしている。

原著者: Brian La, Sejoon Chang, Ben Kim, Junyoung Bae, Aamish Ahmad Beg, Sei Chang, Gonzalo Gonzalez-Pumariega, Kanav Goyal

公開日 2026-07-16
📖 1 分で読めます☕ さくっと読める

原著者: Brian La, Sejoon Chang, Ben Kim, Junyoung Bae, Aamish Ahmad Beg, Sei Chang, Gonzalo Gonzalez-Pumariega, Kanav Goyal

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

ロボットに家を建てる方法を教えていると想像してみてください。「この釘をハンマーで打て」という単純な指示を与えれば、ロボットは素晴らしい仕事をするかもしれません。しかし、もしあなたが、すでに半分完成している家の中に歩いて入り込み、配管が電気配線とどのように接続されているかを把握した上で、既存のライトを壊したりショートを引き起こしたりすることなく、新しいスマート照明システムを設置するように頼んだらどうなるでしょうか?それははるかに難しいテストになります。これが、コンピューターコードを記述し修正するために設計された人工知能、コーディング・エージェントの世界です。長い間、科学者たちはこれらのロボットに対し、数学のパズルを解いたり、単一の関数を書いたりといった、単純で孤立したタスクでテストを行ってきました。しかし、現実世界はパズルではありません。それは、あらゆるものが互いに影響し合う、混沌とした生きたシステムなのです。研究者たちが投げかけている大きな問いは、「これらのAIエージェントは、現実の稼働しているソフトウェアシステムの混沌を扱えるのか、それとも真空状態の中でしか機能しないのか?」ということです。

GameEngineBenchと題されたこの論文は、ビデオゲームエンジンを究極のテストラボとして使用することで、その問いに切り込んでいます。ゲームエンジンを、単にゲームを作るためのツールとしてではなく、キャラクター(「アクター」と呼ばれます)が走り回り、互いに話し、物事を記憶し、世界に反応する、複雑で生きた都市として考えてみてください。研究者たちは、AIがこの都市に足を踏み入れ、特定の通りを見つけ出し、都市全体の停電を引き起こすことなく、壊れた信号機を修理できるかどうかを確認したいと考えました。彼らは、強力で人気のあるゲームエンジンであるUnreal Engine 5を使用して、GameEngineBenchというベンチマークを構築しました。彼らは9つのオープンソースのゲームプロジェクトから、110の現実的なタスクを取り出しました。これらのタスクは単に「ループを書け」といったものではなく、「プレイヤーのインベントリが正しく保存されるようにする」、「AIが動けなくなるのを防ぐために修正する」、あるいは「マルチプレイヤーゲームの同期をとり、全員が同じものを見られるようにする」といった内容でした。AIはC++(難解で精密なプログラミング言語)でコードを書き、それをコンパイルし、実際にゲーム内で実行して、それが機能することを証明しなければなりませんでした。

結果は、AIの世界にとって一種の現実的な再確認となりました。研究者たちは、トップクラスのAIモデルの12種類の「構成」をテストしました。最高の実績を上げたclaude-fable-5というモデルは、初回試行でタスクの約55.5%を解決しました。これは印象的に聞こえますが、同時に、AIがほぼ半数のケースで失敗したことも意味しています。さらに明白なのは、どのAIモデルも、どれほど懸命に試みても解決できなかったタスクが31件あったことです。論文は、これらの失敗が単にAIがタイポ(打ち間違い)をした、あるいはセミコロンを忘れたといった理由によるものではないことを示唆しています。むしろ、AIはゲームエンジンの奥深くにある目に見えないルールに苦戦したのです。AIは、ある事象が「クライアント(プレイヤーの画面)」ではなく「サーバー(メインの脳)」で発生する必要があることを見落としたり、オブジェクトが生成または破棄されるタイミングを誤ったりすることがよくありました。それはまるで、AIは文章の書き方は知っているものの、会話全体の文法を理解していないようなものです。

この研究は、AIエージェントは向上しているものの、プロフェッショナルなソフトウェア開発の、混沌とした統合された現実には依然として苦戦していると結論付けています。AIは、見た目が良く、エラーなくコンパイルされるコードを書くことはできますが、実際にライブでインタラクティブなシステムを実行すると、システムの仕組みにおける繊細なバランスをしばしば崩してしまいます。研究者たちは、AIが教科書的な例ではなく、現実の稼働している環境でコードが機能することを証明しなければならない、このようなテストがもっと必要であると主張しています。AIがゲームエンジンの複雑に相互接続された都市を確実にナビゲートできるようになるまで、私たちは複雑なソフトウェアシステムを構築する役割を完全にAIに託すことはできないのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →