← 最新の論文
🤖 machine learning

Superhuman AI for Generals.io Using Self-Play Reinforcement Learning

本論文は、効率的なエンドツーエンドの自己対戦強化学習を通じてビジョン・トランスフォーマー・ポリシーの学習を可能にする、10,000倍の高速化を実現したJAXネイティブのシミュレータを活用することで、リアルタイム戦略ゲーム「Generals.io」においてパブリックリーダーボードで第1位を獲得した超人的なAIエージェントを提示するものである。

原著者: Matej Straka, Viliam Lisý, Martin Schmid

公開日 2026-06-23
📖 1 分で読めます☕ さくっと読める

原著者: Matej Straka, Viliam Lisý, Martin Schmid

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

Generals.io と呼ばれるデジタル戦場を想像してみてください。これは、2人の指揮官(または2つのチーム)がグリッド上で軍隊を操るリアルタイム戦略ゲームです。彼らはマップ全体を一度に把握することはできません。自分たちが所有している土地と、自軍の兵士の周囲の領域しか見ることができないのです。それ以外の部分は「戦場の霧」の中に隠されています。目標は単純です。自分の本拠地(ジェネラル)を守りつつ、敵の本拠地を占領することです。

この論文は、ある研究チームがいかにして、世界最高峰の人間プレイヤーを打ち負かすほど優れたAIを構築したかについて記述しています。ここでは、そのプロセスをシンプルな概念に分解して解説します。

1. 「超高速」シミュレーター

AIを訓練する前に、練習する方法が必要でした。かつて、このゲームでAIを訓練することは、車が1時間にわずか1インチ進むのを眺めながら運転を学ぶようなものでした。あまりにも遅すぎたのです。

研究者たちは、JAX という特殊なツールを使用して、新しい「シミュレーター」(ゲームのデジタル版)を構築しました。これは、自転車から超音速ジェットへとアップグレードすることだと考えてください。

  • 従来の方法: 以前のバージョンは、標準的なコンピュータで1秒間に約3,500ゲームステップを実行できました。
  • 新しい方法: 彼らの新しいバージョンは、単一のグラフィックスカードで毎秒5,000万ステップを実行します。
  • 結果: これは10,000倍の高速化です。これにより、AIは人間が1回プレイする間に、数百万回のゲームをプレイできるようになりました。このスピードが、最大のボトルネックを取り除きました。つまり、AIがついに、上手くなるために必要な速度で学習できるようになったのです。

2. 「セルフプレイ」のトレーニングキャンプ

エキスパートである人間のプレイ動画を見せてAIを教えるのではなく(これはチェスのグランドマスターの対局だけを見せてチェスプレイヤーを教えるようなものです)、AIに自分自身と対戦させました。

  • 手法: AIは自分自身のコピーと何百万回も対戦します。
  • 報酬: ゲームは非常にシンプルです。勝てば(+1点)、負ければ(-1点)となります。敵の兵士を数人倒したとしても、参加賞やポイントは与えられません。敵のジェネラルを捕らえたときのみ、報酬が得られます。
  • 課題: 報酬が非常に稀であるため(長いゲームの最後に一度だけ得られるため)、AIは何が正しかったのかを理解するのが困難です。これは、砂糖を入れすぎたのか、あるいは小麦粉が足りなかったのかといったフィードバックがないまま、最終的なケーキの味だけでケーキの作り方を学ぼうとするようなものです。

3. 特秘のレシピ:何が実際に機能したのか

研究者たちは、何がAIを人間を超越させるのかを知るために、多くの異なる「レシピ」をテストしました。その結果、人々が不可欠だと考えていたことが実は無用であり、いくつかのシンプルなトリックこそが決定的な違いを生むことが分かりました。

  • 「カンニングペーパー」は不要: AIに複雑なルールや、「良いこと(城を占領するなど)」に対する手動の報酬を与える必要はありませんでした。超高速シラレーターのおかげで、単純な「勝ちか負けか」の信号だけで十分でした。
  • 「平均的な生徒」(EMA): 多くのAIシステムでは、訓練を終了した直後の最新バージョンのAIを使用します。しかし、研究者たちは、時間の経過に伴うAIの脳の**指数移動平均(EMA)**を取る方が効果的であることを発見しました。
    • 比喩: ある生徒が毎日テストを受けていると想像してください。「最新のイテレート(反復)」は、最終日のスコアに過ぎません。「EMA」は、その月全体のパフォーマンスの平均を取るようなものです。研究者たちは、「平均的な生徒」の方が、最高(あるいは最低)の単一の日の生徒よりも、一貫性があり賢いことを発見しました。
  • 「良いゲーム」のフィルタリング(トップ・アドバンテージ・フィルタリング): AIは何百万ものゲームをプレイしましたが、そのほとんどは退屈でランダムなものでした。研究者たちは、すべてのゲームから学ぶ必要はないことに気づきました。彼らは、AIが明確な優位性を持っていた上位25%のゲームのみを保持し、そこから学習しました。
    • 比喩: 水泳の練習をしている場合、水の中で足をバタつかせているすべての瞬間を見る必要はありません。スムーズに、かつ効率的に泳いでいる時だけを研究する必要があります。これにより、学習ははるかに高速かつ効率的になりました。
  • 小さく始める: 彼らは最初から大きなマップでAIを開始したわけではありません。まずはジェネラル同士を非常に近くに配置し、AIが素早く勝てるように学習させました。その後、徐々にジェネラルを遠ざけていき、長期的な戦略をステップバイステップで学習させました。

4. 結果:人間を打ち負かす

強力なコンピュータで4日間訓練した後、AI(ニックネームは「Average Joe」)は公開リーダーボードに登場しました。

  • ランキング: 5,000人以上の人間プレイヤーの中から1位に到達しました。
  • 格差: AIは2位の人間プレイヤーを圧倒的な差で破りました。実際、AIと2位の人間との差は、2位の人間と25位の人間との差と同じくらい大きなものでした。
  • 直接対決: トップ2名の人間プレイヤーと直接対戦した際、AIは199勝、わずか70敗を喫しました。
  • 旧世代のボットに対して: 前のベストAIや、学習ではなく数学的な公式を使用する「ルールベース」のボットに対しても、100%の勝率で完勝しました。

5. AIが「見ていた」もの

研究者たちは、AIの思考が人間と同じかどうかを確認するために、AIの脳の内部を調査しました。

  • 「霧」の検知器: 彼らは、敵のジェネラルがどこに隠れているかを追跡していると思われる特定のパーツをAIの脳内に発見しました。
  • 比喩: 暗闇の中でかくれんぼをしているところを想像してください。最初は、相手はどこにでもいると考えます。しかし、物音が聞こえたり影が見えたりするにつれて、場所を絞り込んでいきます。最終的に、相手を見つけ出します。AIの脳はまさにこれを行いました。最初は推測から始め、手がかりを集めるにつれて絞り込み、直接は見えていなくても、最終的に敵のジェネラルの位置を「ロックオン」したのです。

まとめ

この論文は、戦略ゲームにおいて、人間が作った複雑なルールや膨大な量の人間データがなくても、超人的なAIを作成できることを証明しています。もし、十分に高速なシミュレーターと、単純な「勝ちか負けか」の報酬があれば、標準的な学習アルゴリズムが残りのすべてを自力で解明できるのです。鍵となった要素は、スピード、忍耐(結果の平均化)、そして最も情報量の多いゲームに集中することでした。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →