← 最新の論文
🤖 AI

AGI Maze as a Benchmark Framework for World-Modeling Agents

本論文は、作業メモリメカニズムが提供されている場合であっても、部分観測的かつ状態依存的なタスクを解決するために必要となる、持続可能で操作可能な世界状態表現を構築できない現在の大型言語モデルの無能力さを露呈させるために設計された、軽量なグリッドベースのベンチマークフレームワークであるAGI Mazeを紹介するものである。

原著者: Alexey Potapov

公開日 2026-07-02
📖 1 分で読めます☕ さくっと読める

原著者: Alexey Potapov

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

大きなアイデア:「賢い」チャットボットが迷路で迷ってしまう理由

想像してみてください。あなたの周りに、詩を書いたり、数学の問題を解いたり、ジョークを言ったりできる非常に賢い友人がいるとします。この友人は、**大規模言語モデル(LLM)**のような存在です。彼らは、文章の次にくる単語を予測することに関しては驚くほど優れています。

しかし、この論文は、もしこの友人を「目の前の壁しか見えない暗くて曲がりくねった迷路」の中に置いたら、彼らは迷ってしまうだろうと主張しています。彼らは次のステップを推測することはできますが、頭の中に迷路全体のメンタルマップ(精神的な地図)を構築することはできません。彼らは物語を完結させることは得意ですが、世界をシミュレーションすることは苦手なのです。

これを証明するために、著者たちはAGI Mazeと呼ばれる新しいテストを作成しました。


AGI Mazeとは何か?(「テキストベースのビデオゲーム」)

AGI Mazeを、すべてテキストメッセージを通じてプレイするビデオゲームだと考えてください。

  • 設定: あなたはグリッド(チェス盤のようなもの)の中にいます。スタート地点、宝箱、鍵、そして出口があります。
  • ルール: あなたはマップを見ることができません。壁がどこにあるのかも分かりません。分かっているのは、自分がどこからスタートしたかだけです。
  • ゲームプレイ: あなたが「右へ行く」と入力すると、ゲームは「壁に当たりました」と返します。次にあなたが「下へ行く」と入力すると、ゲームは「鍵を見つけました!」と言います。
  • ゴール: マップのレイアウトを理解し、鍵を見つけ、宝箱を開け、脱出すること。これらすべてを、一度も画像を見ることなく、自分がどこにいたか、どこに壁があったかを記憶しながら行わなければなりません。

なぜ難しいのか?
迷路には、さらに難易度を上げるための「仕掛け」があります:

  1. 川: 川に足を踏み入れると、自動的に下流へと流されますが、ゲームは水がどちらの方向に流れているかは教えてくれません。あなたはそれを推測しなければなりません。
  2. 穴: 穴に落ちると、迷路の全く別の場所に飛び出すかもしれません。
  3. 制限時間: 完了までに使えるステップ数には限りがあります。目的もなく彷徨っていると、時間がなくなってしまいます。

実験:AIはこれを解けるか?

著者たちは、いくつかの人気のあるAIモデル(GPT-4oやGeminiなど)をこれらの迷路でテストしました。彼らはAIを、テキストによる記述のみを頼りに進む人間のプレイヤーとして扱いました。

結果は驚くべきものでした:

  • 「素の(Vanilla)」AI: AIがチャット履歴に基づいて次の動きを推測しようとしただけの場合、惨敗しました。小さな迷路では、ランダムに方向を選んで進むだけのプログラム(ランダムウォーク)よりも成績が悪くなることさえありました。
  • 問題点: AIは自分の「心」の中にマップを構築していませんでした。単に直前の数文に基づいた「次の単語」を予測していただけなのです。「自分は今どこにいるのか」「壁はどこにあるのか」という安定したイメージを保持することができませんでした。

「ノート」のトリック

著者たちは、人間が複雑な迷路を解くには、鉛筆と紙なしでは不可能であることに気づきました。私たちは進みながら地図を描きます。そこで、彼らはAIに「ノート」を与えました(AIが動きを作る前に、自分自身のチャット履歴の中にメモを書けるようにしました)。

  • 設定: AIは「右へ行く」と言う前に、まずメモを書きます。「私は左下にいます。上に行こうとしたら壁に当たりました。鍵は右の方にあるようです。」
  • 結果: これにより、強力なAIモデルは大幅に改善されました。失敗続きの状態から、約60〜70%の迷路を解けるようになりました。
  • 落とし穴: ただし、ノートを使ってもなお、AIは苦戦しました。AIは自然に完璧で構造化されたマップを構築することはありませんでした。ただ、とりとめのないメモを書いているだけでした。そして、より小規模で能力の低いAIモデルにとっては、このノートのトリックは効果がなく、依然として迷ったままの状態でした。

これは何を示しているのか?

この論文は、いくつかの重要な結論を導き出しています。

  1. 予測 vs 理解: 現在のAIは、文章の次の単語を予測すること(物語を完結させることなど)は得意ですが、変化する世界をシミュレートすること(迷路をナビゲートすることなど)は苦手です。彼らは現実の「メンタルモデル」を自然に持つことができません。
  2. メモリ(記憶)の難しさ: 単に長いメッセージのリスト(そのAIの「記憶」)を与えるだけでは不十分です。情報をマップや計画へと能動的に整理する必要がありますが、現在のAIはそれを自力で行うことに苦労しています。
  3. テストはツールであり、最終スコアではない: 著者たちは「AIは役に立たない」と言っているのではありません。「AIが具体的にどこで失敗しているのかを示すための、特定のツール(AGI Maze)を提示している」のです。真に知的なエージェントを構築するためには、単にチャットする方法を教えるだけでなく、世界の内部マップを構築し、それを使用する方法を教える必要があることを、このテストは浮き彫りにしています。

アナロジーのまとめ

  • 現在のLLMは、台本を暗記したツアーガイドのようなものです。知らない街について尋えられれば、言葉を推測して答えることはできますが、目隠しをした状態で迷路をナビゲートしろと言われれば、地図を持っていないため躓いてしまいます。
  • AGI Mazeは、その目隠しをした迷路テストです。
  • 「ノート」は、そのツアーガイドにペンと紙を渡すことです。それは少しは役に立ちますが、彼らが自然に地図製作者になれるわけではありません。

論文は、AIが真の知能(AGI)へと進化するためには、単に次の文章を予測するのではなく、自ら地図を描き、探索しながらそれを更新していく方法を学ぶ必要があると主張しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →