From Pixels to BFS: High Maze Accuracy Does Not Imply Visual Planning
この論文は、MazeBench ベンチマークを用いた評価により、多モーダルモデルが迷路タスクで高い正解率を示すのは、人間のようないわゆる「視覚的計画」によるものではなく、画像をテキストグリッドに変換してトークン空間で全探索(BFS)を行う「力任せの検索」の結果であることを明らかにしています。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
迷路を解く AI の「嘘」と「真実」
~「正解」が出ても、実は人間とは全く違う方法で解いている?~
この論文は、最新の AI(マルチモーダルモデル)が「迷路」を解くとき、私たちが想像するような「頭の中で地図を広げて道を探す」ような賢さを持っているのか、それとも別の方法で正解を出しているのかを暴いた面白い研究です。
タイトルにある**「ピクセルから BFS(探索)へ:高い正解率は、視覚的な計画性を意味しない」というフレーズは、「AI が正解を出せても、それは人間のような『直感的な迷路解き』ではない」**という衝撃的な結論を表しています。
🧩 1. 実験の舞台:「MAZEBENCH」という迷路のテスト
研究者は、AI たちに 110 種類の迷路を解かせました。
- 簡単な迷路: 5×5 の小さなもの。
- 超難問: 20×20 の巨大で、壁やトラップがびっしり詰まったもの。
- 参加者: OpenAI、Anthropic、Google、Alibaba などの最新 AI モデルたち。
人間なら、複雑な迷路でも数秒で「あ、ここは行き止まりだ」と目で追って最短ルートを発見できます。でも、AI はどうでしょうか?
🤖 2. 驚きの結果:「正解」の裏にある「力業」
結果、最新の AI は驚くほど高い正解率を出しました。
- GPT-5.4: 91% 正解!
- Gemini 3.1 Pro: 79% 正解!
「すごい!AI は迷路を解けるようになった!」
と思いたいところですが、論文は**「待てよ、その正解の出し方は人間とは違うぞ」**と言います。
🕵️♂️ AI の正体:「画像を文字に変換して、ひたすら試行錯誤する」
AI は迷路の画像を「見る」のではなく、「画像を文字のマス目(グリッド)に書き起こす」ところから始めます。
そして、その文字のマス目の中で、「上、右、下、左…」と「もしこうだったら?」「じゃあこう?」と、文章(トークン)を使って一つずつ経路を試し続けるのです。
- 人間の解き方: 迷路全体をパッと見て、「あ、ここは死に道だ」と一瞬で判断し、最短ルートを直感的に見つける。
- AI の解き方: 迷路を「文字のリスト」に変換し、「A 行こう→壁だ!戻る。B 行こう→壁だ!戻る…」と、すべての可能性を文章で書き殴りながら正解を探す。
これは、**「迷路を解く」のではなく、「文章で迷路をシミュレーションして力業で正解を見つける」**作業に近いです。
💸 3. 代償は大きかった:「思考の燃料」を大量消費
この「力業」には大きなコストがかかります。
- 人間: 数秒で解く。
- AI: 正解を出すために、1,700 文字から 22,000 文字以上もの「思考トークン(計算リソース)」を消費します。
- 例:GPT-5.4 は 1 回の正解に約 1,700 トークン。
- 例:Gemini は約 9,000 トークン。
- 例:Claude は約 22,000 トークン(正解率が低いのに、最も無駄遣いしている!)。
まるで、**「目的地まで歩くのに、地図を見ずに『右、左、右、左』と一歩一歩を大声で叫びながら歩く」**ようなものです。正解にはたどり着いても、そのプロセスは非効率で、人間とは全く異なります。
📉 4. 限界の壁:「超難問」で AI は挫折する
20×20 の超難問(パスが 40 歩以上あるもの)になると、AI は**「思考の燃料切れ」**を起こします。
- 経路を文章で書き起こす前に、**「トークン制限(出力できる文字数)」**に達してしまい、「解けない」と諦めてしまいます。
- 実際には道があるのに、「道がない」と誤って報告することも多いです。
- 人間なら数秒で解ける迷路を、AI は「文字を書き続ける時間」が足りないために解けなくなります。
🧪 5. 意外な発見:「目」の問題か「脳」の問題か?
研究チームは、ある実験を行いました。
「AI に迷路の画像を見せるのではなく、正解の『文字のマス目』を直接渡したらどうなるか?」
- 画像を与えた場合(Claude Sonnet): 正解率 6%(画像を文字に変換する段階で失敗)。
- 文字のマス目を直接与えた場合: 正解率 80% に跳ね上がりました!
これは、**「Claude などの AI は、迷路を『見る(画像認識)』のが下手なだけで、迷路を『解く(論理思考)』能力は実は高い」**ことを意味します。
逆に、GPT-5.4 は画像認識も解き方も得意ですが、それでも「力業で経路を探す」という基本戦略は変わりません。
🎯 6. 結論:「正解」は「理解」を証明しない
この論文が私たちに教えてくれることはシンプルです。
「AI が迷路を正解したからといって、それは人間のような『空間認識』や『直感的な計画力』を持っているわけではありません。」
AI は、**「画像を文字に変換し、その文字の羅列の中で、ひたすら試行錯誤して正解を見つけ出す」**という、人間とは全く異なる「力業」で正解を出しているに過ぎません。
- 高いスコア = 「すごい空間認識能力」 ではなく、**「大量の計算リソースを使って、力業で正解を導き出した」**という証拠に過ぎない。
- **人間のような「視覚的な計画」**は、まだ AI には備わっていない可能性があります。
🌟 まとめ:日常への教訓
この研究は、AI の評価方法にも警鐘を鳴らしています。
「AI が 90% 正解したから、もう人間並みだ!」と喜ぶのは危険かもしれません。
**「その正解は、人間と同じ『賢さ』で出ているのか、それとも『計算の力』で無理やり出しているのか」**を見極める必要があります。
AI は、「迷路の画像を見て、頭の中で道筋を描く」のではなく、「迷路をテキストに変換して、辞書引きのように経路を探している」のです。
それは、「迷路を解く」という行為の本質(視覚的な直感)とは、まだ遠い場所にいることを示しています。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。