← 最新の論文
🤖 AI

Mini Amusement Parks (MAPs): A Testbed for Modelling Business Decisions

本論文は、複雑で現実的なビジネス意思決定タスクにおけるAIエージェントを包括的にベンチマークするために設計された新しい遊園地シミュレーターであるMini Amusement Parks(MAPs)を紹介し、現在の最先端のLLMが、長期的な最適化、サンプル効率の高い学習、空間推論、および世界モデル化において、人間のベースラインを大幅に下回っていることを明らかにしている。

原著者: Stéphane Aroca-Ouellette, Ian Berlot-Attwell, Panagiotis Lymperopoulos, Abhiramon Rajasekharan, Tongqi Zhu, Herin Kang, Kaheer Suleman, Sam Pasupalak

公開日 2026-07-14
📖 1 分で読めます☕ さくっと読める

原著者: Stéphane Aroca-Ouellette, Ian Berlot-Attwell, Panagiotis Lymperopoulos, Abhiramon Rajasekharan, Tongqi Zhu, Herin Kang, Kaheer Suleman, Sam Pasupalak

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは、世界で最も混沌とし、予測不能で、かつ利益率の高い遊園地の鍵を渡されたと想像してみてください。あなたの仕事は?マネージャーです。どこにジェットコースターを配置するか、アイスクリームスタンドをいくつ開くか、いつ清掃員を雇うか、そして新しい超高価なアトラクションの研究に現金を投じるべきかどうかを決めなければなりません。しかし、ここには落とし穴があります。ゲストは機嫌が悪く、乗り物はランダムに故障し、もし判断を誤れば、ランチの時間が来る前にパークは倒産してしまうかもしれません。

これが、AIがいかにして現実のビジネスを運営できるかをテストするために研究者によって作成された、ビデオゲームのような新しいシミュレーター、Mini Amusement Parks (MAPS) の世界です。

大対決:AI vs 人間のマネージャー

研究者たちは、世界最高峰のAIモデル(GPT-5、Claude、Geminiなど)と、熟練した人間のプレイヤーによる対決を設定しました。目的はシンプルです。誰が最も価値のあるパークを築けるかを見ることでした。

結果は、大きな警鐘を鳴らすものでした。最高峰のAIモデルでさえ、追いつくのに苦労したのです。

  • イージー(Easy)モードでは、トップAI(GPT-5)は、熟練した人間が達成したスコアのわずか8.80%にしか到達できませんでした。つまり、人間は11.4倍優れていました。
  • 長期的な思考が求められる、よりトリッキーなミディアム(Medium)モードでは、その差はさらに広がりました。AIのパフォーマンスは人間のスコアのわずか4.44%にまで低下し、人間は15.3倍も優位に立ちました。

それは、フォーミュラ1の車を幼児に渡し、プロのレーサーにプロの車を渡すようなものです。幼児(AI)は車を動かすことすらままならず、プロ(人間)はトラックを周回しています。

なぜAIは失敗したのか?

この論文は、AIが単に「数学が苦手」なのではなく、非常に人間的な「超能力」を欠いていることを示唆しています。研究者は、AIがつまずいた5つの特定の領域を特定しました。

  1. 「昼食はどうするんだ?」問題(短視眼的思考):
    人間は先を見越して計画を立てます。今日巨大なジェットコースターを建設するなら、スタッフを増員し、来月のための資金を貯めておく必要があることを知っています。しかし、AIは近視眼的になりがちです。AIは(ジェットコースターを建てるといった)目先の報酬を掴み取ろうとし、その結果として起こる事態を考えることができません。それは、今日食べるお菓子を全部食べてしまい、残りの一日のためのエネルギーを忘れて腹痛を起こす子供のようなものです。ゲームが難しくなった(ミディアムモード)とき、AIのパフォーマンスが急落したのは、次のターン先を見通せなかったためです。

  2. 「目隠し」問題(空間推論):
    実際のパークでは、ショップをどこに置くかが重要です。道沿いに置くべきであり、隅に追いやってはいけません。AIはしばれて、アクセスしにくい場所に乗り物を配置したり、すべてを一箇所に固めたりして、群衆の流れを無視してしまいました。興味深いことに、AIにパークの画像(視覚情報)を与えても効果はありませんでした。実際、それは状況を悪化させることもありました。AIは視覚データに混乱しているようでしたが、配置に関する単純なルール(ヒューリスティック)を用いると、AIのパフォーマンスは向上しました。

  3. 「推測ゲーム」問題(確率性):
    現実の世界は混沌としています。理由もなく乗り物が故障することもありますし、ゲストがただ不機嫌なだけということもあります。これは「確率性(ストカスティシティ)」と呼ばれます。AIはこのランダムさに対処するのに苦労しました。AIは、運が悪かったことによる悪い日と、判断が悪かったことによる悪い日の区別をつけることができませんでした。研究者が未来を予測するためにAIを使おうとしたとき(「ワールドモデル」)、それはしばしば状況を悪化させ、より遅く、より高価な決定を招きました。

  4. 「記憶喪失」問題(能動的学習):
    人間は実験が得意です。新しい戦略を試して失敗した場合、なぜ失敗したのかを学び、別の方法を試します。研究者はAIに「サンドボックス」モード、つまり本番テストの前に100日間実験できる安全な練習エリアを与えました。驚いたことに、これはあまり効果がありませんでした。AIは主に、すでに説明書にあることを繰り返すか、あるいは後で役に立つにはあまりにも具体的すぎるメモを作成するだけでした。AIは、パークがどのように機能しているかについての真の「メンタルモデル」を構築することに失敗したのです。

  5. 「リサーチの底なし沼」問題:
    より難しいバージョンでは、新しい乗り物を建設する前に、それを研究する必要があります。AIは、まだ建設できる資金がない場合でも、すぐに最も高価で派手な乗り物を研究対象として選んでしまうことがよくありました。それは、運転免許を取る前にフェラーリを買おうとしている学生のようなものです。

この論文が否定したもの

この論文は、何が機能しないのかを明確に述べています。

  • 単にAIに画像を与えることは解決策ではない: AIの「脳」に視覚的な入力を追加しても、空間的な問題は解決せず、むしろテキストのみの場合よりもAIを混乱させることがわかりました。
  • 現在の「ワールドモデル」はまだ準備不足である: 研究者は、AIが未来を予測するのを助けるために特定のAI技術(WALL-E)を使用してみましたが、それは逆にAIのパフォーマンスを低下させ、実行コストを増大させました。
  • 練習が必ずしも完璧を作るわけではない: 単にサンドボックスで100日間プレイさせたとしても、AIが自動的に賢くなることはありませんでした。多くの場合、AIは失敗から何を学ぶべきかを理解できず、性能が低下するか、変わらないままでした。

私たちの確信度は?

これらの知見は、MAPSゲーム環境内でのシミュレーション測定に基づいています。研究者は、特定のレイアウト(マップ)を用いて、AIと人間のプレイヤーを何度も走らせ、これらの数値を算出しました。彼らは単に推測したのではなく、パークの価値、支出額、および要した時間を測定しました。

この論文は、AIが多くの分野で進化している一方で、現実のビジネスのように複雑に絡み合い、予測不能な事態を扱うには、まだ長い道のりがあることを示唆しています。人間(エキスパート)とAIの間のギャップは、ほんのわずかな差ではなく、深い溝です。研究者たちは、この「ミニ・アミューズメント・パーク」をテストベッドとして用いることで、真に人間のように考え、計画し、適応できるAIを構築できることを期待しています。

それまでは、もしあなたがテーマパークを運営したいのであれば、人間のマネージャーを雇い、AIには非常に短いリード(制御)をつけておくのが賢明でしょう。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →