STOCKTAKE: Measuring the Gap Between Perception and Action in LLM Agents with a Fair Oracle
本論文は、状態推定と制御アクションを分離する公正なオラクルを備えた26週間のサプライチェーン・ベンチマークであるSTOCKTAKEを紹介しており、高度なLLMエージェントは隠れた失敗を正確に診断できる一方で、その知識を効果的な意思決定へと変換することには失敗することが多く、その結果、一部のモデルが優れた検出能力を持ちながらも症状を知らないベースラインよりも低性能になるというパフォーマンスの格差が生じることを明らかにしている。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
霧に包まれた諸島を航行する船の船長を想像してみてください。あなたが手にしている地図は不完全であり、隠れた岩礁や変化する潮流を直接見ることはできません。代わりに、船体に打ち付ける波の音、水のいろ、そして風の音だけが頼りです。安全に航行するためには、これらの手がかりから、水面下で何が起きているのかを推測しなければなりません。これは、長期的な意思決定を行おうとするAIエージェントの世界です。この分野において、科学者たちは、人工知能が人間の船長のように、ノイズ混じりの症状から隠れた危険を推論し、数週間あるいは数ヶ月にわたって資金を節約したり災厄を防いだりする選択ができるかどうかをテストしています。
研究者が抱いている大きな疑問は、**「AIが失敗したとき、それは手がかりを理解できなかったからなのか、それとも手がかりを完璧に理解した上で、ひどい選択をしてしまったからなのか?」**ということです。これは「知る・行う間のギャップ(knowing-doing gap)」と呼ばれます。それは、数学の問題の答えを知っているのに、パニックになって間違った数字を書いてしまう学生のようなものです。長い間、この違いを判別することは困難でした。なぜなら、「正解」を得るためには通常、AIには見ることが許されていない隠れた岩礁を見る必要があるからです。AIが失敗したとき、それが「盲目」だったのか、それとも単に「不器用」だったのかが分からなかったのです。
大規模サプライチェーン・ストックテイク
この論文において、研究者たちはこの謎を解明するために、STOCKTAKEと呼ばれるデジタル・プレイグラウンド(実験場)を構築しました。彼らは、AIが電子機器輸入業者のマネージャーとして振る舞う26週間のシミュレーションを作成しました。マネージャーは毎週、どの程度のガジェットを注文すべきかを決定しなければなりません。問題は、世界には隠れたトラブルメーカーが満ちていることです。サプライヤーが破綻しているかもしれないし、運河が封鎖されているかもしれないし、需要が突然急増しているかもしれません。AIはこれらの問題を直接見ることはできません。AIが見ることができるのは、毎週更新される、ノイズが多く混乱したダッシュボード(例えば「バースの待ち時間が長い」や「運賃見積もりが上昇している」といった情報)だけです。
AIが「盲目」なのか、それとも単に「不器用」なのかを判断するために、研究者たちは**フェア・オラクル(公正な神託)**を考案しました。これは、AIの隣に座っている超スマートで完璧に論理的なロボットだと考えてください。このロボットは、AIと全く同じ、混乱したダッシュボードを見ます。このロボットもまた、隠れたトラブルメーカーを覗き見ることはできません。しかし、このロボットは数学の天才です。完璧な確率規則(ベイズ・フィルター)を用いて、何が起きているのかを推測し、その推測に基づいた絶対的に最善の注文量を算出します。
このフェア・オラクルとAIのパフォーマンスを比較することで、研究者は以下の2つの要素を個別に測定することができました。
- 知覚(Perception):AIは、何が間違っているのかを正しく推測できたか?(隠れた問題を特定できたか?)
- 行動(Action):AIは、推測した後に正しいステップを踏めたか?(正しい量を注文できたか?)
彼らは、4つの最新鋭のAIモデル(Claude Sonnet 5、GPT-5.4、DeepSeek-V4-Pro、Grok 4.5)を用いて、50種類の異なる「シード」(隠れた世界の異なるバージョン)にわたってこの実験を行いました。
彼らが発見したもの: 「知る・行う」のギャップは実在する
結果は驚くべきものであり、少し滑稽でもありました。
1. AIの「視力」は十分である
まず、研究者はAIが隠れた問題を察知できるかどうかを確認しました。答えは明白なイエスでした。4つのモデルすべてが「見る」ことに関しては非常に優れていました。彼らは、隠れたストレス(港の封鎖やサプライヤーの失敗など)を**84%から88%**のケースで正しく特定しました。さらに優れたことに、彼らは通常、問題が発生してから1週間以内にそれを突き止めました。実際、最終的な財務パフォーマンスが悪かったモデルほど、問題を察知するスピードは速かったのです。したがって、失敗の原因はAIが盲目であったことではありませんでした。
2. AIは「行動」できない(時がある)
ここからが面白いところです。たとえAIが何が起きているかを理解していても、間違った動きをすることが頻繁にありました。
- 「過小反応型(Under-Responders)」:例えばClaude Sonnet 5のようなモデルは、問題を正しく診断しながらも、そのまま固まってしまうことがありました。例えば、港が封鎖されているのを見た場合、現在の在庫で十分だと考えて注文を完全に止めてしまいます。しかし、港が封鎖されているために在庫が届かず、結局品切れを起こして損失を出してしまいます。彼らは問題を理解していましたが、慎重になりすぎてしまいました。
- 「過剰反応型(Over-Responders)」:逆に、DeepSeek-V4-ProやGrok 4.5のようなモデルは正反対でした。彼らは問題を見つけるとパニックになり、高価な航空便を大量に注文したり、高い価格で契約を確定させたりしました。彼らは問題を把握していましたが、あまりにも過剰に反応したため、必要以上に多額の費用を費やしてしまいました。実際、テスト走行の約半分において、これらのモデルのパフォーマンスは、症状を無視した単純なルールに従っていた方がより多くの資金を節約できたという結果になりました。彼らの「スキルスコア」は実際にマイナス(具体的には -0.23 と -0.13)であり、症状を知らない戦略よりも成績が悪かったことを意味しています。
3. 「知る・行う」のギャップこそがボトルネックである
研究の結果、優れたAIとそうでないAIの最大の差は、知能や世界の捉え方の鮮明さではなく、**コントロール(制御)**にあることが分かりました。
- 「持続的(Persistent)」なストレスシナリオ(問題が数週間にわたって続く状況)において、たとえAIが問題を正しく診断できたとしても、**34%から43%**の確率で在庫切れが発生していました。
- 研究者は、AIがフェア・オラクルにどれだけ近づけたかを測るために「スキルスコア」を算出しました。2つのモデル(DeepSeekとGrok)はマイナスの数値を記録しました。これは、症状を無視する単純なルールよりも成績が悪かったことを意味します。しかし、これらのモデルは、記述された説明文の中で、最も早く隠れた問題を指摘していたのです。
まとめ
本論文は、現在のAIエージェントにとっての問題は、世界で何が起きているかを理解できないことではないと結論づけています。彼らは推論(deduction)においては非常に優れています。問題は、正しい思考を正しい行動へと変換することが極めて難しいという点にあります。
AIは、「運河が閉鎖されており、もっと注文する必要があります」という完璧な文章を書くことができますが、その直後に、注文を少なすぎたり、遅すぎたり、あるいは解決策に対して高すぎるコストを支払ったりしてしまうのです。「知る・行うのギャップ」は実在します。これらのモデルは正しい信念を持つことはできますが、それを効果的な行動へとつなげることに失敗するのです。研究者たちは、この問題を解決するには、単に「より良く見える」賢いAIが必要なのではなく、その知識をいかに適切なコストを伴う行動へと翻訳させるかを教える、より優れた方法が必要であると示唆しています。
要するに、AIは盲目ではありません。ただ、手先が不器用なのです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。