← 最新の論文
🤖 AI

CoffeeBench: Benchmarking Long-Horizon LLM Agents in Heterogeneous Multi-Agent Economies

本論文は、異種混合のマルチエージェントによるコーヒー経済において、長期的な展望を持つLLMエージェントを評価するために設計されたベンチマークであるCoffeeBenchを紹介しており、ほとんどのモデルが積極的なコミュニケーションを通じて正の純利益を達成する一方で、一部のモデルは一貫した計画を立てているにもかかわらず「アイドル・ドリフト(停滞による逸脱)」のような特定の失敗モードを示すことを明らかにしている。

原著者: Issa Sugiura, Daichi Hattori, Kazuo Araragi, Keita Ogawa, Shota Onose, Taro Makino, Teppei Usuki, Takashi Ishida

公開日 2026-06-16
📖 1 分で読めます☕ さくっと読める

原著者: Issa Sugiura, Daichi Hattori, Kazuo Araragi, Keita Ogawa, Shota Onose, Taro Makino, Teppei Usuki, Takashi Ishida

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

巨大なデジタル・コーヒーショップ・シミュレーションが90日間実行されている世界を想像してみてください。この世界には、6つの独立した事業が存在します。豆を栽培する2人の農家、その豆をコーヒーへと加工する2人のロースター、そして最終的な一杯のコーヒーを顧客に販売する2人の小売業者です。

この論文は、AIエージェントが長期にわたって一つの事業をどれほど上手く運営できるかをテストするために設計された、新しい「テスト」であるCoffeeBenchを紹介しています。従来のテストとは異なり、AIは単に質問に答えたり、一つのゲームをプレイしたりするだけではありません。CoffeeBenchは、AIに対して、資金管理、商品の売買、他の事業との交渉、そして日々意思決定を行うといった、本物のCEOのように振る舞うことを強いています。

以下に、このテストがどのように機能し、研究者が何を発見したのかを、簡単な比喩を用いて解説します。

セットアップ:デジタルのコーヒー・チェーン

このシミュレーションを、ひねりの効いた複雑なリレー・レースだと考えてください。

  • プレイヤー: 2人の農家、2人のロースター、2人の小売業者がいます。彼らは互いに競い合っていますが、生き残るためには互いに取引を行う必要があります。
  • ゴール: テストされるAIはある特定の**ロースター(焙煎業者)**の役割を与えられます。その唯一の任務は、90日間でできるだけ多くの利益を上げることです。
  • 対戦相手: 他の5つの事業は、他のAIエージェント(または固定されたルール)によって運営されています。彼らもまた、独自の利益を上げようとしています。
  • ルール:
    • ただ座って待っていることはできません。生豆を買い、それを焙煎し、焙煎されたコーヒーを売らなければなりません。
    • 資金(お金を切らさないこと)、在庫(コーヒーを腐らせないこと)、そして価格を管理しなければなりません。
    • 他の事業と会話することができます。「20kgの豆を10ドルで買います」と言ったり、「ねえ、まとめ買い割引をしてくれないか?」と交渉したりできます。
    • もし現金が底をついたら、破産してゲームから追放されます。

テスト:AIの実績

研究者たちは、いくつかの異なるAIモデルをこのコーヒー経済の中で戦わせました。彼らは誰が最高の「ビジネスオーナー」になれるかを確認したかったのです。

1. 勝者(アクティブなマネージャー)
GPT-5.5Claude Opus 4.7のようなモデルが最も優れた成績を収めました。

  • 彼らがやったこと: 彼らは忙しく、おしゃべりな起業家のような存在でした。絶えず他の事業に連絡を取り、価格を交渉し、取引を行いました。ただ物事が起こるのを待つのではなく、サプライチェーンを積極的に管理しました。
  • 結果: 彼らは健全な利益(シミュレーション内で約3,000ドル)を上げました。

2. 「沈黙」のパフォーマー
Gemini 3.1 Proのようなモデルは、あまり多くは話しませんでしたが、そこそこの利益を上げました。

  • 彼らがやったこと: 彼らは効率的でしたが、反応的(リアクティブ)でした。他者からメッセージが来るのを待ち、それに応答していました。自分から会話を始めることはあまりありませんでしたが、それでも事業を継続させることはできました。

3. 敗者:「アイドル・ドリフト(停滞による漂流)」の失敗
Claude Haiku 4.5というモデルは、非常に奇妙な問題を抱えていました。

  • 問題点: これは、著者たちが**「アイドル・ドリフト(Idle Drift)」**と呼ぶ現象に陥ったものです。
  • 比喩: チェスのプレイヤーが盤の前に座り、非常に深く考え、紙に素晴らしい計画を書き留めるものの……何もせず、ただ座っている姿を想像してください。彼らは次の日が始まるのをただ待っているだけです。
  • 何が起きたのか: このAIはニュースを読み、市場を分析し、「すべて順調だ、素晴らしい計画がある」と言ったものの、90日間のうち40日間、全く何もしないことを選択しました。その推論自体は一貫していましたが、行動することを拒んだのです。
  • 結果: 何もしなかったために、彼らは資金を失い、シミュレーションを赤字で終えました。

論文の重要なポイント

  • 会話が重要: 最も成功したAIエージェントは、最も多くコミュニケーションを取っていたエージェントでした。複雑な経済においては、ただオフィスに座ってうまくいくのを期待することはできません。交渉し、関係を築かなければなりません。
  • 長期的な思考は難しい: 90日間ビジネスを運営することは、短距離走ではなくマラソンです。多くのAIは、時間が経過するにつれて混乱したり、怠慢になったりしました。
  • アクションが多い \neq お金が多い: AIが多くのツール呼び出し(価格チェックやメッセージ送信など)を行ったからといって、必ずしも利益を上げたわけではありません。アクションの「量」よりも、意思決定の「質」(例えば、良い価格で仕入れることなど)の方が重要でした。
  • 「アイドル(停滞)」のバグ: この論文は、「考えているだけで行動しない」というループに陥るという、特定の失敗モードを浮き彫りにしています。これは、長期的なタスクを実行する必要がある将来のAIにとって、極めて重要な課題です。

この論文が述べて「いない」こと

  • これらのAIが、明日から現実世界のコーヒー会社を運営できる準備ができているとは主張していません。
  • これが金融危機を解決したり、世界経済を変えたりすることを意味するわけでもありません。
  • AIがビジネスオーナーのように「意識」を持ったり「感情」を持ったりしていることを示唆しているわけではありません。それは単に、数値を最大化するように指示に従っているだけです。

要約すると: CoffeeBenchは、コーヒービジネスを運営することを目的とした、AIのためのビデオゲームです。勝者は、最も多く話し、最も多く行動した者たちでした。敗者は、考えすぎて行動が足りず、最終的に「何もしない」という状態へと漂流していった者たちでした。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →