← 最新の論文
💻 computer science

CEO-Bench: Can Agents Play the Long Game?

本論文は、スタートアップの運営を500日間にわたってシミュレートすることで、言語モデルエージェントが長期的な展望、不確実性、およびノイズの多い現実世界のビジネス上の課題を乗り越える能力を評価する新しいベンチマークであるCEO-Benchを紹介しており、最先端のモデルであっても一貫して収益性を達成することに苦慮していることを明らかにしている。

原著者: Haozhe Chen, Karthik Narasimhan, Zhuang Liu

公開日 2026-06-19
📖 1 分で読めます☕ さくっと読める

原著者: Haozhe Chen, Karthik Narasimhan, Zhuang Liu

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたが、あるスタートアップ企業を運営するために、極めて優秀で超知能を持つロボットを雇ったと想像してください。あなたは、そのロボットに100万ドル、ノートパソコン、そして価格設定からマーケティング、リサーチ、カスタマーサポートに至るまで、あらゆる業務を管理するためのツール一式を与えました。あなたの目的は?その会社を500日間、存続させ、かつ利益を出させることです。

これこそが、論文「CEO-BENCH」がテストしている内容です。研究者たちは、「NovaMind」というスタートアップのリアルなビデオゲームのようなシミュレーションを作成し、今日の最先端のAIエージェントが、CEOという長く、混沌とし、不確実な仕事をこなせるかどうかを検証しました。

以下に、彼らが何を行い、何を見出したのかを、簡単な比喩を用いて解説します。

1. ゲーム:500日のマラソン

これまでのAIテストの多くは、短距離走のようなものでした。AIに対して、「この壊れたコードを修正せよ」や「メールを書け」といった、特定のタスクを素早く実行させるものでした。AIには明確な目標が与えられ、行動し、即座にフィードバックが得られます。

一方、CEO-BENCHは、霧の立ち込める森の中でのマラソンです。

  • 霧: AIはすべてを見通せるわけではありません。顧客がどれほど満足しているか、あるいは競合他社が何を計画しているのかを正確には知りません。SNSでの苦情や売上データといった「手がかり」をもとに、推測しなければなりません。
  • 霧の中の道: 意思決定が成果として現れるまでには時間がかかります。今日、研究開発にお金を使えば、より良い製品が出るのは数週間後かもしれません。価格を下げれば、今すぐ顧客は増えるかもしれませんが、後で赤字になるかもしれません。
  • 動く標的: 森は変化し続けます。競合は賢くなり、経済状況は変わり、顧客の好みも変化します。AIは走りながら、常に地図を更新し続けなければなりません。

2. ツール:スイスアーミーナイフ

AIはただ言葉を発するだけでなく、実行しなければなりません。AIはコンピュータ・ターミナルを通じて操作を行います。

  • 大規模なスプレッドシート(SQLデータベース)を分析するためのコードを書く。
  • さまざまな製品の価格を設定する。
  • 広告枠を購入する。
  • 大手法人顧客との交渉を行う。
  • 評判を回復するためにSNSに投稿する。

これは、パイロットに34種類のコントロールレバーを備えた飛行機を渡すようなものです。AIは、どのレバーを、いつ引き、それらが互いにどのように影響し合うのかを理解しなければなりません。

3. 結果:ほとんどのAIがクラッシュした

研究者たちは、世界最高峰のAIモデル(GPT-5.5、Claude Opusなど)を用いてこのシミュレーションを実行しました。その結果は、非常に厳しいものでした。

  • 「倒産」率: ほとんどのAIエージェントは、500日が経過する前に資金が底をつき、倒産しました。彼らは、燃料計を確認せずにアクセルを踏み続けているドライバーのようでした。
  • 生存者: わずか2つのモデル、Claude Opus 4.8GPT-5.5だけが、開始時よりも多くの資金を持ってレースを完走しました。
  • 現実とのギャップ: 勝者といえども、大富豪になったわけではありません。彼らは最終的に約2,000万〜2,700万ドルを手に入れましたが、研究者が計算したところ、完璧な戦略をとっていれば20億ドル以上の利益を得られていたはずでした。これは、最高のAIであっても、真のビジネス戦略に必要な「秘伝のソース」がいまだに欠けていることを意味しています。

4. 勝者はどのようにして勝ち抜いたのか

論文では、勝ったAIがどのように思考したかを詳しく分析しています。勝者と敗者の間には、3つの決定的な違いがあることがわかりました。

  • 探偵であった: 勝者は単に推測するのではなく、データを掘り下げるためのコードを書いていました。過去の交渉記録を調べ、顧客がいくらなら支払う意思があるのかを、直接教えられなくても導き出していました。
  • 予言者であった: 勝者は、頭の中で独自の「ミニ・シミュレーション」を実行していました。大きな施策を打つ前に、「もしXを行ったら、4週間後にどうなるか?」と問いかけるコードを書いていました。これにより、罠を回避することができました。
  • 適応力があった: ゲーム内の「競合」が強くなると、勝者はすぐにそれに気づき、戦略を変更しました。敗者は、クラッシュするまで同じことを繰り返していました。

5. 「ルールベース」の基準値

興味深いことに、研究者たちは「常に価格を10ドルに保つ」といった基本的なルールに従うだけの、単純で愚かなコンピュータ・プログラムもテストしました。この単純なプログラムは1,500万ドルを稼ぎ出しました。

  • 教訓: 最良のAIモデルは、この単純で愚かなルールに従うだけのスクリプトを辛うじて上回ったに過ぎませんでした。これは、AIが指示に従うことには長けていても、実際のビジネスを運営するために必要な複雑で長期的な思考においては、依然として苦戦していることを示しています。

結論

CEO-BENCHは、私たちへの警鐘です。AIエージェントは、短期的なタスク(タイポの修正など)には非常に長けてきていますが、長期的な戦略(500日の嵐の中で会社を操縦することなど)については、依然として非常に拙いことが示されました。

論文は次のように結論づけています。真に有用なAIを構築するためには、「タスクを遂行できるか」をテストする段階を超え、ノイズが多く、変化が激しく、隠れたサプライズに満ちた世界で、「長期的なゲームを戦い抜けるか」をテストする必要があるのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →