← 最新の論文
🤖 AI

YC-Bench\texttt{YC-Bench}: Benchmarking AI Agents for Long-Term Planning and Consistent Execution

LLM エージェントの長期的な計画と一貫した実行能力を評価するため、1 年間のシミュレーションスタートアップ運営を通じて複数のモデルをテストしたベンチマーク「YC-Bench」を提案し、その結果、コンテキストの断絶を越えた情報保持(スクラッチパッドの使用)が成功の決定的要因であり、敵対的クライアントの検知失敗が破産の主要因であることを明らかにしました。

原著者: Muyu He, Adit Jain, Anand Kumar, Vincent Tu, Soumyadeep Bakshi, Sachin Patro, Nazneen Rajani

公開日 2026-04-02
📖 1 分で読めます☕ さくっと読める

原著者: Muyu He, Adit Jain, Anand Kumar, Vincent Tu, Soumyadeep Bakshi, Sachin Patro, Nazneen Rajani

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

この論文は、**「AI が長期的な計画を立てて、本当に現実世界で生き残れるか?」**という問いに答えるための新しいテスト「YC-Bench」について紹介しています。

まるで、AI に「1 年間、スタートアップ企業の社長になってください」というミッションを与えたような実験です。

以下に、難しい専門用語を使わず、日常の例え話を使って解説します。


🏢 実験の舞台:AI 社長と「1 年間の起業ゲーム」

このテストでは、AI に**「20 万ドル(約 3000 万円)の資金」**を与え、1 年間(数百回のターン)にわたって会社を運営させます。

  • やること: 市場から仕事(タスク)を選び、社員に仕事を割り当て、給料を払い、利益を最大化すること。
  • 難易度: 非常に高いです。
    • 見えない敵: 市場には「悪徳クライアント」が潜んでいます。彼らは高報酬を提示しますが、実際には**「不可能な量の作業」**を押し付けてきます。AI は失敗を繰り返しながら「あ、この人は嘘つきだ」と学習し、避ける必要があります。
    • 記憶の限界: AI の「短期記憶(会話履歴)」はすぐに消えてしまいます(20 回分だけ)。そのため、**「メモ帳(スクラッチパッド)」**を使って、重要な情報(誰が悪徳クライアントか、誰が優秀な社員か)を書き留め続けないと、同じ失敗を繰り返して破産してしまいます。

🧪 結果:誰が生き残ったのか?

12 種類の最新の AI モデル(GPT-5.4 や Claude Opus 4.6 など)に挑戦させましたが、結果は**「半分以下が破産」**という厳しいものでした。

  • 勝ち組(3 社): 資金を 20 万ドルから 100 万ドル以上(5 倍〜6 倍)に増やした AI が 3 社だけいました。
    • 一位: 「Claude Opus 4.6」が 127 万ドルまで増やしました。
    • 二位: 「GLM-5」が 121 万ドル。驚くべきことに、このモデルは**「Claude の 11 分の 1」のコスト**で同じ成果を出しました。
  • 負け組: 残りの 9 社は、資金が減り続け、破産したり、スタート時の金額以下で終わったりしました。

💡 なぜ勝ったのか?負けたのか?(3 つの教訓)

1. 「メモ帳」を使えるかが命取り

勝った AI の共通点は、「メモ帳(スクラッチパッド)」を賢く使っていたことです。

  • 例え話: 長距離運転で、道順を頭の中で覚えるのは大変です。勝った AI は「あ、この道は渋滞するぞ」「このガソリンスタンドは高いぞ」と手帳に書き留めて、後で振り返って同じ失敗をしないようにしました。
  • 敗因: 負けた AI はメモ帳を使わなかったり、使い方が下手だったりして、「あ、このクライアントは嘘つきだったな」と気づいても、数ターン後に忘れてしまい、また同じ契約を結んで破産しました。

2. 「悪徳クライアント」を見抜く力

市場には「報酬は高いけど、実は作業量が膨大すぎる」罠があります。

  • 勝った AI: 「あ、この人は 3 回連続で失敗したな。もう二度と契約しない」と**リスト(ブラックリスト)**を作って徹底排除しました。
  • 負けた AI: 「報酬が高いからとりあえず受けてみる」と、罠にはまり続け、破産しました。

3. 「考える」と「行動する」のギャップ

面白いことに、**「正しい戦略を考えているのに、実行できない AI」**が多かったです。

  • 例え話: 社長が「来月は赤字になるから、無駄な出費を止めよう!」とメモに書いていても、翌日には「あ、でもこの仕事も受けておこう」とメモを無視して行動してしまうような状態です。
  • 失敗モード: 「悪徳クライアントを避ける」とメモに書いていても、実際に契約ボタンを押してしまう。この「思考と行動の不一致」が多くの AI の弱点でした。

📊 結論:AI はまだ「長期的な知恵」が足りない

この実験からわかったことは、**「最新の AI は、複雑な長期的な計画を立てて、一貫して実行するのはまだ苦手」**ということです。

  • 短期戦は得意: すぐに答えが出る簡単な問題なら最強です。
  • 長期戦は苦手: 1 年かけて戦略を練り、失敗から学び、記憶を維持し続けるような「人生のゲーム」になると、多くの AI は破綻してしまいます。

しかし、**「メモ帳を上手に使うこと」「コストパフォーマンス(GLM-5 のようなモデル)」**を重視すれば、すでに実用的なレベルに近づいていることも示されました。

🚀 まとめ

この論文は、AI に「ただの計算機」ではなく、「長期的な戦略家」としての能力を問うテストを作りました。
今の AI は、**「メモ帳を使えば賢くなるが、まだ『考えていること』と『やっていること』が一致していない」**という、人間の子供のような成長過程にあることがわかりました。

今後は、この「YC-Bench」というテストを使って、より賢く、破産しない AI を作っていくことが期待されています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →