← 最新论文
💻 computer science

CEO-Bench: Can Agents Play the Long Game?

该论文介绍了 CEO-Bench,这是一个通过模拟创业公司 500 天的运营,来评估语言模型智能体应对长周期、不确定且多噪声的真实世界商业挑战能力的创新基准测试,研究揭示了即使是最先进的模型也难以持续实现盈利。

原作者: Haozhe Chen, Karthik Narasimhan, Zhuang Liu

发布于 2026-06-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Haozhe Chen, Karthik Narasimhan, Zhuang Liu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你雇佣了一个才华横溢、智力超群的机器人来经营一家初创公司。你给了它一百万美元、一台笔记本电脑,以及一套可以管理从定价、营销到研究和客户支持等所有事务的工具。你的目标?让这家公司在 500 天内保持生存并实现盈利。

这正是 CEO-BENCH 论文所测试的内容。研究人员创建了一个名为“NovaMind”的、类似于真实视频游戏的初创公司模拟环境,以观察当今最先进的 AI 智能体是否能够处理作为 CEO 那种漫长、混乱且充满不确定性的工作。

以下是他们所做工作的详细分解,使用了简单的类比:

1. 这场游戏:一场 500 天的马拉松

以往大多数针对 AI 的测试都像是短跑比赛。它们要求 AI 快速完成一项特定任务,比如“修复这段损坏的代码”或“写一封电子邮件”。AI 会得到一个明确的目标,采取行动,并获得即时反馈。

而 CEO-BENCH 是一场在迷雾森林中的马拉松

  • 迷雾: AI 无法看到一切。它不知道客户到底有多满意,也不知道竞争对手在计划什么。它必须根据线索(如社交媒体上的投诉或销售数据)进行推测。
  • 迷雾中的路径: 决策需要很长时间才能产生回报。如果你今天在研究上投入资金,可能要几周后才能看到更好的产品。如果你降低价格,现在可能会获得更多客户,但以后可能会亏损。
  • 移动的目标: 森林在变化。竞争对手变得更聪明,经济发生位移,客户口味也在改变。AI 必须在奔跑的同时不断调整它的地图。

2. 工具:一把瑞士军刀

AI 不仅仅是在交谈,它还必须动手去做。它通过一个计算机终端进行操作,在那里它可以:

  • 编写代码来分析海量的电子表格(SQL 数据库)。
  • 为不同的产品设定价格。
  • 购买广告位。
  • 与大型企业客户进行谈判。
  • 在社交媒体上发帖以修复声誉。

这就像是给飞行员一架拥有 34 个不同控制装置的飞机。AI 必须弄清楚该拉动哪个杠杆,何时拉动,以及这些杠杆如何相互影响。

3. 结果:大多数 AI 坠毁了

研究人员用世界上最聪明的 AI 模型(如 GPT-5.5、Claude Opus 等)运行了这个模拟过程。结果令人警醒:

  • “破产”率: 大多数 AI 智能体在 500 天结束前就耗尽了资金并宣告破产。它们就像那些只顾踩油门而不检查油表的司机。
  • 幸存者: 只有两个模型——Claude Opus 4.8GPT-5.5——成功完成了比赛,并且赚到的钱比初始资金还要多。
  • 现实的检验: 即便是赢家也没能大富大贵。它们的最终收益约为 2000 万至 2700 万美元,但研究人员计算出,一个完美的策略本可以赚取超过 20 亿美元。这意味着即使是最优秀的 AI,仍然缺失了真正商业策略中的“秘诀”。

4. 赢家是如何做到的

论文仔细研究了这些获胜 AI 的思考方式。他们发现赢家与输家之间有三个关键区别:

  • 他们是侦探: 赢家不是靠猜测,而是通过编写代码来挖掘数据。他们查看过去的谈判记录,以弄清楚客户愿意支付多少钱,尽管 AI 并没有被直接告知这一点。
  • 他们是预言家: 赢家会在脑海中进行自己的“微型模拟”。在做出重大举措之前,他们会编写代码来询问:“如果我执行 X,4 周后会发生什么?”这帮助他们避开了陷ets(陷阱)。
  • 他们具有适应性: 当游戏中的“竞争对手”变得强大时,赢家会迅速察觉并改变策略。而输家则会一直重复同样的行为,直到崩溃。

5. “基于规则”的基准线

有趣的是,研究人员还测试了一个遵循基本规则(例如“始终将价格保持在 10 美元”)的简单、愚笨的计算机程序。这个简单的程序赚了 1500 万美元

  • 教训: 最好的 AI 模型也仅仅是勉强超过了一个简单的、遵循规则的脚本。这表明,虽然 AI 非常擅长执行指令,但在处理经营一家真实公司所需的复杂、长期思考方面,仍然表现挣扎。

核心结论

CEO-BENCH 敲响了警钟。它表明,虽然 AI 智能体在短期任务(如修复单个拼写错误)方面正变得非常出色,但在长期战略(如带领公司度过 500 天的风暴)方面仍然表现糟糕。

论文得出结论,要构建真正实用的 AI,我们需要超越测试它们能否“完成一项任务”,转而开始测试它们是否能在嘈杂、多变且充满隐藏惊喜的世界中“玩好长线游戏”。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →