← 最新论文
💬 NLP

APEX-Agents

本文介绍了 APEX-Agents 基准,这是一个由金融、咨询和法律专家构建的用于评估 AI 智能体在真实跨应用环境中执行长周期任务能力的评测集,并开源了包含 480 个任务的数据集及评估基础设施 Archipelago,同时展示了 Gemini 3 Flash 等模型在其中的表现。

原作者: Bertie Vidgen, Austin Mann, Abby Fennelly, John Wright Stanly, Lucas Rothman, Marco Burstein, Julien Benchek, David Ostrofsky, Anirudh Ravichandran, Debnil Sur, Neel Venugopal, Alannah Hsia, Isaac Rob
发布于 2026-02-24
📖 1 分钟阅读☕ 轻松阅读

原作者: Bertie Vidgen, Austin Mann, Abby Fennelly, John Wright Stanly, Lucas Rothman, Marco Burstein, Julien Benchek, David Ostrofsky, Anirudh Ravichandran, Debnil Sur, Neel Venugopal, Alannah Hsia, Isaac Robinson, Calix Huang, Olivia Varones, Daniyal Khan, Michael Haines, Austin Bridges, Jesse Boyle, Koby Twist, Zach Richards, Chirag Mahapatra, Brendan Foody, Osvald Nitski

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一个名为 APEX–Agents 的新项目,你可以把它想象成给人工智能(AI)代理(Agent)举办的一场"职场终极生存挑战赛"。

为了让你更容易理解,我们把这篇论文的核心内容拆解成几个生动的部分:

1. 比赛背景:AI 真的能当“打工人”吗?

现在的 AI 很聪明,能写诗、能画画,但如果你让它像人类员工一样,去处理复杂的真实工作(比如投行分析师做财务模型、律师查合同、咨询师做市场策略),它行不行?

以前的测试就像是在“模拟考”里做简单的数学题,太假了。而 APEX–Agents 这次搞的是"全真模拟职场"。

2. 赛场设置:33 个“虚拟公司”

研究者(来自 Mercor 的人才平台)搭建了 33 个高度逼真的虚拟工作世界

  • 场景:有的像投行,有的像咨询公司,有的像律师事务所。
  • 道具:每个世界里都有真实的“办公用品”——电子邮件、Excel 表格、PDF 文件、日历、聊天软件,甚至模拟的证券数据库。
  • 任务:AI 需要像人类员工一样,在这些文件里翻找信息,写邮件,做表格,最后交出一份完美的报告。

比喻:这就好比给 AI 一个装满杂乱文件的办公室,然后说:“给你 2 小时,把这份关于某家公司的投资分析报告做出来,还要把 PPT 做好。”

3. 参赛选手:8 位"AI 实习生”

这次比赛邀请了 8 个顶尖的 AI 模型(包括 Google 的 Gemini、OpenAI 的 GPT、Anthropic 的 Claude 等)来参赛。

  • 规则:每个 AI 要完成 480 个不同的任务。
  • 评分标准:不是看它“大概做对没”,而是看它是否完美符合所有要求(Pass@1)。只要有一个小错误(比如小数点错了,或者漏了一个文件),就算失败。

4. 比赛结果:AI 还很“笨拙”

虽然这些 AI 都很先进,但结果让人有点意外:它们的表现远不如人类专家

  • 冠军Gemini 3 Flash 拿了第一,但也只拿到了 24% 的通过率。
    • 通俗解释:如果让 100 个这样的 AI 去处理 100 个复杂的金融任务,只有 24 个能一次性完美搞定。剩下的 76 个要么做错了,要么卡住了。
  • 亚军:GPT-5.2 紧随其后,得分 23%。
  • 垫底:开源模型(免费或社区开发的模型)表现很差,得分不到 5%。

关键发现

  • 不稳定:如果给 AI 8 次机会(Pass@8),它的成功率能提升到 36%-40%。这说明它们有能力做对,但经常发挥不稳定,像是一个偶尔能考满分但经常粗心大意的学生。
  • 容易死循环:很多 AI 在遇到难题时,会陷入“死循环”,不停地重复做无用功,直到时间耗尽(超时)。
  • 乱删文件:有些 AI 会不小心删掉重要文件,这是很危险的“职场事故”。

5. 为什么这么难?

论文指出,这些任务之所以难,是因为它们需要:

  1. 跨软件操作:要在邮件里找线索,去 Excel 算数据,再回邮件汇报。
  2. 长链条思考:一个任务可能需要分 10 步走,AI 很容易在第 3 步就迷路了。
  3. 真实环境:不像做数学题有标准答案,真实工作充满了模糊性和意外。

6. 这个研究有什么用?

  • 开源了:研究者把这次比赛的所有题目、评分标准、甚至虚拟世界的文件都公开了。就像把“考卷”和“参考答案”发给了全世界,让其他科学家也能来测试和改进 AI。
  • 基础设施:他们还开源了一个叫 Archipelago 的工具,就像是一个“虚拟办公室模拟器”,以后大家可以用它来训练 AI 如何更好地工作。

总结

这篇论文告诉我们:AI 离真正替代人类处理复杂的“白领工作”还有很长的路要走

现在的 AI 就像是一个才华横溢但缺乏经验的实习生:它懂很多知识,也能做很多事,但在面对真实、复杂、需要多步骤协作的职场任务时,它经常犯错、迷路或效率低下。

不过,这次比赛提供了一个极好的“训练场”和“体检报告”,帮助开发者知道 AI 哪里不行,从而在未来让它们真正成为得力的“职场助手”。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →