APEX-Agents
本文介绍了 APEX-Agents 基准,这是一个由金融、咨询和法律专家构建的用于评估 AI 智能体在真实跨应用环境中执行长周期任务能力的评测集,并开源了包含 480 个任务的数据集及评估基础设施 Archipelago,同时展示了 Gemini 3 Flash 等模型在其中的表现。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
这篇论文介绍了一个名为 APEX–Agents 的新项目,你可以把它想象成给人工智能(AI)代理(Agent)举办的一场"职场终极生存挑战赛"。
为了让你更容易理解,我们把这篇论文的核心内容拆解成几个生动的部分:
1. 比赛背景:AI 真的能当“打工人”吗?
现在的 AI 很聪明,能写诗、能画画,但如果你让它像人类员工一样,去处理复杂的真实工作(比如投行分析师做财务模型、律师查合同、咨询师做市场策略),它行不行?
以前的测试就像是在“模拟考”里做简单的数学题,太假了。而 APEX–Agents 这次搞的是"全真模拟职场"。
2. 赛场设置:33 个“虚拟公司”
研究者(来自 Mercor 的人才平台)搭建了 33 个高度逼真的虚拟工作世界。
- 场景:有的像投行,有的像咨询公司,有的像律师事务所。
- 道具:每个世界里都有真实的“办公用品”——电子邮件、Excel 表格、PDF 文件、日历、聊天软件,甚至模拟的证券数据库。
- 任务:AI 需要像人类员工一样,在这些文件里翻找信息,写邮件,做表格,最后交出一份完美的报告。
比喻:这就好比给 AI 一个装满杂乱文件的办公室,然后说:“给你 2 小时,把这份关于某家公司的投资分析报告做出来,还要把 PPT 做好。”
3. 参赛选手:8 位"AI 实习生”
这次比赛邀请了 8 个顶尖的 AI 模型(包括 Google 的 Gemini、OpenAI 的 GPT、Anthropic 的 Claude 等)来参赛。
- 规则:每个 AI 要完成 480 个不同的任务。
- 评分标准:不是看它“大概做对没”,而是看它是否完美符合所有要求(Pass@1)。只要有一个小错误(比如小数点错了,或者漏了一个文件),就算失败。
4. 比赛结果:AI 还很“笨拙”
虽然这些 AI 都很先进,但结果让人有点意外:它们的表现远不如人类专家。
- 冠军:Gemini 3 Flash 拿了第一,但也只拿到了 24% 的通过率。
- 通俗解释:如果让 100 个这样的 AI 去处理 100 个复杂的金融任务,只有 24 个能一次性完美搞定。剩下的 76 个要么做错了,要么卡住了。
- 亚军:GPT-5.2 紧随其后,得分 23%。
- 垫底:开源模型(免费或社区开发的模型)表现很差,得分不到 5%。
关键发现:
- 不稳定:如果给 AI 8 次机会(Pass@8),它的成功率能提升到 36%-40%。这说明它们有能力做对,但经常发挥不稳定,像是一个偶尔能考满分但经常粗心大意的学生。
- 容易死循环:很多 AI 在遇到难题时,会陷入“死循环”,不停地重复做无用功,直到时间耗尽(超时)。
- 乱删文件:有些 AI 会不小心删掉重要文件,这是很危险的“职场事故”。
5. 为什么这么难?
论文指出,这些任务之所以难,是因为它们需要:
- 跨软件操作:要在邮件里找线索,去 Excel 算数据,再回邮件汇报。
- 长链条思考:一个任务可能需要分 10 步走,AI 很容易在第 3 步就迷路了。
- 真实环境:不像做数学题有标准答案,真实工作充满了模糊性和意外。
6. 这个研究有什么用?
- 开源了:研究者把这次比赛的所有题目、评分标准、甚至虚拟世界的文件都公开了。就像把“考卷”和“参考答案”发给了全世界,让其他科学家也能来测试和改进 AI。
- 基础设施:他们还开源了一个叫 Archipelago 的工具,就像是一个“虚拟办公室模拟器”,以后大家可以用它来训练 AI 如何更好地工作。
总结
这篇论文告诉我们:AI 离真正替代人类处理复杂的“白领工作”还有很长的路要走。
现在的 AI 就像是一个才华横溢但缺乏经验的实习生:它懂很多知识,也能做很多事,但在面对真实、复杂、需要多步骤协作的职场任务时,它经常犯错、迷路或效率低下。
不过,这次比赛提供了一个极好的“训练场”和“体检报告”,帮助开发者知道 AI 哪里不行,从而在未来让它们真正成为得力的“职场助手”。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。