← 最新论文
🤖 AI

AutomationBench

该论文提出了 AutomationBench,这是一个基于 Zapier 真实工作流模式构建的基准测试,旨在评估 AI 代理在跨应用 REST API 编排中自主发现端点、遵循复杂业务策略及确保最终数据正确性的能力,而当前最先进模型在此类真实业务场景下的得分仍低于 10%。

原作者: Daniel Shepard, Robin Salimans

发布于 2026-04-22
📖 1 分钟阅读☕ 轻松阅读

原作者: Daniel Shepard, Robin Salimans

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一个名为 AutomationBench(自动化基准测试) 的新工具。为了让你更容易理解,我们可以把现在的 AI 想象成一群刚入职的超级实习生,而这篇论文就是给这些实习生设计的一场极其严苛的“职场生存大考”。

以下是用通俗语言和比喻对这篇论文的解读:

1. 为什么要搞这个考试?(背景与痛点)

以前的 AI 考试(基准测试)有点像在考“单科状元”:

  • 有的考你能不能在网页上点来点去(像 WebArena);
  • 有的考你能不能调用几个固定的工具(像 ToolBench)。

但这就像只考实习生“怎么打字”或“怎么查字典”,却没考他们“怎么把整个项目跑通”。

在现实工作中,一个任务往往需要跨部门协作:

比如老板说:“把那个客户的会议改期,如果冲突了,按公司规定优先保大客户的会,然后发邮件通知,再在日历上更新,最后发个 Slack 消息给团队。”

这需要 AI 同时操作:CRM 系统(客户信息)、邮箱、日历、Slack 等多个软件。以前的考试没考过这种“连环套”任务。现在的 AI 虽然聪明,但在这种复杂的“多软件接力赛”里,表现非常差,甚至最好的 AI 也考不到 10 分(满分 100)。

2. 这个考试考什么?(AutomationBench 的核心)

这个考试模拟了一个充满陷阱的虚拟办公室,里面有 6 个部门(销售、市场、运营、支持、财务、HR)和 47 个不同的软件应用。

考试规则非常“魔鬼”:

  • 没有说明书(自主发现): 考试不给 AI 具体的 API 接口文档。AI 必须像侦探一样,自己搜索、试错,找出哪个软件里有它需要的功能。
  • 遵守潜规则(政策遵循): 任务里会夹杂公司的“内部规定”(比如“遇到这种情况必须优先处理 VIP")。AI 不能只凭直觉,必须读懂这些规则。
  • 全是干扰项(抗干扰): 数据库里塞满了假数据、过期的记录和误导性的信息。AI 得像老练的会计一样,一眼看出哪个是真实的,哪个是假的。
  • 只看结果(结果导向): 不管 AI 中间折腾了多少步,也不管它是不是绕了远路,只看最后数据对不对。
    • 比喻: 就像你让实习生去超市买牛奶。不管他是开车去的、骑单车去的,还是顺便买了包薯片,只要最后你手里拿到了牛奶,就算及格。但如果牛奶买错了牌子,或者根本没买,那就是不及格。

3. 考试有多难?(现状与结果)

论文里展示了一个令人震惊的排行榜(Leaderboard):

  • 目前的“最强大脑”: 即使是像 Opus 4.7、Gemini 3.1 Pro 这样顶尖的 AI 模型,在这个考试里的得分也不到 10%。
  • 差距巨大: 它们擅长的任务完全不同。比如 Opus 做对了 A 题,Gemini 可能完全做不对;Gemini 做对了 B 题,Opus 又懵了。这说明它们还没掌握通用的“职场生存技能”。
  • 常见翻车现场:
    • 盲目自信: 90% 的失败是因为 AI 觉得自己做完了,其实根本没做完(比如以为邮件发了,其实没发)。
    • 丢三落四: 任务要求处理 12 封邮件,它只处理了 10 封,然后假装全部搞定。
    • 指鹿为马: 找不到数据时,就瞎编一个或者去错误的地方找。

4. 这个考试有什么用?(意义)

这就好比给 AI 行业立了一个新的“高考”标准。

  • 不再忽悠: 以前 AI 可能只会做简单的单步任务,现在这个考试逼着它们学会真正的“多步推理”和“跨系统协作”。
  • 指明方向: 它告诉科学家和开发者:现在的 AI 离真正能帮人类处理复杂工作(比如自动处理报销、自动安排会议)还有很长的路要走。
  • 真实模拟: 它不是用假数据瞎编,而是基于 Zapier(一家自动化公司)真实的客户工作流设计的,所以非常接地气。

5. 总结

AutomationBench 就像是一个高难度的“职场模拟游戏”。
现在的 AI 就像是一群只会背书本、但没上过班的学霸。它们能背下所有公式,但一旦把它们扔进一个需要同时操作 5 个软件、还要遵守复杂公司规定的真实办公室,它们就手忙脚乱,甚至经常“装傻充愣”。

这篇论文的目的就是把 AI 扔进这个真实的“职场”里摔打,看看它们到底能不能学会像人类员工一样,独立、准确、守规矩地完成复杂的跨部门任务。目前的结论是:它们还差得远,但这正是未来需要努力的方向。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →