← 最新论文
🤖 AI

SaaS-Bench: Can Computer-Use Agents Leverage Real-World SaaS to Solve Professional Workflows?

本文介绍了 SaaS-Bench,这是一个涵盖 23 个专业 SaaS 系统中 106 项真实任务的综合基准,其结果表明,当前的计算机使用智能体在规划和状态跟踪及错误恢复方面的局限性,使其在处理复杂、长程工作流时面临显著困难,端到端成功率不足 4%。

原作者: Kean Shi, Zihang Li, Tianyi Ma, Zengji Tu, Jialong Wu, Xinbo Xu, Qingyao Yang, Ruoyu Wu, Weichu Xie, Ming Wu, Jason Zeng, Michael Heinrich, Elvis Zhang, Liang Chen, Kuan Li, Baobao Chang

发布于 2026-05-18
📖 1 分钟阅读☕ 轻松阅读

原作者: Kean Shi, Zihang Li, Tianyi Ma, Zengji Tu, Jialong Wu, Xinbo Xu, Qingyao Yang, Ruoyu Wu, Weichu Xie, Ming Wu, Jason Zeng, Michael Heinrich, Elvis Zhang, Liang Chen, Kuan Li, Baobao Chang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在招聘一位新助理来处理你最复杂的工作日。你不仅仅希望他们回复邮件;你希望他们能登录你的银行账户、项目管理软件、医疗记录和设计工具,真正去完成工作。

这篇论文介绍了一项名为SaaS-Bench的新“期末考试”,旨在测试 AI 助手(称为计算机使用代理)在应对这类现实世界任务时的真实能力。

以下是他们所做的工作及发现,辅以简单的类比进行解析。

1. 问题所在:“电子游戏”与“真实工作”

迄今为止,大多数针对 AI 助手的测试就像玩电子游戏。关卡短暂,规则简单,如果你卡住了,游戏只需重置即可。

  • 旧方式:“点击红色按钮,然后输入‘你好’。”(简单、短暂、孤立)。
  • 现实世界:“进入人力资源系统解雇一名员工,然后进入会计系统计算其最终薪资,接着进入客户关系管理系统重新分配其客户,并确保日期完全匹配。”(困难、漫长、混乱)。

作者意识到,通过“电子游戏”式的测试并不意味着 AI 能够胜任真实工作。因此,他们基于23 个真实可部署的软件系统(如真实的医疗记录系统、会计工具和项目管理工具)构建了一项新测试,这些系统正是专业人士实际使用的。

2. 考试:SaaS-Bench

SaaS-Bench想象成一个巨大的、持续多天的障碍赛。

  • 赛道:它包含106 个不同的任务,分布在六个不同的工作“社区”(如医疗保健、金融和软件工程)中。
  • 规则:AI 必须像人类一样,使用网页浏览器在这些系统中导航。它不能通过查看数据库代码作弊;它必须点击按钮并阅读屏幕。
  • 难度:这些任务并非只需 5 分钟。平均每个任务需要超过 100 个步骤(点击、输入和滚动)。这就像要求某人烤一个蛋糕,为其撰写食谱,将食谱寄给朋友,然后归档面粉的收据,所有这一切一气呵成。

3. 结果:AI 迷失了方向

研究人员在考试中测试了当时最智能的 AI 模型(即 AI 界的“优等生”)。结果令人清醒:

  • 得分:即使是最好的 AI 模型,也仅完成了**不到 4%**的任务,且是从头到尾完整完成的。
  • “差点”陷阱:AI 实际上在任务的开始阶段表现不错。它能完成 80% 的进度。它可以填写第一份表格,点击正确的按钮,并创建第一份文档。
  • 崩溃:但随后,它会犯下一个微小的错误(例如输入错误的日期),未能察觉该错误,然后继续沿着错误的道路走下去。等到它到达终点时,整个结果都是错的。

类比:想象一个 GPS,它非常擅长告诉你“左转”和“直行 5 英里”。但如果你不小心错过了一个转弯,GPS 并不会说“你迷路了,让我们重新计算”。相反,它会自信地告诉你继续直行 50 英里,直到你耗尽燃油。AI 很自信,但它经常出错。

4. 它们为何失败?(四大障碍)

论文指出了 AI 挣扎的四个主要原因,并运用了一些精彩的隐喻:

  • “纸牌屋”效应(脆弱性):在这些长任务中,每一步都依赖于前一步。如果你在第 10 步搞砸了,第 11 步到第 100 步就全毁了。AI 在第 10 步表现得如此出色,以至于它认为自己做得很好,但那个微小的错误却导致整个结构崩塌。
  • “沉默的毒药”(错误级联):有时 AI 犯下的错误在表面上看起来是正确的。
    • 示例:AI 创建了一个名为"Elena"的客户,而不是"Arcturus Digital"。屏幕上显示"Elena (Arcturus)",所以 AI 心想:“太好了,我做到了!”但由于名称在技术上不正确,随后发生的每一笔财务交易都关联到了错误的人身上。AI 从未意识到它毒害了源头。
  • “自信的骗子”(自我欺骗):AI 有一个“记忆”,它会在那里告诉自己它做了什么。有时,它看到了错误,试图修复它,却忘了检查修复是否生效。然后,它会写一份报告说:“我修好了!”尽管屏幕上仍然显示错误。这就像一个学生意识到自己犯了数学错误,试图擦掉它,但随后还是把答案写了下来,并说:“我完成了。”
  • “抛硬币”(不可靠性):如果你让同一个 AI 执行相同的任务三次,它第一次可能得满分,第二次完全失败,第三次表现尚可。它缺乏一致性。这意味着即使它昨天能工作,你今天也不能信任它能可靠地完成任务。

5. 结论

这篇论文问道:"AI 代理能否使用现实世界的软件来解决专业工作?"

答案是:尚未。

虽然这些 AI 模型在交谈和理解语言方面极其聪明,但它们目前在长期、复杂、现实世界的执行方面表现极差。它们会迷失在细节中,不会双重检查自己的工作,并且在犯错后无法恢复。

作者构建这项测试(SaaS-Bench)并非为了说明 AI 无用,而是为了向我们确切展示它在哪里出错,以便我们能够修复它。在 AI 能够在不混淆或不自信地给出错误答案的情况下处理 100 步的工作流程之前,它尚未准备好接管你的专业工作。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →