← 最新论文
🤖 AI

WorkBench Revisited: Workplace Agents Two Years On

本文在 WorkBench 基准测试首次评估两年后对其进行了重新审视,证明了像 Claude Opus 4.8 这样的前沿智能体已经实现了显著更高的任务完成率(89% 对比 43%)并大幅降低了有害错误率(2.5% 对比 26%),同时表明能力与安全性在同步提升,开源权重模型使高性能访问变得民主化,且某些会导致不可逆伤害的基础错误类型依然存在。

原作者: Olly Styles

发布于 2026-06-15
📖 1 分钟阅读☕ 轻松阅读

原作者: Olly Styles

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

WorkBench 想象成一个巨大的、模拟的办公游乐场。在这个游乐场内部,有数字版的日历、电子邮箱收件箱、客户名单和一个项目看板。这项研究的目标是测试 AI“智能体”(聪明的计算机程序)在扮演人类员工时的表现如何:阅读邮件、安排会议以及修复客户记录,且不出差错。

作者决定在第一次开放这个游乐场两年后,再次对其进行检查。以下是他们的发现,通过简单的语言进行了解释:

1. “前后对比”照

2024 年(过去):
当时最优秀的 AI(GPT-4)就像一个非常热心但笨手笨脚的实习生。在 690 项任务中,它仅完成了 43%。更糟糕的是,当它试图提供帮助时,大约有 26% 的情况会意外造成麻烦(比如给错误的人发邮件)。它虽然很努力,但经常感到困惑或造成危险。

2026 年(现在):
作者使用最新的 AI 模型重新运行了测试。其中的佼佼者(Claude Opus 4.8)就像一位已经在岗位上工作多年的资深高管。它完成了 89% 的任务。更令人印象深刻的是,它仅在 2.5% 的案例中造成了意外伤害。它不仅速度更快,而且更加安全。

2. 大惊喜:安全与技能并行

通常,我们会认为如果让机器人变得更快或更聪明,它可能会变得更加鲁莽。这篇论文指出,对于这些 AI 智能体来说,事实并非如此。

  • 类比: 把这想象成一辆赛车。在过去,最快的车往往也是最容易发生碰撞的车。而现在,最快的车同时也拥有最好的刹车和安全功能。完成任务最多的模型,同时也正是犯错最少的模型。

3. “开源模型”的魔力

论文强调了谁在赢得这场竞赛方面发生的巨大转变。

  • 旧方式: 只有昂贵的、“专有”的模型(例如来自大型科技公司的模型)才能出色地完成工作。
  • 新方式: “开源权重”模型(类似于任何人都可以下载并改进的开源软件)现在的表现已经不相上下,但成本却仅为一小部分。
  • 隐喻: 想象一下,你原本需要一辆豪华轿车才能横跨全国。现在,你可以从另一家制造商那里得到一辆全新的、高性能的电动汽车,其运行成本仅为原来的百分之一,而且能带你去同样的目的地。论文指出,目前性能达标的最便宜 AI 来自中国的开源实验室,而绝对最强大的模型仍然是西方的专有模型。

4. 测试本身发生了什么变化?

作者承认他们在 2024 年的原始测试中犯了一些错误。这就像是在批改一份答案解析中有错别字的数学试卷。

  • 修正: 他们纠正了规则。例如,他们修复了一个 Bug:原先测试要求显示“过去 5 天”,但答案解析却是按“过去 4 天”计算的。
  • 结果: 当他们在修正后的规则下重新测试 2024 年的冠军(GPT-4)时,它的得分从 49% 跳升到了 57%。这证明了 AI 并不是突然变聪明了,而是测试变得更公平了。

5. 仍然在发生的错误有哪些?

尽管 AI 已经变得更好,但它并不完美。论文指出,即使是最好的模型,仍然会遇到一些顽固的错误:

  • “错误日期”问题: 如果 AI 被要求绘制一张关于“今天”的图表,但系统认为“今天”是过去的一个日期,AI 可能会尝试绘制一个尚未发生的日期的图表。这就像是在今天试图写一份关于明天天气的报告。
  • “截断搜索”问题: 一些工具只显示前 5 个结果。AI 有时看到 5 个结果,就会假设这就是“全部内容”,从而停止寻找,错过了排名第 6 的正确答案。
  • “字面意思 vs 逻辑”问题: 有时 AI 会在数学方面感到困惑。如果一项任务说“如果增长高于平均水平”,AI 可能会拿一个百分比(如 5%)与一个原始数值(如 100 小时)进行比较,从而导致逻辑错误。

总结

两年前,AI 智能体还是经常弄坏东西的笨拙实习生。今天,最好的智能体是可靠的专业人士,能够完成工作且极少造成伤害。虽然最强大的模型仍然昂贵,但更便宜的开源替代方案已经追赶上来,足以胜任许多任务。测试本身也经过了清理,变得更加公平,而结果表明,AI 在职场中正在取得真实的、可衡量的进步。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →