EnterpriseClawBench: Benchmarking Agents from Real Workplace Sessions
本文介绍了 EnterpriseClawBench,这是一个源自专有真实企业级智能体会话的基准测试,通过评估 852 个可复现任务来证明当前模型取得的成功有限(0.663),并指出未来的评估必须采用一个多维框架,报告包括“工具链-模型”组合、制品交付、视觉质量、成本、运行时间以及技能迁移行为,而非仅仅依赖单一评分。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你雇佣了一名非常聪明、全新的员工,他能够阅读文件、使用工具并撰写报告。你想知道他是否真的胜任这份工作。
以往大多数针对 AI “员工”的测试就像是在安静的教室里给他们进行随堂测验。他们被要求在孤立的状态下回答问题或编写代码。但真正的办公室工作并非安静的测验;它是一个混乱、嘈杂的环境,你必须阅读杂乱的电子邮件、打开特定的附件、修复断开的链接,并在一天结束前交付一个最终成品(如电子表格或演示文稿)。
这篇论文介绍了 EnterpriseClawBench,这是一种基于公司真实工作会话(而非虚构的练习测试)来测试 AI 智能体的新方法。
以下是他们所做的工作和发现的拆解,使用了简单的类比:
1. 真实工作的“回收厂”
研究人员从他们自己公司成千上万次的真实工作会话存档中开始了这项工作。这些会话是非常混乱的:它们包含私密聊天、错误的路径以及模糊的指令。
把这个存档想象成一堆未经精炼的原始矿石。论文描述了一个**“构建流水线”**(回收厂)来清理这些矿石:
- 过滤器: 他们剔除了任务过短、缺少文件或依赖于失效链接的任务。
- 翻译器: 他们将多轮、混乱的对话重写为清晰、单次的指令(就像将一段喋喋不休的邮件链转化为一份清晰的“待办事项”清单)。
- 安全检查: 他们确保每个任务都可以重复运行,而不需要使用公司的秘密密码。
从 5,291 次原始尝试中,他们最终得到了 852 个高质量、可复现的任务。他们还创建了一个包含 120 个任务的较小“轻量版”,这些任务经过了人工检查以确保质量完美。
2. “驾驶员与汽车”测试
该论文的一个主要发现是,你不能仅仅在真空环境下测试 AI 模型(“引擎”)。你必须将 AI + 软件框架(“汽车”)作为一个整体进行测试。
- 类比: 想象测试一台法拉利引擎。如果你把它装在一辆锈迹斑斑、破旧不堪的卡车里,它的表现不会好;如果你把它装在一辆流线型的跑车里,它就会飞驰。
- 结果: 论文测试了 32 种不同的“引擎”(如 GPT-5.5, Sonnet 4.6)与“汽车”(软件框架,如 Claude Code, OpenClaw, Hermes)的组合。
- 惊喜之处: 一些强大的引擎在与错误的框架配对时表现极差。例如,一个顶级的模型在使用 “Hermes” 框架时得分显著下降,因为该框架阻止了模型执行某些必要的动作。这证明了软件包装层与 AI 大脑同样重要。
3. “成绩单”不仅仅是一个分数
在学校里,你会得到一个最终成绩。但在本基准测试中,研究人员认为这还不够。他们根据一份多维度的成绩单来为智能体评分:
- 他们完成工作了吗?(成果交付)
- 他们做得快吗?(运行时间)
- 成本是否过高?(成本)
- 文件是否真正可用?(视觉质量)
- 他们理解上下文了吗?(语义质量)
现实检验: 即使是最优秀的组合(Codex 配搭 GPT-5.5)也仅获得了 66.3% 的分数。这意味着,即使是我们最聪明的 AI 智能体,在处理真实的办公任务时仍然显得力不从心。它们经常遗漏细节、找不到正确的文件,或者生成的报告看起来不错,但数据却是错误的。
4. “技能迁移”实验
研究人员想看看 AI 能否从一个任务中“学习”一项技能,并将其应用到另一个类似的任务中。
- 实验: 他们拿出一个练习过制作“前端网页”的 AI,然后给它一个它从未见过的全新网页任务。
- “老师”与“学生”: 他们发现,“技能”的质量完全取决于谁在教它。
- 如果是一个强大的 AI(如 GPT-5.5)进行知识蒸馏,那么“学生”AI 会变得更好。
- 如果是一个较弱的 AI 试图传授这项技能,那么“学生”AI 实际上会变得更差。
- 教训: 你不能仅仅假设一个 AI 已经“学会”了某项技能。教学的质量至关重要,有时一个糟糕的老师会毁掉一个优秀的学生。
5. “人类 vs 机器人”裁判问题
为了给这些任务评分,他们使用了 AI 评委(用机器人给机器人打分)。
- 文本任务: AI 评委在对文本报告进行评分时表现得相当出色,与人类评委的判断高度一致。
- 视觉任务: 当涉及到对电子表格、幻灯片或图像进行评分时,AI 评委非常不可靠。它们经常给那些人类会拒绝的混乱输出打出高分。
- 启示: 我们擅长测试 AI 是否能写好一句话,但我们目前还很难测试 AI 是否能制作出一份专业的商务文档。
总结
EnterpriseClawBench 是对 AI 行业的一次现实检验。它指出:
- 停止在虚假、干净的环境中测试 AI;要在混乱、真实的存档中测试它们。
- 你使用的软件框架与 AI 模型本身一样重要。
- 目前的 AI 智能体尚未准备好完全取代复杂办公岗位中的人类员工;它们犯错的频率仍然太高,无法被信任去交付最终产品。
- 我们需要更好的方式来评估视觉输出,而不只是文本。
论文得出结论:虽然 AI 正在进步,但“与 AI 聊天”与“可靠地运营一个业务部门”之间的差距依然巨大。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。