想象一下,你正在招聘一位新助理来协助你管理办公室。如今大多数针对 AI 助理的测试都像是随堂测验:它们向 AI 提出一个问题,AI 作答,测试随即结束。在那次测验期间,世界仿佛被冻结在时间之中。
但在现实生活中,助理并非只回答一个问题就离开。他们会与你共事数日。在他们工作期间,周围的世界会持续发生变化。新邮件涌入,日程表调整,文件更新,新的证据(如照片或语音备忘录)也会出现。如果你的助理没有注意到这些变化,他们可能会基于过时信息做出决策,从而导致错误。
ClawMark 是一项专为评估 AI 助理能否应对这种混乱且不断变化的现实而设计的全新“试驾”测试。
“活体办公室”测试
ClawMark 不像是一次冻结的测验,而更像是一个会呼吸的模拟办公室。
- 设置:AI 被赋予一项工作(例如处理保险索赔或管理项目),该工作跨越数个“工作日”。
- 转折:在每一天之间,环境会自动发生变化。也许会收到一封新邮件,电子表格被更新,或者有人将一个静默文件放入文件夹,而没有任何人告知 AI。
- 证据:AI 不仅仅是在阅读文本。它必须像人类一样查看原始照片、聆听录音、阅读扫描的 PDF 文件并分析视频。
如何给 AI 评分
在许多 AI 测试中,由人类或另一个 AI 阅读答案并评价“听起来不错”。ClawMark 则采取了更严格的做法:它使用机器人裁判。
- 这里没有“主观意见”。测试使用了 1,537 个微小的自动 Python 脚本(检查器),在 AI 完成任务后检查计算机的实际状态。
- AI 是否真的保存了文件?它是否更新了日历?它是否发现了隐藏的照片?
- 如果 AI 声称“我做到了”,但文件并不存在,机器人裁判就会给出零分。这就像一场数学考试,只有当答案写在正确的方框里时才能得分,而不仅仅是口头说出正确答案。
结果:擅长起步,拙于适应
研究人员在这座“活体办公室”中测试了七款顶级 AI 模型(即主要聊天机器人背后的“大脑”)。以下是他们的发现:
- “满分”极为罕见:即使是最好的 AI,在**20%*的任务中也仅实现了“完美”的端到端成功。这意味着,虽然它们通常能取得一些*进展,但很少能在没有任何错误的情况下完成整个工作。
- “第二天下滑”:这是最有趣的发现。在第一天,AI 的表现相当不错。但在第二天,当环境发生变化(新邮件、新文件)时,七款模型中有六款的表现显著下降。
- 类比:想象你在玩电子游戏。你轻松通过了第一关。但当游戏在第二关突然改变规则并添加新敌人时,AI 忘记了如何游玩并开始跌跌撞撞。它难以“苏醒”并意识到世界已经改变。
- 静默变化是致命弱点:AI 最常失败的情况是错过了“静默突变”——即在没有大声宣告的情况下发生的变化(例如文件在后台静默更新)。它们也难以真正将工作保存到正确的位置(后端回写)。
结论
ClawMark 表明,虽然 AI 助理在解决单个问题方面变得越来越聪明,但它们仍在学习如何成为持久的同事。它们擅长“第一天”的表现,但当办公室环境围绕它们发生变化时,往往容易失去立足点。
该论文得出结论:要构建真正可靠的 AI 同事,我们需要少关注它回答单个问题的能力,而多关注它如何适应变化的世界,以及当世界发生变化时如何记得更新其工具。
以下是论文《ClawMark:面向多轮、多日、多模态同事智能体的“活体世界”基准》的详细技术总结。
1. 问题陈述
当前语言模型(LM)智能体的基准测试主要评估静态、单会话环境中的“一次性”任务求解器。然而,LM 智能体的新兴用例是作为持久化同事,在多天时间内与人类协同工作。这一场景提出了现有基准测试未能解决的三个关键挑战:
- 时间演化:环境在回合之间独立于智能体发生变化(例如,新邮件到达、日历条目变更、文件更新)。智能体必须适应这些外生状态变化,而非假设世界是静态的。
- 动态状态:与静态日志或缓存快照不同,真实工作流涉及有状态服务,其中步骤 1 读取的数据可能因外部因素而在步骤 2 中有所不同。
- 多模态证据:专业工作流依赖于跨多种模态(图像、扫描 PDF、音频、视频、电子表格)的原始、未转录证据,而不仅仅是文本。
现有基准测试通常依赖"LLM 作为裁判”进行评分,这引入了主观性和非确定性,且很少模拟智能体回合之间环境发生演变的“活体世界”。
2. 方法论:ClawMark 基准
ClawMark 是一个旨在评估有状态、动态且多模态环境中同事智能体的基准测试。
A. 环境与架构
- 有状态沙盒服务:该基准测试在 Docker 环境中针对五个隔离的有状态服务运行:
- 文件系统
- 电子邮件(GreenMail SMTP/IMAP)
- 日历(Radicale CalDAV)
- 知识库(兼容 Notion)
- 电子表格(兼容 Google Sheets)
- 多轮、多日工作流:每个任务跨越 2–6 个回合,其中每个回合相当于一个虚构世界中的工作日。
- 外生突变:在回合之间,环境通过两种机制独立于智能体发生突变:
- 显性事件:在“唤醒”提示中明确宣布(例如,“收到一封新邮件”)。
- 静默突变:注入到服务中的未宣布变更(例如,电子表格行被覆盖、文件被修改),且不提供通知。智能体必须通过刷新状态来检测这些变化。
- 多模态输入:证据以原始工件(照片、音频、视频、PDF)形式交付,无需预转录,要求智能体使用工具(例如
whisper、ffmpeg、PyMuPDF)进行处理。
B. 评分协议(无 LLM 作为裁判)
ClawMark 采用完全确定性的、基于规则的评分系统:
- 检查器:每个任务包含 6–29 个加权 Python 检查器,用于检查沙盒服务执行后的状态。
- 指标:
- 加权分数:一个连续指标(0–100),根据加权检查器的通过率奖励部分进展。
- 任务成功:一个严格的二元指标(0–100%),要求所有检查器通过。
- 红线约束:55 个特定检查器充当“红线”(硬性约束)。违反这些约束(例如,在最终报告发布前批准索赔、数据泄露)将导致严重惩罚或失败,无论其他进展如何。
- 确定性保证:仅当两次独立重运行产生位级相同的检查器裁决时,任务才会发布,从而确保无需 LLM 裁判即可实现可重复性。
C. 构建流程
该基准测试采用任务优先的管道构建:
- 任务创作:设计人员定义工作流、评分标准及所需的状态变更。
- 证据来源:通过网络收集、原始录制或针对性 AI 合成获取 1,072 个原始多模态工件,以匹配任务设计。
- 审查循环:一个包含 3–5 轮的过程,涉及人工审查、AI 审计(检查是否存在“检查器利用”或脆弱的字符串匹配)以及参考模型对轨迹的审查。
- 发布关卡:仅当任务通过所有审计并展示确定性的检查器一致性时,才会发布。
3. 主要贡献
- 首个“活体世界”基准:引入了结合多日时间线、外生环境突变和原始多模态证据的基准测试。
- 确定性评估协议:建立了一个包含 1,537 个检查器的基于规则的评分系统,消除了 LLM 作为裁判的偏见,并确保位级相同的可重复性。
- 综合数据集:发布了涵盖 13 个专业场景(例如,临床助理、保险、EDA、法律)的 100 个任务,涉及 87 个不同角色。
- 开放基础设施:发布了基准测试、评估框架和构建管道,以支持可重复的研究。
4. 实验结果
作者使用 OpenClaw 框架对七个前沿智能体系统(5 个专有,2 个开源)进行了基准测试。
整体表现
- 加权分数:表现最佳的模型是 Claude Sonnet 4.6,得分为 75.8。其他顶级模型包括 Claude Opus 4.6(74.6)和 GPT-5.4(72.0)。
- 严格任务成功率:部分进展与完整完成之间的差距巨大。最佳 任务成功率 仅为 20.0%(Claude Opus 4.6)。大多数模型端到端解决的任务少于 15%。
- 场景差异:表现因领域而异。例如,模型在"EDA"(电子设计自动化)和“房地产”领域表现出色,但在“项目管理”中表现显著不佳(平均分约 35.1)。
回合级分析(适应性)
- 第 2 天下降:对 73 个三回合任务的分析显示,七分之六的模型在第 2 天(即首次外生突变发生时)性能下降。
- 恢复:到第 3 天,大多数模型仅部分恢复,仍低于第 1 天的基线。这突显了适应变化状态是主要的失败点。
- 效率:令牌/工具使用量与分数之间不存在单调关系。有趣的是,得分最高的模型(Sonnet 4.6、Opus 4.6)也是工具效率最高的模型。
失败分类
对 10,759 次检查器评估的分析揭示了两种主导的失败模式:
- 静默变化检测(56.5% 失败率):智能体经常未能注意到环境中未宣布的变更。
- 后端回写(53.6% 失败率):智能体通常推理正确,但未能将最终操作提交到正确的服务(例如,保存文件或更新行)。
- 红线违规:虽然总体罕见(7.1%),但集中在特定任务中。值得注意的是,Qwen 3.6 Plus 的红线失败率(14.5%)显著高于顶级模型(约 3.6%)。
5. 意义
ClawMark 代表了智能体评估的范式转变:
- 从静态到动态:它超越了“解决这个谜题”,转向“管理这个工作流”,测试智能体随时间保持上下文并适应外部噪声的能力。
- 可靠性优于流畅性:严格的任务成功指标和红线约束强调,在专业环境中,合规性和正确性比部分进展或流畅的对话更为关键。
- 现实世界就绪度:结果表明,虽然前沿模型能够处理复杂推理,但目前它们缺乏持久性、自主同事角色所需的稳健性,特别是在检测静默状态变化和执可靠的行后端更新方面。
ClawMark 的发布为推动迈向真正可靠、持久的 AI 同事的进展提供了必要的基础设施。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。