← 最新论文
💻 computer science

ClawMark: A Living-World Benchmark for Multi-Turn, Multi-Day, Multimodal Coworker Agents

本文介绍了 ClawMark,这是一个旨在动态、有状态环境中评估多轮次、跨天、多模态同事智能体的新基准,揭示出尽管前沿模型展现出部分进展,但它们在应对外源性变化以及实现完整端到端任务成功方面仍面临显著困难。

原作者: Fanqing Meng, Lingxiao Du, Zijian Wu, Guanzheng Chen, Xiangyan Liu, Jiaqi Liao, Chonghe Jiang, Zhenglin Wan, Jiawei Gu, Pengfei Zhou, Rui Huang, Ziqi Zhao, Shengyuan Ding, Ailing Yu, Bo Peng, Bowei Xi
发布于 2026-04-28
📖 1 分钟阅读☕ 轻松阅读

原作者: Fanqing Meng, Lingxiao Du, Zijian Wu, Guanzheng Chen, Xiangyan Liu, Jiaqi Liao, Chonghe Jiang, Zhenglin Wan, Jiawei Gu, Pengfei Zhou, Rui Huang, Ziqi Zhao, Shengyuan Ding, Ailing Yu, Bo Peng, Bowei Xia, Hao Sun, Haotian Liang, Ji Xie, Jiajun Chen, Jiajun Song, Liu Yang, Ming Xu, Qionglin Qiu, Runhao Fu, Shengfang Zhai, Shijian Wang, Tengfei Ma, Tianyi Wu, Weiyang Jin, Yan Wang, Yang Dai, Yao Lai, Youwei Shu, Yue Liu, Yunzhuo Hao, Yuwei Niu, Jinkai Huang, Jiayuan Zhuo, Zhennan Shen, Linyu Wu, Cihang Xie, Yuyin Zhou, Jiaheng Zhang, Zeyu Zheng, Mengkang Hu, Michael Qizhe Shieh

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在招聘一位新助理来协助你管理办公室。如今大多数针对 AI 助理的测试都像是随堂测验:它们向 AI 提出一个问题,AI 作答,测试随即结束。在那次测验期间,世界仿佛被冻结在时间之中。

但在现实生活中,助理并非只回答一个问题就离开。他们会与你共事数日。在他们工作期间,周围的世界会持续发生变化。新邮件涌入,日程表调整,文件更新,新的证据(如照片或语音备忘录)也会出现。如果你的助理没有注意到这些变化,他们可能会基于过时信息做出决策,从而导致错误。

ClawMark 是一项专为评估 AI 助理能否应对这种混乱且不断变化的现实而设计的全新“试驾”测试。

“活体办公室”测试

ClawMark 不像是一次冻结的测验,而更像是一个会呼吸的模拟办公室

  • 设置:AI 被赋予一项工作(例如处理保险索赔或管理项目),该工作跨越数个“工作日”。
  • 转折:在每一天之间,环境会自动发生变化。也许会收到一封新邮件,电子表格被更新,或者有人将一个静默文件放入文件夹,而没有任何人告知 AI。
  • 证据:AI 不仅仅是在阅读文本。它必须像人类一样查看原始照片、聆听录音、阅读扫描的 PDF 文件并分析视频。

如何给 AI 评分

在许多 AI 测试中,由人类或另一个 AI 阅读答案并评价“听起来不错”。ClawMark 则采取了更严格的做法:它使用机器人裁判

  • 这里没有“主观意见”。测试使用了 1,537 个微小的自动 Python 脚本(检查器),在 AI 完成任务后检查计算机的实际状态。
  • AI 是否真的保存了文件?它是否更新了日历?它是否发现了隐藏的照片?
  • 如果 AI 声称“我做到了”,但文件并不存在,机器人裁判就会给出零分。这就像一场数学考试,只有当答案写在正确的方框里时才能得分,而不仅仅是口头说出正确答案。

结果:擅长起步,拙于适应

研究人员在这座“活体办公室”中测试了七款顶级 AI 模型(即主要聊天机器人背后的“大脑”)。以下是他们的发现:

  1. “满分”极为罕见:即使是最好的 AI,在**20%*的任务中也仅实现了“完美”的端到端成功。这意味着,虽然它们通常能取得一些*进展,但很少能在没有任何错误的情况下完成整个工作。
  2. “第二天下滑”:这是最有趣的发现。在第一天,AI 的表现相当不错。但在第二天,当环境发生变化(新邮件、新文件)时,七款模型中有六款的表现显著下降
    • 类比:想象你在玩电子游戏。你轻松通过了第一关。但当游戏在第二关突然改变规则并添加新敌人时,AI 忘记了如何游玩并开始跌跌撞撞。它难以“苏醒”并意识到世界已经改变。
  3. 静默变化是致命弱点:AI 最常失败的情况是错过了“静默突变”——即在没有大声宣告的情况下发生的变化(例如文件在后台静默更新)。它们也难以真正将工作保存到正确的位置(后端回写)。

结论

ClawMark 表明,虽然 AI 助理在解决单个问题方面变得越来越聪明,但它们仍在学习如何成为持久的同事。它们擅长“第一天”的表现,但当办公室环境围绕它们发生变化时,往往容易失去立足点。

该论文得出结论:要构建真正可靠的 AI 同事,我们需要少关注它回答单个问题的能力,而多关注它如何适应变化的世界,以及当世界发生变化时如何记得更新其工具

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →