← 最新论文
💻 computer science

ClawForge: Generating Executable Interactive Benchmarks for Command-Line Agents

本文介绍了 ClawForge,这是一个基于生成器的基准框架,用于评估命令行代理在具有持久状态冲突的可执行工作流上的表现,结果表明当前最先进模型在检查现有状态和处理预存工件方面存在显著困难,其严格准确率最高仅为 45.3%。

原作者: Yuxiang Lai, Peng Xia, Haonian Ji, Kaiwen Xiong, Kaide Zeng, Jiaqi Liu, Fang Wu, Jike Zhong, Zeyu Zheng, Cihang Xie, Huaxiu Yao

发布于 2026-05-15
📖 1 分钟阅读☕ 轻松阅读

原作者: Yuxiang Lai, Peng Xia, Haonian Ji, Kaiwen Xiong, Kaide Zeng, Jiaqi Liu, Fang Wu, Jike Zhong, Zeyu Zheng, Cihang Xie, Huaxiu Yao

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是《ClawForge》论文的解释,已用通俗易懂的语言并辅以生动的类比进行翻译。

宏观视角:“凌乱书桌”难题

想象你雇佣了一位非常聪明的机器人助手来打理你的生活。大多数我们给这些机器人做的测试,就像给它们一张崭新、空无一物的书桌,然后说:“请写一份待办事项清单。”机器人写下清单,我们检查文字是否正确。

但在现实世界中,你的书桌从未是空的。它堆满了未完成的半成品项目、过期的便利贴、相互矛盾的指令以及陈旧的文件。对机器人智能的真正考验,不仅仅在于“它能写清单吗?”,而在于**“它能否审视这张凌乱的书桌,找出哪里出了问题,在保留有效内容的同时修复旧问题,并最终完成任务?”**

这篇论文介绍了ClawForge,这是一种全新的测试 AI 智能体(机器人)的方法,完全聚焦于这种“凌乱书桌”的场景。


什么是 ClawForge?(“场景工厂”)

作者们意识到,手工创建这些“凌乱书桌”测试既困难又缓慢。如果你想测试 100 种不同的凌乱场景,你就必须手动构建 100 种不同的混乱局面。

ClawForge 是一个自动化工厂。
研究人员没有让人类编写每一个测试,而是构建了一个能够生成测试的系统。它接收一个模板(例如“修复错误的发布计划”),然后自动填充细节(不同的城市、不同的日期、不同的错误)。

  • 输出结果: 它生成一个完整的“可执行任务”。这不仅仅是一个问题,而是一个微型模拟,包含初始状态(凌乱的书桌)、一套规则以及评估结果的方法。
  • 目标: 考察 AI 是否能处理状态冲突。这意味着要处理那些已经存在的事物,其中一些可能是错误的、过时的或重复的。

测试如何运作(“游戏循环”)

把测试想象成一个视频游戏关卡,AI 是玩家:

  1. 设置: 游戏加载一个“存档文件”,棋盘上已经有一些物品。也许有一个名为“修复服务器”的任务已经存在,但被标记为“低优先级”(这是错误的)。
  2. 指令: AI 收到命令:“服务器修复任务标记错误。请修正它,但不要删除其他有效的任务。”
  3. 行动: AI 像人类使用命令行一样,逐条输入命令。
  4. 评分: 这是最关键的部分。系统检查 AI 是否输入了与人类完全相同的文字,而是检查书桌的最终状态
    • 那个旧的、错误的任务被移除了吗?
    • 新的、正确的任务存在吗?
    • AI 是否不小心创建了任务的重复项
    • 它是否保留了有效的内容未动?

如果最终的书桌看起来完美,AI 就通过测试;如果看起来依然凌乱,则失败。

结果:机器人仍在学习

作者们在新的基准测试中,对七款最智能的 AI 模型(来自 OpenAI、Anthropic 和 Kimi 等公司)进行了测试。结果令人惊讶且发人深省:

  • “满分”极其罕见: 即使是最好的 AI 模型,也只有约**45%**的任务完全正确。这意味着该基准测试难度很大,尚未被“攻克”。
  • “错误修复”问题: 一种特定类型的失败非常普遍。当被要求替换错误项时,模型往往会陷入困境。它们可能会删除错误项却忘记添加新项,或者添加了新项却留下了旧的、损坏的项。
    • 类比: 想象你被告知要更换一个瘪掉的轮胎。AI 把瘪轮胎拆下来了,却忘了装上备胎;或者它装上了备胎,却让瘪轮胎留在地上滚动。
  • “别碰它”问题: 另一种常见的失败发生在书桌已经大部分完成时。AI 看到一个已经正确的任务,不是选择保持原样,而是试图再次“修复”它,从而创建了重复项。
    • 类比: 你告诉机器人:“咖啡已经煮好了。”机器人说:“好的,”然后立刻又煮了一壶,制造了混乱。
  • 效率至关重要: 有些模型解决简单问题需要过多的步骤,而另一些模型虽然快但会犯错。表现最好的是那些在行动前先检查现有状态的模型。

两大最严峻挑战

论文强调了两类让几乎所有模型都束手无策的“凌乱书桌”场景:

  1. 错误状态替换: AI 必须识别出错误的事物,并用正确的事物替换它,同时确保其他一切安全。这是最难的任务;最好的模型也只有 17% 的正确率。
  2. 中断工作流续接: AI 必须走进一个别人已经启动项目的房间,补全缺失的部分,并且不要重做已经完成的部分。在这里,最好和最差的模型之间差距巨大(从 17% 到 90%),这表明某些模型在“入乡随俗”(先观察环境)方面要擅长得多。

为什么这很重要

作者们认为,我们不能再仅仅在“干净”的任务上测试 AI 了。真实的工作涉及处理历史、错误和部分进展。ClawForge 是一个工具,用于衡量 AI 是否真正准备好在真实的办公室工作,那里的事情很少完美,且很少有机会从头开始。

简而言之: ClawForge 是 AI 智能体的健身房,让它们学习如何清理凌乱的房间,同时不破坏那些已经正常运作的家具。目前,即使是实力最强的 AI 智能体,在这个健身房里也还在被自己的脚绊倒。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →