← 最新论文
💬 NLP

RealClawBench: Live OpenClaw Benchmarks from Real Developer-Agent Sessions

RealClawBench 引入了一个源自真实 OpenClaw 开发者-智能体会话的实时基准测试框架,该框架利用重建的执行环境和确定性评分器,将 281 个具有挑战性的真实世界任务转化为可复现的评估,从而揭示了当前模型中显著的性能差距。

原作者: Zongwei Lv, Zhewen Tan, Yaoming Li, Yilun Yao, Yuxuan Tian, Lin Sun, Xiangzheng Zhang, Weihong Lin, Tong Yang, Guangxiang Zhao

发布于 2026-06-03
📖 1 分钟阅读☕ 轻松阅读

原作者: Zongwei Lv, Zhewen Tan, Yaoming Li, Yilun Yao, Yuxuan Tian, Lin Sun, Xiangzheng Zhang, Weihong Lin, Tong Yang, Guangxiang Zhao

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正在试图测试一个新研发的机器人厨师有多出色。

旧方法(传统基准测试):
传统上,研究人员会编写一系列完美的、教科书式的食谱,比如“制作一份烤奶酪三明治”或“烘焙一个巧克力蛋糕”。他们会将这些食谱交给机器人,观察它是否遵循步骤。问题在于,现实生活并非教科书。在现实世界中,顾客可能会说:“我的面包有点陈了,奶酪在冰箱后面,而且我只有一个小烤箱,没有烤架。你能做点能入口的东西吗?”旧的测试并没有检查机器人是否能够处理这些混乱的、现实世界的细节。

新方法 (REALCLAWBENCH):
这篇论文的作者意识到,要真正测试一个“开发者智能体”(即帮助程序员的机器人),他们需要停止编写虚假的测试,而是开始观察真实的人是如何在实际场景中使用机器人的。

他们构建了一个名为 REALCLAWBENCH 的系统。以下是它的工作原理,我们使用简单的类比来解释:

1. 捕捉真实瞬间(来源)

他们并没有凭空发明任务,而是观察了 76,155 个真实的会话,在这些会话中,真实的开发者使用一种名为“OpenClaw”的工具来获取代码帮助。他们看到了真实的人们如何提出那些混乱、复杂且有时含糊不清的需求。

  • 类比: 想象一个监控摄像头正在记录繁忙餐厅里成千上万名真实顾客点餐的过程,而不是一位厨师在安静的厨房里编写菜单。

2. “神奇的清理”(流水线)

你不能直接把一段真实客户的原始录音变成一个测试。录音中可能包含私密密码、公司机密文件,或者指向已经不存在的计算机的引用。
论文描述了一个 pipeline(一个逐步进行的工厂流水线)来清理这些真实的瞬间:

  • 隐私屏蔽: 他们清除所有秘密和私人信息,就像在视频中模糊人脸一样。
  • 环境重建: 如果开发者要求机器人修复他们特定电脑上的一个文件,团队会构建一个虚假的、安全的该电脑环境,以便稍后可以再次运行该测试。
  • 重写请求: 他们将含糊的、对话式的请求(“嘿,你能看看我刚才提到的那个东西吗?”)转化为清晰、独立的指令(“请修复登录文件中的错误”)。
  • 自动评判员: 他们没有使用人工来评分,而是编写了一个计算机程序来检查结果。文件是否被修复了?是/否。不允许猜测。

3. 结果:一个“活的”测试

最终产物是一个包含 281 个真实世界任务 的基准测试。

  • 为什么它很特别: 它是“活的”且“锚定的”。这意味着这个测试不是一份会过时的静态问题列表。由于它是从持续不断的真实用户数据流中构建的,他们以后可以用新的真实案例来更新测试,以保持其新鲜度。
  • “现实差距”: 论文指出,之前的测试存在一个“差距”,即测试内容与实际发生的情况之间不符。REALCLAWBENCH 弥合了这个差距。这就像是从在完美、空旷的赛道上测试驾驶员,转变为在充满坑洼和困惑行人的实际高峰期交通中测试他们。

他们发现了什么?

他们在这种新的、混乱的、真实的测试上测试了 14 个目前最智能的 AI 模型

  • 得分: 即使是最优秀的 AI 模型(Claude Opus 4.7)也只解决了大约 66% 的任务。
  • 结论: 这意味着仍有很大的提升空间。目前的“超智能”机器人仍然在应对实际开发者每天面临的那些混乱、现实问题的过程中挣扎。

总结

简而言之,这篇论文是在说:“不要再用虚假的、完美的场景来测试机器人了。让我们用它们在现实中真正面临的那些混乱、真实的问题来测试它们,但要把它们清理得足够干净,以便我们可以公平地评分。”

他们构建了一个系统来实现这一点,并发现即使是当今最优秀的机器人,在实现真正的可靠性方面,也仅仅完成了大约三分之二的任务。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →