← 最新论文
🤖 AI

Embodied-BenchClaw: An Autonomous Multi-Agent System for Embodied Spatial Intelligence Benchmark Construction

本文介绍了 Embodied-BenchClaw,这是一个通过五阶段流水线自动化构建可验证、可维护且多样化的具身空间智能基准测试的自主多智能体系统,从而解决了现有评估框架中劳动密集且静态的局限性。

原作者: Baoyang Jiang, Fengchun Zhang, Leyuan Wang, Haotian Li, Yida Wang, Zhe Ji, Jinshan Lai, Xi Ren, Jianwei Hu, Qiang Ma

发布于 2026-06-11
📖 1 分钟阅读☕ 轻松阅读

原作者: Baoyang Jiang, Fengchun Zhang, Leyuan Wang, Haotian Li, Yida Wang, Zhe Ji, Jinshan Lai, Xi Ren, Jianwei Hu, Qiang Ma

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在尝试教一个机器人如何在房子里导航、如何开车或如何驾驶无人机。为了做到这一点,你需要一个“测试”(基准测试)来观察这个机器人是否足够聪明。但目前,制作这些测试就像是为每一台新机器人定制建造一栋房子:它需要数月的体力劳动,蓝图杂乱无章,而且当你终于完成时,机器人可能已经学会了如何通过测试,导致测试变得毫无意义。

Embodied-BenchClaw 是一个全新的系统,它充当了这些机器人测试的自动化施工队。它不再依靠人类从零开始构建每一个测试,而是利用一组 AI“智能体”(agents)来自动设计、构建并质检这些测试。

以下是该系统的运作方式,我们使用简单的类比来解释:

1. 三人协作团队

该系统并非只有一个 AI 在做所有事情。它拥有三个专门的工人(智能体),像流水线一样将项目向下传递:

  • 建筑师(规划智能体/Architect): 你告诉这个工人:“我需要一个针对在多岩石地形上四足行走的机器人的测试。”建筑师会倾听,弄清楚究竟需要测试哪些技能,并绘制出一份蓝图。
  • 建造者(构建智能体/Builder): 这个工人接过蓝图并开始收集材料。它会调取真实的图片、模拟器中的视频或旧的测试数据。然后,它会组装成实际的测试题目,确保这些题目是基于真实的视觉证据(例如一张关于岩石的照片)而生成的,而不是凭空捏造的故事。
  • 检查员(评估智能体/Inspector): 这个工人是严格的质量控制经理。在建造者构建测试的过程中,检查员会检查每一步。建造者使用的是正确的照片吗?答案是否真的可以从那张照片中推导出来?如果出了问题,检查员不会把整个项目丢弃,而是会将问题发回给建造者,让其仅修复那一个特定的部分。

2. “乐高”库(技能库/Skill Library)

该论文的一个重大创新是 技能库(Skill Library)。想象一下你在盖房子。与其每次都重新发明如何铺砖或安装窗户,不如拥有一个装满预制、经过测试的乐高积木的盒子。

  • 在 Embodied-BenchClaw 中,这些“积木”就是技能(Skills)。一个技能可能是“计算图像中两个物体之间的距离”,或者是“检查路径是否畅通”。
  • 因为这些技能是预先验证且可重复使用的,系统可以快速构建复杂的测试,而无需每次都重新发明轮子。如果引入了新型号的机器人,团队只需抓取合适的“乐高积木”并将它们拼接在一起即可。

3. “自我修复”过程

通常情况下,如果人类在构建测试时犯了错,他们可能不得不从头开始或花费数小时去修复。Embodied-BenchClaw 拥有 局部修复(Local Repair) 机制。

  • 这就像是一个 GPS,当它意识到你走错了路时,它不会告诉你回到家重新开始开车,而是直接从你当前的位置重新规划路线。
  • 如果系统发现了一个错误的测试题目,它会追踪出错的具体位置(溯源追踪),并仅修复那一个特定的步骤,从而保持其余工作的完整性。

4. 他们构建了什么?

论文展示了该系统成功构建了六种不同类型的“机器人驾驶测试”(基准测试),涵盖了:

  • 室内导航: 机器人在房间内移动。
  • 驾驶: 汽车在街道上行驶。
  • 机械臂: 机器人抓取并移动物体。
  • 四足机器人: 犬类或四足动物在崎岖地形上行走。
  • 无人机: 航拍视角与飞行。
  • 升级旧测试: 将旧有的、“饱和”的测试变得更难、更具体。

5. 结果

作者通过让系统构建一个无人机(UAV)测试来验证其性能。

  • “盲测”: 当他们在不让 AI 模型看到图像(仅提供文本)的情况下向其展示测试时,模型的得分非常低(约为 30%)。这证明了该测试确实需要观察图片,而不是仅仅根据语言模式进行猜测。
  • “视觉测试”: 当模型能够看到图像时,它们的得分跃升到了 65% 左右。
  • 结论: 这证明了该系统创建了一个公平、困难且有用的测试,能够真正区分出聪明的机器人和愚笨的机器人。

总结

Embodied-BenchClaw 是一个用于自动化构建机器人测试的系统。它利用 AI 智能体团队、可重复使用的“建筑模块”库以及自我纠错过程,来快速构建高质量的视觉化测试。这解决了测试制作过慢以及容易被“作弊”的问题,确保我们始终能找到新的方法来衡量机器人的智能化程度。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →