← 最新论文
💻 computer science

VLA-REPLICA: A Low-Cost, Reproducible Benchmark for Real-World Evaluation of Vision-Language-Action Models

本文介绍了 VLA-REPLICA,这是一个由现成组件构建的低成本且易于复现的真实世界基准,它通过为全球实验室评估视觉 - 语言 - 动作模型提供一个一致、多样且可访问的环境,解决了现有评估方法的局限性。

原作者: Alex S. Huang, Jiahui Zhang, Shiqing Tang, Yu Xiang

发布于 2026-05-21
📖 1 分钟阅读☕ 轻松阅读

原作者: Alex S. Huang, Jiahui Zhang, Shiqing Tang, Yu Xiang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你建造了一位天才机器人厨师,它能遵循复杂的指令,比如“做一个三明治”或“叠好衣物”。你兴奋地想看看它在现实世界中是否行得通。但问题在于:如何公平地测试它?

如果你在视频游戏(模拟环境)中测试它,机器人可能看起来像位大师级厨师,可一旦把它放进真正的厨房,它可能会因为游戏未考虑到的滑溜桌面或形状怪异的盘子而掉落面包。另一方面,如果你在真实厨房中测试它,你就需要一台超级昂贵、定制的机械臂、一个工程师团队来搭建,以及一个无人能复制的特定房间。这使得其他科学家无法说:“嘿,让我们在实验室里试试你的机器人,看看效果是否一样。”

VLA-REPLICA 登场了。

将这篇论文视为一套“机器人测试乐高套件”的推出。

问题:机器人测试的“黑箱”

目前,测试机器人就像试图评判一场烹饪比赛,而每位评委使用的厨房、烤箱和食材都各不相同。有些厨房位于配备百万美元设备的豪华实验室;有些则存在于缺乏真实感的视频游戏中。这使得人们很难判断机器人究竟是真正聪明,还是仅仅在特定设置下运气好。

解决方案:标准化、低成本的“食谱”

作者们创建了VLA-REPLICA,这是一个低成本、可复现的基准测试。以下是他们如何通过简单的类比来实现的:

1. “宜家”式机械臂
他们不使用定制化的百万美元机器人,而是采用了一款廉价、现成的机械臂(SO-101),价格约为 200 美元。这就像使用标准、实惠的厨房搅拌机,而不是定制的工业机器。因为它便宜且由 3D 打印部件制成,任何人都可以购买并组装。

2. “灯箱”舞台
为了确保每次测试看起来都一样,他们将机器人放入摄影灯箱中(就像摄影师拍摄产品照片时使用的灯箱)。这就是“舞台”。它屏蔽了杂乱的背景,并确保每次测试的光线都完美且一致。这就像将机器人置于聚光灯下的舞台,无论谁在观看,光线都永不改变。

3. “幽灵叠加”技巧
这是最酷的部分。如何确保机器人手臂在 A 实验室的位置与在 B 实验室完全一致?

  • 他们使用摄像头叠加。想象一下透过一副眼镜观看,眼镜中会显示完美设置的“幽灵”图像。
  • 当科学家设置他们的机器人时,他们会查看摄像头的屏幕。他们能看到房间的实时视频,但屏幕上叠加了一层“完美”设置的透明图像。
  • 他们移动机器人和物体,直到“幽灵”与真实物体完美对齐。这就像玩“连线游戏”,你必须让现实世界与图画完全匹配。

“任务菜单”

他们不仅测试了一件事,而是创建了一个包含10 种不同任务的菜单,从简单到棘手不等:

  • 简单:将一片面包放在红色盘子上。
  • 棘手:将毛巾对折。
  • 记忆测试:“将胡椒瓶摇晃整整三次。”(这对机器人来说很难,因为它们必须计数并记住)。
  • 工具使用:打开烤箱门或清洁白板。

他们还创建了两类测试:

  • “练习”测试(分布内):机器人看到的物体是它以前见过的,只是位置略有不同。
  • “惊喜”测试(分布外):机器人看到的是一条蓝色毛巾,而不是粉色的,或者被要求摇晃胡椒五次而不是三次。这测试了机器人是否真正在学习,还是仅仅在死记硬背。

他们的发现

他们用这个新的“乐高套件”测试了几个“大脑”模型(AI 系统)。

  • 好消息:机器人在拾取面包或折叠毛巾等简单任务上表现相当不错。“预训练”模型(即已经掌握大量通用知识的机器人)的表现优于从零开始学习的模型。
  • 坏消息:机器人在记忆任务上表现挣扎。如果你让它们“按按钮三次”,它们往往会忘记已经按了多少次,从而无限循环下去。它们擅长观察和抓取,却不擅长在心中计数。

为什么这很重要

最重要的结果不仅仅是机器人表现得好或差。而是当两个不同的人在不同的房间建造了两个不同的 VLA-REPLICA 套件时,机器人获得的分数几乎完全相同。

这证明了“乐高套件”是有效的。这意味着世界各地的科学家现在可以构建相同的测试环境,分享他们的结果,并真正比较谁的机器人最聪明,而无需百万美元的预算或超级计算机。它将机器人测试从“黑箱”谜团转变为透明、公平且可重复的科学。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →