← 最新论文
💻 computer science

UMI-Bench 1.0: An Open and Reproducible Real-World Benchmark for Tabletop Robotic Manipulation with UMI Data

本文介绍了 UMI-Bench 1.0,这是首个开放且可复现的真实世界基准测试,旨在通过在单一的可审计协议内统一数据采集、场景重置、执行和分析,来标准化通用操控接口(UMI)风格策略的评估。

原作者: Shi Jin, Yuntian Wang, Yuhui Duan, Di Wu, Gaoqi Dong, Xiaohang Liu, Xiaotong Li, Hongfei Jia, Zehao Zhang, Tianyu Wang, Zhongjie Jia, Yuanqi Yao, Chenjia Bai, Zhaxizhuoma, Siao Liu, Nieqing Cao, Jin W
发布于 2026-06-10
📖 1 分钟阅读☕ 轻松阅读

原作者: Shi Jin, Yuntian Wang, Yuhui Duan, Di Wu, Gaoqi Dong, Xiaohang Liu, Xiaotong Li, Hongfei Jia, Zehao Zhang, Tianyu Wang, Zhongjie Jia, Yuanqi Yao, Chenjia Bai, Zhaxizhuoma, Siao Liu, Nieqing Cao, Jin Wang, Chao Yu, Yan Ding

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个机器人如何叠衣服、堆杯子或倒豆子。你向它展示了成千上万段人类完成这些任务的视频。但当你真正把机器人放入真实的厨房时,它可能会因为一个阴影而绊倒,或者因为光线稍有变化就掉落杯子,或者因为杯子是蓝色的而不是红色的而感到困惑。

长期以来,科学家们一直在视频游戏(模拟器)或非常特定的、完美的设置中测试机器人。但正如这篇论文所解释的,模拟器就像是在电子游戏中开车:你可以学会规则,但你没有感受过风、湿滑的路面,或者突然冲出来的松鼠带来的惊吓。

这篇论文介绍了 UMI-Bench 1.0,它本质上是为现实世界中的机器人制定的一个标准化的“驾驶考试”。

以下是他们所做工作的拆解,使用了简单的类比:

1. 问题所在:“食谱”与“厨房”

作者注意到,许多机器人学习系统都使用一种特定的数据采集方式,称为 UMI(通用操纵接口)。你可以把 UMI 理解为一种特定类型的食谱,其中的指令是从机器人的“眼睛”(安装在手腕上的摄像头)和“手”(抓取器)的角度编写的。

问题在于,虽然大家都在使用这本“食谱”来训练机器人,但他们并没有在同一个“厨房”里进行测试。

  • 一个团队可能在铺着红垫子的桌子上进行测试。
  • 另一个团队可能在蓝垫子和不同的光照条件下进行测试。
  • 第三个团队可能会将物体放在稍微不同的位置。

如果机器人 A 失败了而机器人 B 成功了,是因为机器人 B 更聪明吗?还是仅仅因为机器人 B 运气好,碰到了红垫子?目前还没有公平的方法来对它们进行比较。

2. 解决方案:一个标准化的“驾驶考试”

作者构建了 UMI-Bench 1.0。想象一下,这是一个管理严格的驾驶考试中心,每一辆车(机器人)都面临着完全相同的条件。

  • 相同的赛道: 他们建造了一个特定的桌子,上面有一个网格(就像一个巨大的游戏棋盘)。每个机器人必须从完全相同的位置开始放置物体。
  • 相同的摄像头: 每个机器人必须通过安装在手腕上的摄像头来观察世界,就像训练数据中那样。不允许使用“第三人称”视角(比如从天花顶向下看的监控摄像头视角)。
  • 相同的规则: 他们创建了 10 个特定的任务,难度从简单到复杂不等。
    • 简单: 堆叠三个篮子。
    • 中等: 用双手将豆子从杯子倒入篮子。
    • 困难: 折叠一条裤子或分拣麻将牌。
  • “惊喜”元素: 为了测试机器人是真的聪明还是仅仅记住了测试内容,他们改变了一些变量。
    • 因素 A(“新装扮”): 他们更换了不同颜色或形状的物体(例如,用绿球代替红球)。
    • 因素 B(“新位置”): 他们将物体移动到了网格上的不同位置。

3. 他们是如何测试的

他们选取了三个不同的“学生”机器人(AI 模型分别命名为 π0、π0.5 和 DreamZero),并让它们针对每个任务进行 50 次标准化测试。

他们不仅仅询问“它是否完成了任务?”(是/否),而是像老师批改数学试卷一样给它们评分:

  • 完全成功: 它拿到 A+ 了吗?(完美堆叠,没有洒出)。
  • 进度得分: 它得到了部分分数吗?(它拿起了杯子,但洒出了一些豆子)。

4. 他们的发现(成绩单)

结果非常具有启发性:

  • “好消息”: 当机器人面对与其训练时完全相同的设置时,表现得相当不错。它可以处理“已见”(Seen)的情况。
  • “坏消息”: 当机器人面对新位置(因素 B)时,它比面对新物体(因素 A)时挣扎得更多。
    • 类比: 这就像一个学生,如果数字按原样排列,他能完美解决数学题;但如果把数字挪到另一页,他就会彻底陷入混乱。机器人过度依赖于记忆物体的“位置”,而不是理解任务的“几何结构”。
  • 最难的任务: 需要长链条动作的任务(如重新排列整个厨房架子)或需要极精准时机的任务(如在旋转转盘上接住易拉罐)极其困难。所有机器人几乎 100% 都会失败。

5. 为什么这很重要

论文认为,我们不应该再根据“谁在自己的私人实验室里表现最好”来比较机器人。

UMI-Bench 1.0 就像是一场标准化的全国统一考试。它让研究人员能够自信地得出结论,例如:“好吧,机器人 A 更擅长折叠衣服,但机器人 B 更擅长倾倒液体”,并确保这种差异是源于机器人的“大脑”,而不是房间里的光线。

它并不声称机器人已经准备好取代你家中的人类了。相反,它提供了一把尺子,让我们去衡量我们距离那个目标究竟还有多远,从而确保当我们说一个机器人在“学习”时,我们衡量的是真实的技能,而不仅仅是模拟器中的技巧。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →