UMI-Bench 1.0: An Open and Reproducible Real-World Benchmark for Tabletop Robotic Manipulation with UMI Data
本文介绍了 UMI-Bench 1.0,这是首个开放且可复现的真实世界基准测试,旨在通过在单一的可审计协议内统一数据采集、场景重置、执行和分析,来标准化通用操控接口(UMI)风格策略的评估。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在教一个机器人如何叠衣服、堆杯子或倒豆子。你向它展示了成千上万段人类完成这些任务的视频。但当你真正把机器人放入真实的厨房时,它可能会因为一个阴影而绊倒,或者因为光线稍有变化就掉落杯子,或者因为杯子是蓝色的而不是红色的而感到困惑。
长期以来,科学家们一直在视频游戏(模拟器)或非常特定的、完美的设置中测试机器人。但正如这篇论文所解释的,模拟器就像是在电子游戏中开车:你可以学会规则,但你没有感受过风、湿滑的路面,或者突然冲出来的松鼠带来的惊吓。
这篇论文介绍了 UMI-Bench 1.0,它本质上是为现实世界中的机器人制定的一个标准化的“驾驶考试”。
以下是他们所做工作的拆解,使用了简单的类比:
1. 问题所在:“食谱”与“厨房”
作者注意到,许多机器人学习系统都使用一种特定的数据采集方式,称为 UMI(通用操纵接口)。你可以把 UMI 理解为一种特定类型的食谱,其中的指令是从机器人的“眼睛”(安装在手腕上的摄像头)和“手”(抓取器)的角度编写的。
问题在于,虽然大家都在使用这本“食谱”来训练机器人,但他们并没有在同一个“厨房”里进行测试。
- 一个团队可能在铺着红垫子的桌子上进行测试。
- 另一个团队可能在蓝垫子和不同的光照条件下进行测试。
- 第三个团队可能会将物体放在稍微不同的位置。
如果机器人 A 失败了而机器人 B 成功了,是因为机器人 B 更聪明吗?还是仅仅因为机器人 B 运气好,碰到了红垫子?目前还没有公平的方法来对它们进行比较。
2. 解决方案:一个标准化的“驾驶考试”
作者构建了 UMI-Bench 1.0。想象一下,这是一个管理严格的驾驶考试中心,每一辆车(机器人)都面临着完全相同的条件。
- 相同的赛道: 他们建造了一个特定的桌子,上面有一个网格(就像一个巨大的游戏棋盘)。每个机器人必须从完全相同的位置开始放置物体。
- 相同的摄像头: 每个机器人必须通过安装在手腕上的摄像头来观察世界,就像训练数据中那样。不允许使用“第三人称”视角(比如从天花顶向下看的监控摄像头视角)。
- 相同的规则: 他们创建了 10 个特定的任务,难度从简单到复杂不等。
- 简单: 堆叠三个篮子。
- 中等: 用双手将豆子从杯子倒入篮子。
- 困难: 折叠一条裤子或分拣麻将牌。
- “惊喜”元素: 为了测试机器人是真的聪明还是仅仅记住了测试内容,他们改变了一些变量。
- 因素 A(“新装扮”): 他们更换了不同颜色或形状的物体(例如,用绿球代替红球)。
- 因素 B(“新位置”): 他们将物体移动到了网格上的不同位置。
3. 他们是如何测试的
他们选取了三个不同的“学生”机器人(AI 模型分别命名为 π0、π0.5 和 DreamZero),并让它们针对每个任务进行 50 次标准化测试。
他们不仅仅询问“它是否完成了任务?”(是/否),而是像老师批改数学试卷一样给它们评分:
- 完全成功: 它拿到 A+ 了吗?(完美堆叠,没有洒出)。
- 进度得分: 它得到了部分分数吗?(它拿起了杯子,但洒出了一些豆子)。
4. 他们的发现(成绩单)
结果非常具有启发性:
- “好消息”: 当机器人面对与其训练时完全相同的设置时,表现得相当不错。它可以处理“已见”(Seen)的情况。
- “坏消息”: 当机器人面对新位置(因素 B)时,它比面对新物体(因素 A)时挣扎得更多。
- 类比: 这就像一个学生,如果数字按原样排列,他能完美解决数学题;但如果把数字挪到另一页,他就会彻底陷入混乱。机器人过度依赖于记忆物体的“位置”,而不是理解任务的“几何结构”。
- 最难的任务: 需要长链条动作的任务(如重新排列整个厨房架子)或需要极精准时机的任务(如在旋转转盘上接住易拉罐)极其困难。所有机器人几乎 100% 都会失败。
5. 为什么这很重要
论文认为,我们不应该再根据“谁在自己的私人实验室里表现最好”来比较机器人。
UMI-Bench 1.0 就像是一场标准化的全国统一考试。它让研究人员能够自信地得出结论,例如:“好吧,机器人 A 更擅长折叠衣服,但机器人 B 更擅长倾倒液体”,并确保这种差异是源于机器人的“大脑”,而不是房间里的光线。
它并不声称机器人已经准备好取代你家中的人类了。相反,它提供了一把尺子,让我们去衡量我们距离那个目标究竟还有多远,从而确保当我们说一个机器人在“学习”时,我们衡量的是真实的技能,而不仅仅是模拟器中的技巧。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。