LIBERO-PRO: Towards Robust and Fair Evaluation of Vision-Language-Action Models Beyond Memorization
本文介绍了 LIBERO-PRO,这是一个鲁棒的基准测试,它通过展示当前的视觉 - 语言 - 动作模型在对象、状态、指令和环境经过泛化扰动评估时性能完全崩溃,揭示了这些模型对死记硬背的严重依赖,从而敦促社区采用更公平的评估标准。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在训练一个机器人厨师制作沙拉。你给它看一段视频:有人拿起一瓶沙拉酱,放进篮子里。机器人观看、学习,然后当你让它做同样的事情时,它完美地完成了任务。你给它打了高分:95%!你心想:“哇,这个机器人是遵循指令的天才。”
但转折来了:机器人其实并没有在思考。 它只是像一只背熟了特定脚本的鹦鹉在表演。
这就是论文LIBERO-PRO的核心故事。作者们认为,目前我们测试这些“视觉 - 语言 - 动作”(VLA)机器人的方式存在缺陷。这就像给学生出一套数学题,题目与他们练习过的完全一样,只是数字被移动了一毫米。学生得了 100 分,但如果你稍微改变数字,他们就会彻底不及格。
以下是该论文发现的要点,使用简单的类比进行说明:
1. “死记硬背”的陷阱
当前的标准测试(称为LIBERO)太容易了。机器人是在一组任务上进行训练,然后在完全相同的任务上进行测试,仅包含微小到几乎看不见的变化(例如将碗向左移动一英寸)。
- 结果: 机器人得分超过 90%。
- 现实: 它们并没有理解任务;它们只是在重播训练期间看到的“记忆电影”。它们通过记忆房间的布局和动作序列来“作弊”,而不是真正理解什么是“篮子”或“沙拉酱”。
2. "LIBERO-PRO"压力测试
为了解决这个问题,作者们创建了LIBERO-PRO。你可以把它想象成一场旨在抓出作弊者的“突击小测验”。他们系统地干扰了四个方面,以观察机器人是否真的能够适应:
- 物体替换(“冒牌货”):
- 测试: 你告诉机器人:“拿起沙拉酱。”但在场景中并没有沙拉酱,取而代之的是一罐字母汤。
- 机器人的反应: 它无视那罐汤,盯着沙拉酱通常所在的位置,试图抓取空气。它如此执着于记忆,以至于根本没有注意到物体缺失或不同。
- “胡言乱语”指令:
- 测试: 你告诉机器人:“拿起沙拉酱”,但随后将文字替换为乱码,如"fdsgfdsgsd"。
- 机器人的反应: 它没有停顿,也没有说“我不明白”。它仍然拿起了沙拉酱。这证明机器人并没有真正听懂你的话;它只是根据所见进行猜测。
- “移动目标”(位置偏移):
- 测试: 你将物体稍微移开,使其位置与训练视频中的位置不同。
- 机器人的反应: 它伸向旧的位置,完全错过了物体。它没有“物体现在在哪里”的概念;它只知道“它本该在哪里”。
- “组合”任务:
- 测试: 你要求机器人做两件它分别知道如何做的简单事情(拿起碗,然后打开炉灶),但将它们合并为一条新指令。
- 机器人的反应: 它失败了。它无法将两个已学习的动作拼接起来以制定新计划。这就像一位音乐家能演奏音阶和和弦,但如果你让他们演奏一首曲子,他们就会僵住。
3. 重大揭露
当作者们在顶级机器人(如 OpenVLA 和 Pi0)上运行这些“压力测试”时,结果令人震惊。
- 标准测试得分: 90% 以上(看起来很棒)。
- LIBERO-PRO 得分: 0%(彻底失败)。
机器人瞬间崩溃。它们无法处理不同的物体、移动的物体、奇怪的指令或任务的新组合。
核心启示
该论文得出结论,目前用于测试机器人的“黄金标准”具有误导性。这就像仅通过评估司机在一条他们已行驶过一千次的完美笔直空旷赛道上的驾驶能力,来判断其驾驶技能。
作者们呼吁科学界停止使用旧的、简单的测试。他们希望所有人都改用LIBERO-PRO,这将迫使机器人证明它们能够真正看见、理解并适应混乱且不可预测的现实世界,而不仅仅是复述背熟的脚本。
简而言之: 机器人还不够聪明;它们只是非常擅长记忆。LIBERO-PRO 是最终揭示这一差异的测试。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。