Does VLA Even Know the Basics? Measuring Commonsense and World Knowledge Retention in Vision-Language-Action Models
本文介绍了 Act2Answer,这是一种新颖的评估协议,它将视觉语言模型(VLM)基准测试适配为基于动作的桌面任务,以系统地测量和分析视觉语言-动作模型(VLA)中的知识保留情况,并揭示了尽管这些模型保持了基础概念,但与其来源 VLM 相比,它们在更丰富的语义知识方面存在显著差距。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你有一位才华横溢的学生,他读遍了图书馆里的每一本书,对世界了如指掌。你称他为“博学之人”。然后,你雇佣他担任机器人管家。你教他如何拿起杯子、打开门以及移动家具。
核心问题是:在接受了所有关于如何移动双手的训练后,这个机器人管家还记得从书中学习到的知识吗? 或者说,“如何移动”的训练是否在无意中清空了他的大脑?
由 Nikita Kachaev 及其同事领导的研究人员决定查明真相。他们开发了一种新的测试方法,称为 Act2Answer(动作到回答)。
问题所在:“成功”陷阱
通常,当我们测试机器人时,我们会问:“机器人是否成功拿起了杯子?”
- 如果机器人拿起了杯子,我们会说:“做得好!”
- 如果机器人掉落了杯子,我们会说:“做得不好。”
但这就像是在只检查学生是否能写出自己的名字,而不检查他们是否真的掌握了数学题,从而给学生评分。机器人掉落杯子可能是因为它的手很笨拙(运动技能差),而不是因为它不知道那个杯子里装满了热咖啡且不应触摸。旧的测试方法将“笨拙的手”与“空洞的大脑”混为一谈。
解决方案:“动作测验”
为了解决这个问题,研究人员创建了一个名为 Act2Answer 的游戏。
想象桌上有两张图片:
- 一张悲伤的人的图片。
- 一张快乐的人的图片。
机器人会收到一个语音指令:“把方块放在悲伤的人身上。”
机器人不需要通过说话来回答“悲伤的人在左边”,而是必须物理性地移动一个方块并将其放置在悲伤人物的图片上。
- 如果它把方块放在了悲伤的图片上,它就得一分。
- 如果它把方块放在了快乐的图片上,它得零分。
这是一个“低风险”的测试。机器人不需要走过整个房间或搬动沉重的沙发。它只需要用一个方块进行指向。这隔离了机器人的知识与其笨拙程度。
他们的发现:“简单 vs 复杂”的差距
研究人员测试了 7 种不同的机器人大脑(VLA 模型),并将它们与其“父辈”版本(在训练移动之前,那些聪明的文本和图像模型)进行了比较。
以下是他们数据所讲述的故事:
1. 机器人擅长“是什么”(简单事物)
如果你问机器人:“这是一个红球还是蓝球?”或者“这是一个圆圈还是正方形?”,机器人几乎是完美的。它们仍然能完美地识别颜色和形状。这就像机器人仍然记得如何识别停止标志。
2. 机器人迷失在“为什么”和“是谁”(复杂事物)
但当问题变得更深层时,机器人开始失败。
- 情感: 它们难以区分“悲伤”的面孔和“快乐”的面孔。
- 社会规则: 它们似乎不知道如果指令暗示了安全性,就不应该把方块放在婴儿的图片上。
- 事实: 它们忘记了名人是谁,或者无法正确计算物体的数量。
这就像机器人学习移动手臂学得太好,以至于忘记了如何像人类一样思考。对于非简单的形状或颜色之外的事物,“笨拙的手”训练似乎覆盖了“聪明的脑”训练。
3. “父亲”与“孩子”
研究人员发现“父亲”(聪明的文本模型)与“孩子”(机器人)之间存在巨大的差距。
- “父亲”能正确回答 90% 的复杂问题。
- “孩子”(机器人)往往会跌落到接近 50%(这仅仅是瞎猜水平)。
这表明,当我们把一个聪明的 AI 变成机器人时,我们往往会丢失大量的常识。
“隐藏知识”之谜
研究人员还窥探了机器人大脑内部(其内部层),以观察知识是真的消失了,还是仅仅被隐藏了。
他们发现,知识在机器人的大脑中间层中依然存在。机器人内部其实“知道”答案。但当它试图将这种知识转化为物理动作(移动方块)时,信号丢失了。
类比: 想象一个人知道谜题的答案,但由于有言语障碍,导致他结结巴巴,无法大声说出来。知识就在那里,但“动作”部分的大脑无法获取它。
总结
论文得出结论,仅仅教聪明的 AI 如何移动机械臂是不够的。我们目前正在训练机器人成为优秀的“执行者”,但在“思考”世界方面却表现糟糕。
要构建一个真正有用的机器人助手,我们需要弄清楚如何在教它们移动的同时,不让它们忘记最初拥有的常识。论文指出,在机器人学习移动的过程中保持其与语言和世界知识的联系,可能是关键,但目前这种平衡是缺失的。
简而言之: 机器人可以拿起杯子,但它们可能不记得杯子是热的,或者不记得拿着杯子的人很伤心。它们是优秀的移动者,但正在忘记如何变得聪明。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。