← 最新论文
💻 computer science

Does VLA Even Know the Basics? Measuring Commonsense and World Knowledge Retention in Vision-Language-Action Models

本文介绍了 Act2Answer,这是一种新颖的评估协议,它将视觉语言模型(VLM)基准测试适配为基于动作的桌面任务,以系统地测量和分析视觉语言-动作模型(VLA)中的知识保留情况,并揭示了尽管这些模型保持了基础概念,但与其来源 VLM 相比,它们在更丰富的语义知识方面存在显著差距。

原作者: Nikita Kachaev, Andrey Moskalenko, Matvey Skripkin, Nikita Kurlaev, Daria Pugacheva, Albina Burlova, Mikhail Kolosov, Denis Shepelev, Andrey Kuznetsov, Elena Tutubalina, Aleksandr I. Panov, Alexey K.
发布于 2026-06-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Nikita Kachaev, Andrey Moskalenko, Matvey Skripkin, Nikita Kurlaev, Daria Pugacheva, Albina Burlova, Mikhail Kolosov, Denis Shepelev, Andrey Kuznetsov, Elena Tutubalina, Aleksandr I. Panov, Alexey K. Kovalev, Vlad Shakhuro

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你有一位才华横溢的学生,他读遍了图书馆里的每一本书,对世界了如指掌。你称他为“博学之人”。然后,你雇佣他担任机器人管家。你教他如何拿起杯子、打开门以及移动家具。

核心问题是:在接受了所有关于如何移动双手的训练后,这个机器人管家还记得从书中学习到的知识吗? 或者说,“如何移动”的训练是否在无意中清空了他的大脑?

由 Nikita Kachaev 及其同事领导的研究人员决定查明真相。他们开发了一种新的测试方法,称为 Act2Answer(动作到回答)。

问题所在:“成功”陷阱

通常,当我们测试机器人时,我们会问:“机器人是否成功拿起了杯子?”

  • 如果机器人拿起了杯子,我们会说:“做得好!”
  • 如果机器人掉落了杯子,我们会说:“做得不好。”

但这就像是在只检查学生是否能写出自己的名字,而不检查他们是否真的掌握了数学题,从而给学生评分。机器人掉落杯子可能是因为它的手很笨拙(运动技能差),而不是因为它不知道那个杯子里装满了热咖啡且不应触摸。旧的测试方法将“笨拙的手”与“空洞的大脑”混为一谈。

解决方案:“动作测验”

为了解决这个问题,研究人员创建了一个名为 Act2Answer 的游戏。

想象桌上有两张图片:

  1. 一张悲伤的人的图片。
  2. 一张快乐的人的图片。

机器人会收到一个语音指令:“把方块放在悲伤的人身上。”

机器人不需要通过说话来回答“悲伤的人在左边”,而是必须物理性地移动一个方块并将其放置在悲伤人物的图片上。

  • 如果它把方块放在了悲伤的图片上,它就得一分。
  • 如果它把方块放在了快乐的图片上,它得零分。

这是一个“低风险”的测试。机器人不需要走过整个房间或搬动沉重的沙发。它只需要用一个方块进行指向。这隔离了机器人的知识与其笨拙程度

他们的发现:“简单 vs 复杂”的差距

研究人员测试了 7 种不同的机器人大脑(VLA 模型),并将它们与其“父辈”版本(在训练移动之前,那些聪明的文本和图像模型)进行了比较。

以下是他们数据所讲述的故事:

1. 机器人擅长“是什么”(简单事物)
如果你问机器人:“这是一个红球还是蓝球?”或者“这是一个圆圈还是正方形?”,机器人几乎是完美的。它们仍然能完美地识别颜色和形状。这就像机器人仍然记得如何识别停止标志。

2. 机器人迷失在“为什么”和“是谁”(复杂事物)
但当问题变得更深层时,机器人开始失败。

  • 情感: 它们难以区分“悲伤”的面孔和“快乐”的面孔。
  • 社会规则: 它们似乎不知道如果指令暗示了安全性,就不应该把方块放在婴儿的图片上。
  • 事实: 它们忘记了名人是谁,或者无法正确计算物体的数量。

这就像机器人学习移动手臂学得太好,以至于忘记了如何像人类一样思考。对于非简单的形状或颜色之外的事物,“笨拙的手”训练似乎覆盖了“聪明的脑”训练。

3. “父亲”与“孩子”
研究人员发现“父亲”(聪明的文本模型)与“孩子”(机器人)之间存在巨大的差距。

  • “父亲”能正确回答 90% 的复杂问题。
  • “孩子”(机器人)往往会跌落到接近 50%(这仅仅是瞎猜水平)。

这表明,当我们把一个聪明的 AI 变成机器人时,我们往往会丢失大量的常识。

“隐藏知识”之谜

研究人员还窥探了机器人大脑内部(其内部层),以观察知识是真的消失了,还是仅仅被隐藏了。

他们发现,知识在机器人的大脑中间层中依然存在。机器人内部其实“知道”答案。但当它试图将这种知识转化为物理动作(移动方块)时,信号丢失了。

类比: 想象一个人知道谜题的答案,但由于有言语障碍,导致他结结巴巴,无法大声说出来。知识就在那里,但“动作”部分的大脑无法获取它。

总结

论文得出结论,仅仅教聪明的 AI 如何移动机械臂是不够的。我们目前正在训练机器人成为优秀的“执行者”,但在“思考”世界方面却表现糟糕。

要构建一个真正有用的机器人助手,我们需要弄清楚如何在教它们移动的同时,让它们忘记最初拥有的常识。论文指出,在机器人学习移动的过程中保持其与语言和世界知识的联系,可能是关键,但目前这种平衡是缺失的。

简而言之: 机器人可以拿起杯子,但它们可能不记得杯子是热的,或者不记得拿着杯子的人很伤心。它们是优秀的移动者,但正在忘记如何变得聪明。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →