Position: Vision-Language-Action Models Cannot Be Verified to Perform Physical Reasoning
本文认为,当前的视觉-语言-动作(VLA)模型评估协议未能区分语义匹配与真正的物理推理,这使得关于物理泛化能力的说法变得无法验证,并呼吁建立能够因果隔离这些不同能力的全新实验设计。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
这是一篇使用通俗易懂的语言和日常类比对该论文进行的解释。
核心理念:一个“不会做饭”的高级大厨
想象一位非常聪明的大厨,他读过所有的食谱,看过所有的烹饪节目,并背下了互联网上数以百万计的食物描述。这位大厨完全知道“香辣番茄汤”看起来是什么样子的,闻起来是什么味道,以及配方是怎么写的。
现在,想象你要求这位大厨在真实的厨房里动手制作这道汤。
这篇论文指出,我们目前仅仅因为他能完美地描述这道汤,或者能准确指出食材,就给了他及格的分数。我们假设,既然他如此精通这些词汇和图像,那么他也一定知道如何搬动沉重的锅具、调节火力以及搅拌而不烫伤手。
作者说:“我们实际上还没有测试他是否真的会做饭。我们只是测试了他是否会‘谈论’烹饪。”
问题所在:混淆了“认知”与“执行”
论文关注的是一种被称为**视觉-语言-动作(VLA)**模型的机器人大脑。这些机器人使用大规模的“视觉-语言模型”(VLM)——即那个在互联网照片和文本上训练出来的部分——来告诉它们该做什么。
作者将机器人的大脑分为两个部分:
- 语义地图(“是什么”): 这是识别物体的一部分。它看到一个红球,知道:“那是一个球。指令说‘拿起球’。”这部分擅长理解语言和图像。
- 物理决策(“怎么做”): 这是研究如何抓取球的部分。球是滑的吗?它重吗?如果我抓得太用力,它会碎吗?这需要理解物理、重量和摩擦力。
缺陷: 论文声称,目前的机器人建立在一个隐藏的假设之上:“如果机器人完美地理解了图像和文字,它就会自动知道如何正确地移动手臂。”
作者认为这个假设是未经证实的。仅仅因为一个机器人在照片中能识别出一个“沉重且光滑的杯子”,并不意味着它知道该用多大的力气去拿起它而不至于掉落。
我们为什么无法分辨?(“评分卡”问题)
目前,我们通过给机器人布置任务(比如“把杯子放到桌子上”)并观察其是否成功来测试它们。如果杯子最终到了桌子上,我们就给它们一个“成功”的分数。
论文认为这种评分卡是失效的,因为它没有告诉我们机器人为什么成功。
- 场景 A: 机器人理解了语言,理解了物理规律,并且做得很好。(真正的成功)。
- 场景 B: 机器人通过观察训练数据中的相似设置,猜中了正确的动作,即使它并不理解物理原理。(幸运的猜测)。
- 场景 C: 机器人完美理解了语言,但因为杯子太重而未能拿起。(物理层面的失败)。
类比: 想象一个学生在参加数学考试。如果他答对了,我们就假设他掌握了数学。但如果他只是背下了答案呢?或者如果他是靠猜呢?
目前的机器人测试就像是一种只看最终答案的测试。我们并没有检查他们是真的在“做数学题”(物理),还是仅仅在进行“模式匹配”(语义猜测)。
“叙事漂移”(被误导的故事)
论文描述了一种被称为**“叙事漂移”(Narrative Drift)**的现象。
- 第一代机器人: “我们制造了一个利用互联网知识控制机械臂的机器人。它有点效果!”
- 第二代机器人: “我们做了一个更大的!它效果更好!这一定是由于互联网知识在物理方面变得更强了。”
- 第三代机器人: “我们做了一个更大的!它太惊人了!它一定是物理方面的天才!”
作者说,这是我们一直在对自己讲述的一个故事。每当机器人的得分略微提高时,我们就假设这是因为机器人在物理方面变得更聪明了。但作者认为,我们从未真正分离出物理部分来进行验证。我们只是不断地假设“互联网知识”(VLM)在承担重任,尽管互联网上的照片并不能教会你一块砖头有多重。
三个层面的困惑
论文解释了为什么我们无法辨别发生了什么,并将其分为三个层面:
- 第一层(结果): 我们看到了成功,但不知道是因为机器人理解了任务,还是因为它猜中了正确的动作。
- 第二层(来源): 我们不知道机器人是从“互联网阅读”(VLM)中学到的,还是从“机器人训练”(物理实践)中学到的。两者混杂在一起。
- 第三层(大脑): 我们不知道机器人在学习移动手臂的过程中,是否实际上丢失了一些聪明的“互联网推理”能力。也许当我们强迫它只能“去做”某事时,它忘记了如何对不可能完成的任务说“不”。
解决方案:更好的测试方法
作者并不是说这些机器人没用。他们只是说我们需要停止猜测。他们提出了一种新的测试方法:
“受控变量”测试:
我们不应该只是给机器人一个任务然后看它是否获胜,而是需要一次只改变一个变量:
- 测试“是什么”: 保持物理世界完全不变,但改变语言或图像。机器人是否仍知道该做什么?(这测试的是语言部分)。
- 测试“怎么做”: 保持语言和图像完全不变,但改变物理特性(例如,让物体变重,或者让桌面变滑)。机器人是否仍能成功?(这测试的是物理部分)。
通过这样做,我们终于可以明确说:“好吧,这个机器人在理解语言方面很棒,但在物理变化时会失败。”或者,“这个机器人在物理方面表现出色,但在面对新词汇时会感到困惑。”
总结
这篇论文是在呼吁停止假设**“了解世界”(通过互联网获取知识)等同于“理解如何在世界中行动”**(物理规律)。
目前,我们正在赞美那些擅长“谈论”任务的机器人,同时又假设它们也擅长“执行”任务。作者希望我们建立更好的测试方法,将这两项技能分离开来,以便我们真正弄清楚机器人是在学习成为物理智能体,还是仅仅在进行高效的模式匹配。
简而言之:不要仅仅因为机器人知道“重”这个词,就假设它能搬起一个沉重的箱子。我们需要测试它是否真的能搬起来。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。