VLM4VLA: Revisiting Vision-Language-Models in Vision-Language-Action Models
本文介绍了 VLM4VLA,这是一个极简的适配流水线,它证明了虽然视觉语言模型(VLM)的初始化有利于下游视觉-语言-动作(VLA)策略,但通用的 VLM 能力和特定的具身技能提升并不能很好地预测控制性能,从而揭示了视觉模块与动作规划之间的领域差距是主要的瓶颈。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在尝试教一个机器人做家务,比如打开抽屉或堆叠积木。为了做到这一点,你需要给机器人一个“大脑”。最近,科学家们一直在使用**视觉语言模型(Vision-Language Models, VLMs)**作为这些大脑。这些是超级聪明的 AI 系统,它们已经成为了看图和理解文字(比如读一本书或描述一张照片)方面的专家。
这个研究论文提出的核心问题是:“如果我们把一个擅长聊天和看图的聪明 AI 拿过来,它会自动变得擅长控制机器人手臂吗?”
研究人员构建了一个简单、公平的测试机器,称为 VLM4VLA。你可以把这个机器想象成一个通用的适配器插头。它能将任何聪明的 AI 大脑直接插入机器人身体中,且仅需最少量的额外部件,这样他们就能观察出问题究竟出在 AI 大脑本身,还是出在机器人身体上。
以下是他们发现的研究结果,通过日常类比进行了解释:
1. “学霸” vs. “熟练工”
你可能会认为,最聪明的学生(在通用知识方面得分最高的 AI)会成为最好的工人(机器人)。
- 研究发现: 不一定。
- 类比: 想象你有两个人。A 是位博学多才的教授,能背诵整部百科全书并写出优美的文章。B 则名气稍逊,但有一手修车的本事。如果你要求他们去修车,教授可能会束手无策,而技工却能成功完成。
- 论文结果: 研究人员发现,AI 的“通用智力”(即它在标准阅读和图片测试中的表现)并不能很好地预测它控制机器人的能力。有时,一个在通用测试中得分较低的模型,在控制机器人手臂方面反而比一个更“聪明”的模型做得更好。
2. “专项训练”的陷阱
研究人员想知道:“如果我们给这些聪明的 AI 增加一些针对机器人任务的额外训练,比如学习如何指向物体或估计深度,情况会怎样?”
- 研究发现: 并没有什么帮助。
- 类比: 想象你雇佣了一位世界级的厨师。为了让他成为更好的机械师,你给他报了一个换机油的速成班。你可能会期望他现在能成为一名优秀的机械师。但当他真正尝试修理发动机时,他仍然会感到吃力。
- 论文结果: 针对特定“类机器人”任务(如回答有关机器人运动的问题)对 AI 进行微调,并不保证能带来更好的性能表现。事实上,有时这甚至会让表现略微下降。
3. “眼睛” vs. “嘴巴”
研究人员将 AI 进行了拆解,以观察到底是哪个部分出了问题:是视觉编码器(负责看的部分),还是语言编码器(负责说的部分)。
- 研究发现: “眼睛”是瓶颈所在。
- 类比: 想象一个机器人拥有一个非常聪明的嘴巴,能说得天衣无缝,但它的眼睛戴着一副模糊的眼镜,这副眼镜是为欣赏画作设计的,而不是为了观察杂乱的工作间。无论它的嘴巴说得多么好,由于看不清工具,它也无法抓取正确的工具。
- 论文结果: AI 的语言部分没问题。问题在于视觉部分。AI 的“眼睛”是在互联网照片(猫、风景、梗图)上训练出来的,但机器人任务需要观察深度、距离以及三维空间中精确的物体位置。AI 的眼睛并没有针对这些进行校准。
4. “现实世界” vs. “模拟环境”的差距
最后,他们问道:“问题在于 AI 是在真实照片上训练的,而机器人在视频游戏(模拟器)中测试,还是说问题在于更深层的东西?”
- 研究发现: 这是一个更深层的“语义”差距,而不只是视觉上的差距。
- 类比: 即便你给 AI 看一张真实的扳手照片(而不是卡通图),它仍然不知道该“如何”握住它。AI 理解“这是一个扳手”(识别语言),但它并不理解“这是要在此处抓握的扳手”(动作/控制)。
- 论文结果: 即使他们在真实的机器人数据上训练 AI,他们仍必须从头开始重新训练视觉部分才能获得良好的效果。仅仅使用预训练的“眼睛”是不够的。AI 需要学习一种专门用于运动的“视觉语言”,而这是它在通用训练期间并未习得的。
总结
论文的结论是,虽然使用预训练的“聪明大脑”是必不可少的(你无法轻易从零开始构建一个机器人),但你不能仅仅把一个通用用途的 AI 插进机器人里就指望它完美运行。
这些 AI 模型的“眼睛”是为理解世界而训练的(就像游客看地图),但机器人需要的是在世界中行动(就像木匠使用锤子)。要制造一个优秀的机器人,你必须专门重新训练 AI 的视觉,使其通过“行动”而非仅仅是“观察”的视角来看待世界。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。