UniviewVLA: A Unified Multiview Vision-Language-Action Model with World Modeling
UniViewVLA 是一个统一的多视图视觉-语言-动作模型,它利用世界模型从标准的双摄像头观测中推断出被遮挡的线索和未来的场景演变,在无需额外硬件或显式 3D 重建的情况下,在以遮挡为核心的任务上实现了显著的性能提升。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下你正在试图解开一个谜题,但你的眼睛只能看到画面的一半。你可以看到上半部分,但下半部分被一个盒子挡住了。一个标准的机器人大脑(视觉-语言-动作模型,Vision-Language-Action model)就像是一个眼睛被遮住的人;它只能根据它所能看到的部分来猜测缺失的部分。通常情况下,它的猜测是错误的,因为最重要的线索被隐藏起来了。
这篇论文介绍了一种新型的机器人大脑——UniviewVLA,它无需购买更多摄像头或构建复杂的3D地图即可解决这个问题。以下是它的工作原理,通过简单的概念进行拆解:
1. 问题所在:“盲区”
机器人通常有两个摄像头:一个在它的“头部”(代理视角,agent-view),一个在它的“手腕处”(手腕视角,wrist-view)。
- 问题: 如果机器人需要抓取一个躲在杯子后面的开关,或者移动一个被盒子部分遮挡的玩偶,标准摄像头就看不见它。
- 旧有的解决方案:
- 增加更多摄像头: 这就像是给机器人多长了几只眼睛。但这很麻烦。你必须用这些特定的摄像头对机器人进行训练,而且如果把机器人移动到另一个房间,由于摄像头角度不同,训练就会失效。
- 构建3D地图: 这就像是在移动时,试图在脑海中绘制出一张完美的房间3D蓝图。这需要消耗大量的脑力(计算能力)且速度很慢。
2. 解决方案:“想象引擎”
UniviewVLA 使用了一个世界模型(World Model)。你可以把它理解为机器人的能力,让它能够想象出从它没有摄像头的角度看过去是什么样子的,并预测场景在未来几秒钟内会如何变化。
- 工作原理: 机器人观察它的两个标准摄像头。然后,它询问它的“想象引擎”:“如果我现在是从侧面或者从上方看,我会看到什么?以及在下一秒钟,我会看到什么?”
- 结果: 它会即时生成这些“想象”出的视图。它不需要额外的硬件;它只是利用自己的大脑来填补盲区。
3. 速度黑科技:“精彩集锦”
这里有一个难点:生成这些想象视图会产生海量的数据(就像为每一秒钟都生成一部高清电影一样)。这会让机器人变得很慢,就像电脑在播放一个简单的动作前,必须先加载一段4K视频一样。
- 解决方法(运动信息特征压缩): 研究人员意识到,机器人并不需要整个想象出来的电影。它只需要知道什么是运动着的。
- 类比: 与其为了理解一个场景而去观看一部60分钟的电影,不如让机器人创建一个只显示运动部分(比如手伸向杯子)的16秒“精彩集锦”。
- 影响: 这将数据量从625个信息碎片缩减到了仅16个。它将机器人的思考时间从处理每个视图需要6-7秒,缩短到了仅需0.2-0.3秒。
4. 智能切换器:“选择最佳角度”
有时,在任务开始时“侧视图”最好,但随着物体的移动,稍后“顶视图”可能变得更重要。固定的摄像头无法改变主意。
- 解决方法(动作熵视角选择): 机器人不断地问自己:“哪个想象的角度能让我更有把握做出下一步动作?”
- 类比: 想象你在玩电子游戏。有时你需要看小地图,有时你需要直视前方。UniviewVLA 会在每一步动态地切换到最有帮助的想象角度,而无需重新训练。
5. 结果:看见“看不见”的东西
团队通过两种方式测试了它:
- 标准测试: 在没有任何遮挡的常规任务中,机器人的表现与现有的最强机器人一样出色(成功率95.8%)。
- “隐藏”测试: 他们设计了一些机器人必须绕过角落或物体背后才能完成的任务。
- 标准机器人: 成功率仅为 40%。
- 带有额外摄像头的机器人: 成功率为 66%。
- UniviewVLA(仅使用2个摄像头): 成功率为 73%。
在现实生活中: 他们也在真实的机械臂上进行了测试。当机器人需要抓取躲在电饭煲后面的奥利奥,或者移动被盒子挡住的玩偶时,标准机器人大多失败了。而 UniviewVLA 仅凭它的两个标准摄像头,成功率显著提高,证明了通过“想象”缺失的视角,比单纯增加物理摄像头效果更好。
总结
UniviewVLA 就像是给了机器人**“超视觉”**。它不再受限于物理摄像头的限制,而是利用“世界模型”来想象房间的其余部分并预测未来。它运行得如此高效,以至于不需要额外的硬件,也不会因为额外的数据量而变慢,并且能够解决那些物体被遮挡的复杂任务。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。