V-Link: Recovering Lost Visual Representations in Action DiT for Vision-Language-Action Models
V-Link 通过引入显式恢复并注入到 Action DiT 中的空间与语义查询表示,解决了视觉-语言-动作模型在获取 3D 几何和 2D 语义信息方面存在的关键局限性,从而显著提升了机器人在多个基准测试中的操控性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
能够在一个杂乱的房间中导航、拿起特定工具并递给人类的机器人,需要一种融合了视觉、理解与运动的智能。多年来,研究人员一直致力于构建这样的系统:将一个强大的“视觉大脑”(能够识别物体并阅读指令)与一个独立的控制模块相结合,后者负责将这些想法转化为机器人手臂和手部的精确动作。这种两部分协作的方法使得机器能够执行日益复杂的任务,从堆叠积木到组装简单的装置。然而,一个关键问题一直萦绕不去:那个实际移动肢体的机器人部分,其观察世界的方式是否真的与那个“思考”的部分一致?如果视觉信息在从“思考”大脑传递到“运动”身体的过程中丢失或变得模糊,机器人可能理解杯子在桌子上,却因为无法准确判断距离或物体的形状而无法抓取它。
一组研究人员已经准确识别出了这种崩溃发生的位置,并设计了一种解决方案来修复它。他们发现,在目前的先进机器人系统中,传递给控制模块的最后一层视觉信息过度偏向于语言和物体名称,而关于深度和三维空间的至关重要的细节却被遗留在了身后。为了解决这个问题,他们开发了一种名为 V-Link 的新方法,该方法充当了一座桥梁,用于在机器人尝试运动之前恢复这些丢失的空间细节。通过明确地教导系统去分离并保留“是什么”(物体的身份)和“在哪里”(物体在三维空间中的精确位置),研究人员使机器人能够以显著提高的成功率完成精细的操作任务。在涉及计算机模拟和真实人形机器人的测试中,这种方法使机器能够完成以前难以完成的任务,例如打开电源开关或在复杂环境中导航,证明了恢复视觉感知的完整丰富性对于精确的机器人行动至关重要。
问题的核心在于现代机器人大脑的结构。这些系统通常使用一个大型预训练模型来处理图像和语言,生成一组总结场景的特征。随后,这个总结会被输入到一个独立的控制器中,由它决定机器人应该如何移动。研究人员发现,虽然这个总结非常擅长识别物体,但在传达场景的几何现实方面却表现得异常糟糕。当他们测试控制器仅基于这个最终总结来估计深度或分割物体时的能力时,结果很差。控制器似乎在走捷径,依赖于物体的语义标签,而不是它们的物理形状和距离。这类似于一位司机知道每条街道的名字,却无法判断与前车的距离;知识确实存在,但实际应用却缺失了。
为了解决这个问题,研究人员引入了一种机制,强制系统显式地学习并保留两种不同类型的视觉信息:一种侧重于场景的几何结构,另一种侧重于其语义含义。他们在视觉处理阶段加入了特殊的、可学习的标记(tokens)——本质上是系统向自身提出的专门问题。一组标记被训练专门关注深度和空间关系,而另一组则专注于识别物体及其类别。至关重要的是,这些标记在学习过程中是通过辅助任务进行训练的,例如预测场景的深度图或分割不同的物体,但在机器人部署后,这些额外的任务会被移除。这确保了机器人学会了内化这些空间和语义细节,而无需在实时运行中进行额外的计算。
一旦这些专门的表示被学习完成,它们就会通过一条精心设计的路径注入到机器人的控制模块中。系统并非简单地将所有信息混合在一起;相反,它采用了一种非对称的方法,其中语义信息作为标准视觉数据的补充,而空间信息则拥有一个专门的通道来调节机器人的运动。这种设计确保了控制器无法忽略场景的 3D 几何结构。结果是,机器人不仅知道自己在看什么,还理解自己在空间中相对于自身身体的确切位置。
这种恢复带来的影响在各种具有挑战性的场景中都是立竿见影且可衡量的。在涉及移动物体、放置物品以及与表面接触等任务的一系列模拟实验中,新方法显著优于之前的最先进模型。在一项基准测试中,成功率提升了 30% 以上,而在另一项测试中,提升了近 19%。这种进步不仅仅是完成任务速度的问题,更在于处理需要精确深度感知的高精度操作的能力。在人形机器人的现实测试中,该系统成功完成了自主开启和关闭电源的任务,成功率分别为 98% 和 94%,较基准模型有了大幅跨越。
或许最重要的一点是,这种增强几乎没有增加机器人的速度成本。研究人员计算出,新方法为机器人的决策时间仅增加了不到一毫秒。这种效率对于实际的机器人技术至关重要,因为延迟可能会导致不稳定或失败。通过在不减慢系统速度的情况下恢复丢失的视觉表示,研究人员证明了机器人操作的瓶颈不在于计算能力,而在于视觉信息从感知到行动的传递方式。这项工作表明,为了让机器人真正掌握物理世界,必须赋予它们获取全谱视觉线索的能力,确保它们对场景的理解与其在其中运动的能力一样丰富且详细。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。