← 最新论文
💻 computer science

Mind-VLA: Instruction-Aware Spatial Representation Alignment for Vision-Language-Action Models

Mind-VLA 是一种指令感知的空间表示对齐方法,通过将潜在表示与语言指令所识别的目标物体的 3D 几何结构进行特定对齐,从而增强视觉-语言-动作模型,进而显著提升其在细粒度操控和遮挡目标任务上的性能。

原作者: Xingyu Ding, Yuzhong Zhao, Yang Wu, Chunhai Zhao, Chaoyang Zhao, Yifan Zhang, Jian Cheng

发布于 2026-08-31
📖 1 分钟阅读☕ 轻松阅读

原作者: Xingyu Ding, Yuzhong Zhao, Yang Wu, Chunhai Zhao, Chaoyang Zhao, Yifan Zhang, Jian Cheng

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

机器人长期以来一直是重复动作的大师,能够毫无差错地执行成千上万次相同的精确动作。然而,当被要求在杂乱的房间中导航,或从一堆相似物体中拿起特定物品时,它们往往会出错。挑战不仅在于如何“看见”世界,还在于如何理解人类要求其触摸的特定物体的三维形状和位置。现代机器人越来越多地受到视觉-语言-动作(Vision-Language-Action)模型的引导,这类系统接收视觉场景和口头指令,然后决定物理运动。虽然这些系统在处理通用任务方面已变得非常出色,但当目标物体被部分遮挡,或者机器人必须在两个几乎完全相同的物品之间进行辨别时,它们往往会显得力不从心。核心难点在于,这些模型倾向于将整个视觉场景视为一个单一、统一的信息块,而不是将其几何理解聚焦在人类提到的特定物体上。

一种被称为 Mind-VLA 的新方法通过教导机器人关注指令中提到的特定物体,解决了这一局限性。该系统不再试图绘制整个房间的 3D 几何图,而是学习隔离出语言指令中所描述的目标物体,并为该物体建立一个详细的精神模型。这种方法使机器人即使在土豆紧挨着一个看起来很像的苹果时,也能理解土豆的形状和位置,或者在香蕉被布料部分覆盖时,仍能抓取到香蕉。通过将焦点从整个场景转向特定的目标,机器人获得了更敏锐的触达位置感和抓握方式感,从而在复杂的现实世界场景中实现了更可靠的表现。

这项工作的研究人员发现,现有的 3D 感知机器人训练方式存在一个根本性的缺陷。现有方法通常将机器人的内部理解与整个场景的几何结构对齐,而无论人类要求它做什么。如果一个人说“拿起那个土豆”,机器人的训练数据可能会迫使它在编码土豆 3D 结构的同时,也将桌子、背景墙以及柜台上的其他水果一并编码进去。这产生了一个模糊的信号,使得最重要的信息——土豆本身的形状——淹没在周围环境的噪声之中。当目标物体被部分遮挡或隐藏时,这个问题变得尤为关键,因为机器人并未经过明确的训练来保留其需要操作的特定物体的 3D 结构。

为了解决这个问题,团队开发了一种像“聚光灯”一样的训练过程,只照亮感兴趣的物体。当机器人接收到指令时,系统首先解析语言以识别目标物体及其预期的交互顺序。随后,它会为该特定物体构建一组标准(或称规范)视图,从而有效地为该物体创建一个纯净的、孤立的 3D 蓝图。在训练阶段,机器人会被展示这些孤立的视图,并被要求将其内部理解与目标的几何结构对齐,同时忽略场景中的其余部分。这个过程包含两个主要步骤:根据视觉外观预测目标的隐藏 3D 结构,并将机器人的中间处理层与该特定物体的详细几何特征进行对齐。至关重要的是,这种额外的训练监督仅在机器人学习期间使用;一旦训练完成,机器人的运行方式与之前一致,无需任何额外的 3D 传感器或复杂的处理过程。

该方法的成果在模拟环境和真实的物理机器人上都得到了测试。在旨在测试机器人操控能力的系列标准基准测试中,这种新方法实现了 94.4% 的成功率,优于使用相同底层架构的以往模型。这种改进在需要精细辨别能力的任务中尤为明显,即机器人必须在相似物体之间做出选择。在测试机器人连续完成五项不同任务能力的 CALVIN 基准测试中,该系统平均完成了 4.47 项任务,较之前的最佳水平有了小幅但具有意义的提升。这些数字表明,通过将焦点从整个场景转向特定目标,机器人变得更加精准且不易产生混淆。

然而,衡量这种方法的真正考验是,研究人员将机器人置于一个目标物体被部分遮挡的真实场景中。他们设置了一个双臂机器人,并要求它拿起并放置诸如土豆和香蕉之类的物品,有时会用遮挡物盖住目标物体的约 25%。在这种挑战性条件下,新系统成功率达到了 54%。这与使用传统“全场景”方法的同类机器人控制组相比是一个巨大的飞跃,后者的成功率仅为 28%。这 26 个百分点的差距凸显了“指令感知空间理解”的价值:当目标被部分遮挡时,知道要寻找什么的机器人仍然可以推断出其形状和位置,而观察整个场景的机器人则往往无法重建缺失的部分。

除了数据之外,研究还表明,机器人确实学会了如何表示特定物体的几何结构。当研究人员分析模型的内部层时,他们发现该系统比以往的模型编码了更多关于目标形状的详细信息。此外,机器人能够根据语言指令可靠地检索出正确的物体,证明其内部地图与听到的词汇直接相关。这表明机器人不仅仅是在记忆模式,而是正在发展出一种将语言与 3D 空间联系起来的灵活理解能力。通过教导机器将几何注意力集中在重要的物体上,研究人员向着让机器人能够以更高的信心和技能处理人类环境中混乱、杂乱且经常被遮挡的现实情况迈出了重要一步。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →