← 最新论文
💻 computer science

VLEM: Real-Time 3D Vision-Language Embedding Mapping

VLEM 是一个实时框架,它将来自原始 RGB-D 流的像素对齐 2D 视觉-语言嵌入集成到全局一致且具有度量准确性的 3D 表示中,从而在无需地面真值姿态的情况下,实现卓越的开集分割和交互式机器人操控。

原作者: Christian Rauch, Björn Ellensohn, Linus Nwankwo, Vedant Dave, Elmar Rueckert

发布于 2026-09-17
📖 1 分钟阅读☕ 轻松阅读

原作者: Christian Rauch, Björn Ellensohn, Linus Nwankwo, Vedant Dave, Elmar Rueckert

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

长期以来,机器人一直难以像人类那样理解世界。如果给予足够的示例,它们可以被编程为识别特定的椅子或特定的门,但它们无法仅通过像“蓝色的马克杯”或“沉重的工具箱”这样的描述来轻松理解一个新物体。这种局限性源于机器人传统上构建环境的方式:它们构建的是精确的、几何的空间模型,但这些模型缺乏语言所提供的丰富且灵活的含义。对于机器人要真正与动态环境进行交互,它需要一张不仅在距离和形状上准确,而且能通过我们日常使用的词汇进行搜索的地图。挑战在于如何将 3D 地图的锐利度量精度与现代语言模型的广泛、开放式理解相结合,同时还要运行得足够快,以便机器人在无需超级计算机的情况下也能移动并做出反应。

来自莱奥本技术大学(Technical University of Leoben)的一个研究小组开发了一种名为 VLEM 的新系统,全称为视觉-语言嵌入映射(Vision-Language Embedding Mapping),旨在解决这一问题。他们的工作通过创建一个三维地图来弥补视觉与理解之间的鸿沟,该地图不仅存储物体的形状,还存储了这些物体外观及其与语言关系的数字“指纹”。与以往需要完美相机数据或海量内存的尝试不同,该系统可以使用标准摄像机传输的简单彩色和深度图像流进行工作。它随着机器人的移动构建一个活生生的世界地图,允许用户询问“咖啡机在哪里?”,然后让机器人立即指向正确的物体,即使它以前从未见过那台特定的咖啡机。

该系统的核心在于如何处理视觉信息。现代人工智能模型已经可以通过将图像和文本转换为数学向量(本质上是代表意义的一系列数字)来理解两者之间的关系。然而,这些模型通常处理的是平面的二维图像。研究人员面临的任务是将这些二维理解投影到机器人可以导航的三维空间中。他们通过将摄像机的视野分解为小的区域,提取每个区域的意义指纹,然后将这些指纹缝合在一起,形成一个单一且一致的 3D 点云来实现这一目标。这个点云充当了房间的数字孪生体,其中每一个点都同时持有空间位置和源自视觉数据的语义含义。

这种方法的独特之处在于其效率以及处理不确定性的能力。许多现有系统试图通过在整个数据集上训练复杂的神经网络来构建这些地图,这是一个缓慢的过程,且需要预先知道摄像机的精确位置。相比之下,VLEM 实时运行,在处理图像到达的同时估算摄像机的实时位置。它使用一种巧妙的方法来优化视觉数据,屏蔽掉无关的背景噪声,以确保附加在物体上的意义是纯净且精确的。例如,当系统观察一台咖啡机时,它会将该物体从背后的墙壁中分离出来,确保“咖啡机”的数字指纹不会被墙壁的颜色所稀释。这使得机器人能够高精度地区分相似物体,例如,仅仅通过文本查询的具体程度,就能分辨出通用的电钻和特定的博世(Bosch)电钻。

研究人员在各种环境中测试了他们的系统,包括厨房、车间和大面积办公区,使用了静态数据集和实时机器人实验。他们发现,在根据文本描述识别物体方面,该方法产生的结果显著优于之前的最先进系统。虽然其他系统经常在边界模糊处遇到困难,或者需要大量的计算机内存,但 VLEM 成功地利用不到 12 GB 的显存创建了一个紧凑且高质量的地图,这个容量可以适配许多现代计算机中常见的标准显卡。这种效率至关重要,因为它允许机器人在运行映射软件的同时,还能同步运行其自身的运动控制。在实际演示中,该系统成功引导机械臂根据简单的语音或键入指令,抓取特定物品并将其放置在指定位置。

VLEM 的成功表明,未来机器人的交互可能不再依赖于教给机器人一份关于世界上所有物体的固定清单,而是赋予它们一种通过语言理解世界的灵活方式。该系统证明,可以在无需针对特定环境进行预训练或无需地面真值(ground-truth)相机数据的情况下,维持一个既具有度量准确性又可由自然语言查询的 3D 表示。研究人员指出,虽然他们目前的方法在识别单个物体方面表现良好,但尚未完全捕捉到不同项目之间的复杂关系,例如知道杯子放在桌子上。然而,通过证明高质量、实时的语义映射在现有硬件上是可行的,这项工作为下一代能够真正理解并与人类世界互动的机器人奠定了坚实的基础。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →