← 最新论文
💻 computer science

GaussVLA: Geometry-Aware Spatial Reasoning for Vision-Language-Action Model

GaussVLA 是一个基于 Mamba 的参数高效型视觉-语言-动作模型,它通过引入将 2D 特征转换为紧凑 3D 高斯标记(Gaussian tokens)的高斯空间分词器(Gaussian Spatial Tokenizer),以及用于结构化几何推理的深度感知思维链(Depth-Aware Chain-of-Thought)模块来增强空间推理能力,仅凭 2 亿参数便在 LIBERO 基准测试中实现了最先进的性能。

原作者: Md Selim Sarowar, Md Tanvir Islam, Sungho Kim, Sangtae Ahn

发布于 2026-08-27
📖 1 分钟阅读☕ 轻松阅读

原作者: Md Selim Sarowar, Md Tanvir Islam, Sungho Kim, Sangtae Ahn

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

通过观察人类来学习操作物体的机器人已成为现代人工智能的一个核心目标。多年来,研究人员一直依赖于将摄像机观察到的世界视为平面的彩色方块网格的模型,就像一张数字照片一样。这些模型擅长识别存在哪些物体并理解语言指令,但它们难以理解这些物体在三维空间中的物理形状和位置。它们将一个杯子视为像素模式,而不是一个坐在桌子上具有特定高度和方向的实体物体。这种局限性使得机器人难以执行需要精确处理的任务,例如拿起易碎物品或在拥挤的工作空间中导航,因为机器人缺乏真正的几何感。

为了弥补这一差距,一个研究小组开发了一个名为 GaussVLA 的新系统,旨在赋予机器人对物理世界更直观的理解。该系统不再依赖平面图像,而是将视觉数据转换为一组在空间中漂浮的微小三维形状,每个形状都携带有关物体位置、大小以及机器人对该信息置信度的信息。通过将这种几何理解与一种在移动前进行空间问题“思考”的新方式相结合,研究人员创建了一个既高度精确又体积惊人的机器人控制器。在测试中,该系统优于许多更大、更复杂的模型,这表明赋予机器人更好的空间感比单纯扩大其“大脑”规模更为重要。

问题的核心在于机器人目前是如何“看”世界的。传统系统将摄像机图像分解为一长串扁平的图块,无论远处的墙壁还是机器人面前的工具,都会将图像的每个部分视为同等重要。虽然这适用于简单任务,但在机器人需要判断距离或表面角度时就会失效。其他修复尝试涉及添加深度图(本质上是告诉机器人每个像素距离有多远的单一数值)。然而,这些深度图往往缺乏关于表面方向或距离测量可靠性的信息,导致机器人在环境变化时只能靠猜测。

研究人员通过引入一种称为“高斯空间分词器”(Gaussian Spatial Tokenizer)的新型视觉数据处理方式解决了这一问题。想象一下,将平面的图像中的每一个图块都升入空中,将其变成一个微小的、模糊的三维云团。这些云团都有中心点、大小以及描述所代表物体局部几何特征的形状。至关重要的是,系统还为每个云团分配了一个置信度分数,告诉机器人它对那部分三维世界的确定程度。这使得机器人能够专注于最可靠的场景部分,例如桌子的边缘或杯子的把手,同时忽略不确定的区域。这种转换将一张平面照片变成了一张机器人可以进行推理的有结构的、三维的地图。

一旦机器人拥有了这个三维地图,它仍然需要决定该做什么。以前的系统通常试图通过在移动前生成一段长长的基于文本的思想来制定计划,这个过程缓慢且往往与实际的物理动作脱节。新系统使用了一种称为“深度感知思维链”(Depth-Aware Chain-of-Thought)的不同方法。该系统并不编写长篇故事,而是使用一组集中的问题来快速扫描其三维地图,并提取完成任务所需的最重要的空间关系。它会问自己,例如目标物体相对于机器人的手在哪里,并利用这个答案直接引导其运动。这种方法不是缓慢的、逐步的文本生成,而是一个快速的、结构化的推理过程,它与机器人的移动决策同步进行。

整个系统构建在名为 Mamba 的骨干架构之上,该架构旨在比目前大多数人工智能使用的标准模型更快速、更高效地处理信息。这种效率至关重要,因为它允许机器人在不需要庞大计算机的情况下进行实时决策。研究人员在各种模拟任务中测试了他们的系统,包括移动物体、堆叠积木和遵循复杂指令。在这些测试中,新系统在一个标准基准测试中达到了 93.5% 的成功率,表现优于其他显著更大的领先模型。在专门测试空间推理能力的特定任务集中,它取得了 100% 的完美得分。

令这些结果尤为引人注目的,是该系统的规模。虽然许多竞争模型需要数十亿个参数才能运行,但这个新系统仅需 2 亿个参数。这意味着它大约比目前使用的某些最大模型小 97%,但在处理需要理解物理空间的任务时表现更好。研究人员还在物理实验室中使用真实的机械臂测试了该系统。即使面对相机噪声和物体位置略有不同的现实世界挑战,该系统仍保持了很高的成功率,证明了它在模拟中学习到的三维几何理解可以迁移到现实世界。

研究还探讨了当系统面临意外变化(如不同的光照或物体颜色)时的情况。虽然该系统表现出了很强的鲁棒性,但研究人员指出,当环境发生剧烈变化时,它仍然面临困难,这表明在使机器人适应每一种可能的现实场景方面仍有工作要做。然而,结果清楚地表明,实现更好机器人操控的关键不仅仅是拥有更多的数据或更大的模型,而是赋予机器人对其所处空间的结构化、三维的理解。通过将平面图像转化为三维云团并利用集中的推理来导航,研究人员展示了一条让机器人能以更高技能和可靠性处理物理世界的清晰路径。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →