← 最新论文
💻 computer science

Qwen-3D: A Generalist 3D Vision-Language Model for Spatial Understanding

Qwen-3D 是一种新颖的几何感知大语言多模态模型,它利用 3D 旋转位置嵌入和基于查询的分割解码器,将图像和视频中的空间推理、指代定位以及实例分割统一起来,有效地弥合了语言与密集 3D 几何预测之间的差距,同时超越了现有的专业化模型和专有模型。

原作者: Lucy Lin, Ayush Jain, Yifan Liu, Katerina Fragkiadaki

发布于 2026-08-05
📖 1 分钟阅读☕ 轻松阅读

原作者: Lucy Lin, Ayush Jain, Yifan Liu, Katerina Fragkiadaki

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在试图教一个机器人如何观察这个世界。长期以来,这些机器人就像是带着相机的游客:它们可以拍一张房间的照片,然后告诉你:“那是一把椅子”或者“那里有三个人”。这对于平面照片或短视频片段非常有效。但如果你要求机器人走遍整个房子,从厨房、走廊和卧室的角度观察同一把椅子,然后准确地告诉你这把椅子在3D空间中的确切位置,事情就会变得一团糟。机器人会感到困惑,因为它正试图将成千上万张独立的2D图像缝合在一起,这就像是试图通过粘贴成千上万张扁平的明信片来建造一座房子。这既缓慢又耗费脑力,而且它经常会丢失对现实世界中物体实际位置的追踪。

这就是“3D视觉语言模型”面临的挑战。科学家们希望构建一种不仅能识别物体,还能理解物体的形状、位置以及与3D环境中其他事物之间关系的AI,同时还能听从人类的指令。核心问题在于:我们如何让一个AI能够从各个角度观察一个房间,记住布局,并在不迷失在海量数据中的情况下指向正确的物体?如果我们能解决这个问题,机器人终于可以穿梭于我们的家中,帮我们寻找丢失的钥匙,或者协助完成复杂的建筑任务,从而从仅仅是“看见”进化到真正“理解”周围的空间。

于是,诞生了 Qwen-3D——由卡内基梅隆大学的研究人员开发的一种新型AI,它扮演着这些数字世界的“首席建筑师”。Qwen-3D并没有将每一帧视频视为一张独立的平面图片,而是采取了一种聪明的方法:它将所有这些不同的视角“熔炼”成一张单一且持久的3D地图。想象一下,如果你能从不同角度拍摄一座雕塑的照片,并瞬间将它们融合进脑海中,变成一个可以旋转的实体雕像。这就是该模型处理视觉数据的方式。它利用深度信息(物体有多远)和相机位置,将一段漫长且蜿蜒的视频流压缩成一个紧凑的3D表示。这使得AI能够对整个场景进行推理,而不是困于逐帧观察。

论文指出,以往教授AI 3D技能的方法存在一个主要的瓶颈。旧的模型尝试通过书写文本(例如“椅子位于坐标1.2, 0.8, 0.9”)来描述3D位置,或者从一个预设的物体列表中进行选择。作者认为,这些方法就像是试图仅用一套有限的表情符号来描述一幅复杂的画作,或者通过猜测哪个预印好的贴纸最合适来描述物体。这是一种尴尬且低效的沟通方式。Qwen-3D通过将AI的“大脑”(其语言推理能力)直接连接到“手”(分割解码器)来解决了这个问题,使其能够指向3D场景中的特定部分。它不再是猜测坐标,而是学习如何高亮显示用户所谈论的物体的精确形状,无论是床上的枕头,还是街道场景中的交通灯。

实验结果非常令人印象深刻。在各种基准测试中,Qwen-3D的表现优于现有的3D AI模型,甚至在理解3D空间方面击败了几种大型商业2D模型。具体而言,研究人员发现,与之前的最佳方法相比,Qwen-3D将3D视觉定位(基于描述寻找物体)提升了4%,并将3D实例分割(从场景中分离单个物体)提升了13%。值得注意的是,它在实现这些提升的同时,并未丧失理解标准2D图像和视频的能力,这证明了你可以教会一个模型进行3D视觉感知,而不必让它忘记如何进行2D视觉感知。

然而,作者也谨慎地指出,这目前还不是解决所有情况的“万灵药”。该模型目前假设世界主要是静态的;在动态环境中(例如车辆疾驰而过的繁忙街道),它会表现得比较吃力。此外,它依赖外部工具来估算深度和相机位置,这意味着如果初始测量有误,AI的理解可能会出现偏差。虽然这代表了弥合语言与3D感知之间差距的重要一步,但研究人员建议,未来的工作需要应对这些“移动的目标”,并或许要让模型学会自主估算几何结构。目前,Qwen-3D是一个强大的新工具,它表明提升3D AI的关键不仅在于更好的数据,更在于一种更聪明的方式,将AI所“见”的内容与其所“说”的内容连接起来。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →