想象一下,你正在试图教一个机器人如何理解周围的 3D 世界,不仅仅是通过看扁平的照片,而是要理解物体在哪里、它们之间距离多远,以及从某个特定位置能看到什么。
目前的多数 AI 模型尝试通过两种方式来实现这一点:要么从头构建一个复杂的、定制化的“3D 大脑”(这既困难又昂贵);要么喂给它们数百万个关于 3D 问题和答案的示例(这需要巨大的计算能力)。
OneCanvas 采取了一种不同且更简单的方法。你可以把它想象成将一段杂乱的多角度视频转化为一张单一的、完美的 360 度全景地图,让 AI 可以像阅读普通图片一样阅读它。
以下是它的工作原理,分为几个简单的步骤:
1. “神奇地图”(全景重投影)
想象你站在一个房间里,手里拿着一个 360 度相机。你一边走动一边观察不同的物体并进行拍摄。
- 旧方法: AI 试图在脑海中将这些分离的视频帧拼接在一起,猜测物体之间的相对位置。这就像是在蒙着眼睛玩拼图。
- OneCanvas 的方法: 系统获取视频中的每一个微小部分(每一个“图像块”),观察它的深度,并在数学上将其从扁平的屏幕中“提升”到 3D 空间。
- 画布: 然后,它将所有这些被提升的碎片绘制在一张单一的、巨大的、圆形的“画布”上(就像世界地图一样)。如果一把椅子在你的左边,它就会被画在地图的左侧。如果一张桌子很远,它就会被画在更远的地方。
- 结果: AI 不再需要猜测了。它只需观察这张单一的、巨大的地图。它能在一张图像中看到整个房间,且每个物体都在其正确的 3D 位置上。
2. 添加“尺子”(3D 位置嵌入)
扁平地图有一个问题:它们可以告诉你“方向”(左/右),但往往会丢失“距离”感(多少米远)。
- 解决方法: OneCanvas 为地图的每一部分都添加了一把特殊的“尺子”。它为每个物体附带了一个数字标签,精确说明该物体距离实际有多远(以米为单位)。
- 为什么重要: 这让 AI 能够回答诸如“这个房间有多大?”或“门离多远?”之类的问题,而无需进行猜测。这就像是在 AI 的眼睛里内置了一把卷尺。
3. “空房间”训练(空间预训练)
在 AI 尝试理解真实的、杂乱的房间之前,研究人员先在“虚拟沙盒”中对其进行训练。
- 类比: 想象一位老师在完全空白的白桌子上放了几个玩具积木。老师问学生:“红色的积木离蓝色的积木有多远?”
- 诀窍: 因为桌子是空的,学生无法通过记忆“红积木通常靠近蓝积木”来作弊。他们必须利用尺子和地图来计算出结果。
- 益处: 这迫使 AI 去学习真正的几何学和空间规则,而不是仅仅根据它在之前视频中看到的模式进行猜测。一旦它掌握了这种“空房间”逻辑,它就能轻松地将其应用到真实的、拥挤的房间中。
为什么这意义重大?
- 成本低廉: 因为 AI 不需要复杂的新大脑,也不需要数百万小时的训练,它的计算量比最顶尖的竞争方法减少了约 10 倍。
- 准确度高: 它目前在主要的 3D 理解测试(如 SQA3D 和 VSI-Bench)中占据领先地位,击败了许多比它复杂得多的模型。
- 灵活性强: 你可以将这张“地图”中心设置在任何你想要的视角。如果你想从站在角落里的机器人的视角来回答问题,你只需旋转地图。如果你想从机器人的眼睛高度来看,你再次旋转即可。AI 处理这一切都非常自然。
简而言之:OneCanvas 将混乱的 3D 视频转化为一张带有内置尺子的单一、易读的 360 度全景地图。它通过先在简单的、空的设置中进行练习,教会 AI 理解空间,使其无需超级计算机就能成为 3D 专家。
技术摘要:OneCanvas:通过全景重投影实现 3D 场景理解
问题陈述
现有的视觉语言模型(VLMs)在 3D 场景理解方面表现不佳,特别是在情境推理任务中(例如,“椅子距离门有多远?”或“从这个视角可以看到什么?”)。目前的方法通常分为两类,这两类都会产生显著成本:
- 架构复杂性: 为预训练的 2D VLM 增加专门的几何编码器(例如,点云分词器、深度调节编码器)或复杂的融合模块。这些方法需要进行大规模联合训练,以将新的几何组件与语言骨干网络对齐。
- 数据规模化: 依赖于海量的、经过精心策划的空间问答数据集,通过单纯的接触量来教授几何推理。
最近的审计表明,即使进行了这些改进,许多模型也未能真正对几何输入进行推理,而是依赖于问题模板和场景类别的统计规律。此外,这些方法通常跨帧分块处理场景,缺乏统一的空间坐标系,这使得基于特定视角的场景理解变得困难。
方法论:OneCanvas
OneCanvas 将 3D 场景理解重新定义为在单个全景画布上的 2D 空间推理。它避免了修改 VLM 的架构或添加辅助损失项。相反,它将多视图 RGB-D 数据转换为 VLM 可以作为标准图像摄入的表示形式。
1. 特征提取与 3D 提升
给定一组带有度量深度图 {Dk} 和相机内参的已定姿态 RGB 图像 {Ik}:
- 一个冻结的视觉编码器(Qwen3-VL)从每个视图中提取补丁级特征 Fk。
- 每个补丁 (u,v) 利用其深度 z、相机内参和相机到世界坐标的位姿 Tk 被“提升”到 3D 世界坐标 pworld。
- 这产生了一组提升后的补丁 P={(pi,fi,ti)},其中 pi 是 3D 世界坐标,fi 是特征,ti 是源帧的临时索引。
2. 全景重投影
提升后的补丁被聚合到一个由选定原点 c 和方向 R 定义的等距柱状全景画布上。
- 连续定位: 与平均或选择重叠补丁的光栅化方法不同,OneCanvas 将每个补丁放置在其在画布上的连续角度位置(经度 θ 和纬度 ϕ)。共定位的补丁保持为不同的 token。
- 位置编码: 使用 VLM 原生的 3D 旋转位置嵌入(3D-RoPE),其中空间维度对应于连续的经度和纬度,时间维度对应于源帧索引。
- 3D 位置嵌入: 为了恢复将 3D 坐标折叠到角度画布位置时丢失的度量深度,每个补丁的特征中都添加了一个 3D 位置嵌入。该嵌入使用正弦编码对轴、径向原语和单位射线方向进行编码,以表示画布框架中的度量偏移 (qx,qy,qz)。这使得 VLM 能够通过其标准的注意力机制访问度量尺度信息。
3. 两阶段训练
该方法采用两阶段训练流水线,以克服从下游问答中学习几何的难度:
- 第一阶段:空间预训练课程: 模型在一个程序化生成的课程上进行训练,该课程将物体特征(取自真实图像)放置在 otherwise 空白的画布上,并具有特定的 3D 坐标。任务包括度量测量、自我中心方向、导航、可观测性、计数和边界框读取。这一阶段迫使模型学习几何推理,而不依赖于场景特定的先验知识或类别身份捷径。
- 第二阶段:目标适配: 第一阶段的权重被合并到基础模型中。随后,在一个新的低秩 LoRA 适配器上,针对下游空间问答数据集(SQA3D、VSI-Bench、ViCA)进行训练,以使几何推理能力适应现实世界的场景分布。
核心贡献
- 全景特征重投影: 一种将所有视图的补丁特征聚合到单个等距柱状画布上的机制。这匹配了预训练 VLM 的输入格式,无需修改架构,并支持灵活的画布原点以进行情境推理。
- 空间预训练课程: 由全景表示启发的创新训练策略。通过在空白画布上程序化地放置补丁特征,作者可以生成具有受控答案分布的多样化空间任务的即时监督,从而有效地抑制数据集统计偏差带来的捷径。
结果
OneCanvas 在主要的 3D 空间推理基准测试中实现了最先进的性能,同时使用的训练计算量显著低于竞争方法:
- SQA3D: 实现了 65.3 EM@1(比之前的最佳水平高出 2.3 点),在测试情境推理的“Which”(哪个)和“Can”(能否)类问题上取得了显著增益。
- VSI-Bench: 实现了 70.1 的平均准确率,在路径规划和房间大小估计方面处于领先地位。
- SPBench: 实现了 72.1 的零样本整体准确率(比次优结果高出 4.8 点),展示了强大的分布外泛化能力。
- 效率: 与最强的竞争方法(如 SenseNova-SI 约需 27,648 A100 等效 GPU 小时)相比,该方法使用的训练计算量低了一个数量级(约 290 A100 等效 GPU 小时)。
消融实验证实,全景重投影和空间预训练课程都是至关重要的,特别是对于需要度量推理和多步导航的任务。
意义与局限性
论文声称 OneCanvas 证明了,只要输入表示能够与 VLM 的预训练能力对齐,就可以在不使用复杂的几何编码器或大规模策划数据集的情况下,实现高质量的 3D 场景理解。通过将多视图数据统一到一个单一的空间坐标系中,并显式注入度量位置嵌入,该方法使 VLM 能够利用其原生的注意力机制对 3D 空间进行推理。
局限性:
- 对深度和位姿的依赖: 该方法需要度量深度和相机位姿,而纯 RGB 方法则不需要。虽然前馈重建可以估计这些参数,但误差可能会降低画布质量。
- 全局全景的权衡: 将场景表示为单个全局全景图是用精细的空间精度换取了紧凑性,这可能会限制其在非常大或室外场景中的表现。
- 课程设计: 预训练课程是人工编写的;引入定性的新空间技能需要编写新的任务生成器,而不仅仅是收集更多数据。
- 骨干网络要求: 该方法假设骨干网络至少具有 2D 位置编码(例如多轴 RoPE)以承载经度和纬度,这可能不适用于 1D 位置模型。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。