在现代计算机视觉领域,机器在理解单张照片方面已变得异常出色。通过在数十亿张图像上进行训练,人工智能系统已经学会了以类人的流利度来识别物体、纹理和场景。这些被称为“基础模型”的系统充当了一种通用的视觉语言,能够描述图片中的内容或在庞大的数据库中寻找相似物体。然而,一个显著的盲点依然存在:这些模型的训练主要基于扁平的二维图像。当计算机观察单张照片时,它看到的是像素的平面模式,但却难以理解该模式背后的三维现实。如果你从正面拍摄一张椅子的照片,然后再从侧面拍摄,标准的模型可能会将其视为两个完全不同的东西,无法意识到它们是同一个空间中的同一个物体。这种空间意识的缺失,使得机器难以在现实世界中导航、构建3D地图,或理解不同视角下的物体如何相互关联。
不列颠哥伦比亚大学与索尼的研究人员开发出一种新方法来弥补这一差距,将扁平的二维视觉智能转化为一种无需同时观察多个角度即可理解深度与几何结构的系统。他们的方法被称为 DDMS,其核心在于一个巧妙的观察:虽然标准的图像模型对3D结构是“盲目”的,但其他专门用于预测深度和几何形状的模型在这方面表现卓越,只是这些模型往往过于单一,无法用于通用任务。该团队创建了一个训练过程,其中一个能够同时观察场景多个视角的“教师”系统,教会一个“学生”系统如何仅凭单张图像就能以三维方式观察世界。这位“教师”结合了标准图像模型的广泛语义知识与多视角深度模型的精确几何理解。通过严格的训练过程,教师学会了识别图像中的哪些点对应于现实世界中的同一个物理位置(即使是从不同角度观察时),同时确保物体的不同部分保持清晰且可辨识。
一旦这位“教师”训练完成,它就会将其知识传递给“学生”。“学生”是一个更简单的单视角模型,它从未同时看到过多张图像。它通过模仿教师对3D空间的内在理解来进行学习。结果是,这种视觉编码器既保留了原始强大模型识别物体和场景的能力,又获得了一项至关重要的全新超能力:它现在能够理解所观察物体的3D形状。在测试中,这一新系统被证明远优于以往尝试让模型具备3D感知能力的尝试。在涉及室内场景的实验中,这些新特征使得计算机能够比以前更准确地匹配房间内不同视角下的点。它能够区分正面看到的椅子和侧面看到的同一把椅子,并在其内部记忆中正确地将它们联系起来,同时仍能将椅子的特征与桌子的特征区分开来。
研究人员还发现,这种3D意识并没有以牺牲模型的原有优势为代价。通常,当科学家试图强迫模型理解几何结构时,它会失去识别语义细节的能力,例如它正在观察哪种物体或如何将其从背景中分割出来。这种新方法避开了这个陷阱。由此产生的特征在执行诸如识别杂乱房间中的物体或估计物体距离等任务时依然表现出色,同时在保持不同摄像机角度下的一致性方面也变得更加优秀。团队通过将模型学习到的特征投影到3D点云或虚拟3D场景中展示了这一点。在这些测试中,其特征保持了连贯性和对齐性,而其他方法的特征在从新角度观察时则往往会变得模糊或不一致。
这项工作为使人工智能在物理世界中更加稳健指明了方向。通过将专门的几何模型中复杂的、多视角的推理能力,蒸馏到单个高效的图像处理器中,研究人员创造了一个可以用于实时应用的工具,例如在机器人穿行于走廊或无人机飞越森林等无法同时观察多个角度的场景中。该方法并不要求最终系统拥有深度传感器或多个摄像机的访问权限;它仅仅是在自身的视觉表示中携带了3D理解。研究结果表明,提升3D视觉的关键可能不在于构建需要海量数据的更大、更复杂的模型,而在于教导现有的强大模型透过几何学的棱镜去观察世界,通过精炼它们的理解,直到它们能够看透像素背后世界的形状。
技术摘要:DDMS —— 将多视图基础特征判别式蒸馏至单视图模型
1. 问题陈述
近期在海量单图数据上预训练的视觉基础模型(如 DINOv2)已成为通用视觉任务的强大骨干网络,这归功于其强大的语义迁移能力。然而,当在多视图环境下进行评估时,这些特征往往表现出有限的 3D 感知能力:
- 不一致性(Inconsistency): 从同一场景的不同视角提取的特征可能会发生显著变化。
- 缺乏可分性(Lack of Separability): 视觉上相似但在几何上截然不同的区域,在特征空间中可能无法得到充分分离。
- 现有方案的权衡(Trade-offs in Existing Solutions):
- 强制执行 3D 一致性的方法(如 Fit3D、SnD)往往会抹平细粒度的差异,从而损害图像匹配所需的局部判别力。
- 提高匹配判别性的方法(如 MEF)往往会降低原始基础特征的语义丰富度,使其不再适合作为通用的密集特征。
核心挑战在于如何将预训练的 2D 基础特征转化为既具备 3D 一致性 又具备 局部判别性,且不牺牲其 语义效用 的表示。
2. 方法论
作者提出了 DDMS(Discriminative Distillation of Multi-view Foundational Features into Single-view Models),这是一个两阶段框架,旨在将多视图几何知识蒸馏到单视图学生编码器中。
2.1 多视图感知教师模型的构建
第一阶段构建一个融合了语义与几何信息的“教师”模型:
- 输入: 一组 N 个输入视图。
- 组件:
- 一个预训练的 2D 视觉基础模型(如 DINOv2),提供语义特征 (Fmv)。
- 一个冻结的多视图几何基础模型(如 Depth Anything 3),提供编码了对应关系和极线线索的中间几何特征 (Fmg)。
- 融合: 语义特征与几何特征在相同的 ViT patch 网格上进行拼接。一个轻量级的投影模块 ψ(⋅) 将拼接后的特征映射回原始基础特征空间,并预测一个残差更新:
Tm=Fmv+ψ([Fmv;Fmg])
这种方式使教师模型保持接近原始特征空间,同时注入了跨视图的几何上下文。
2.2 判别式特征学习(教师模型精炼)
通过精炼教师模型,确保特征既具有 3D 一致性,又具有局部辨识度:
- 几何监督排序(Geometry-Supervised Ranking): 对于查询像素 x,根据几何有效性(重投影、深度一致性、表面法线一致性)从其他视图中采样候选点。候选点被标记为正样本(3D 邻近度 <τpos)或负样本(>τneg)。
- 应用一种可微的平均精度排序损失 (Ldisc),以鼓励几何有效的对应点在特征相似度空间中比不兼容的候选点具有更高的排名。
- 特征空间锚定(Feature-Space Anchoring): 为了防止精炼后的特征偏离原始语义流形,应用了一个语义锚定损失 (Lanchor),该损失惩罚与冻结的原始 2D 基础特征 (vx) 的较大偏差:
Lanchor=∣Q∣1x∈Q∑max(0,dcos(tx,vx)−δ)
- 教师目标函数: Lteacher=Ldisc+λanchorLanchor。
2.3 蒸馏至单视图学生模型
最终目标是一个在推理时仅基于单张图像运行的实用编码器。
- 过程: 精炼后的多视图教师模型被冻结。单视图学生编码器通过特征级蒸馏 (Ldistill) 被训练以模仿教师的特征图。
- 正则化: 学生模型同样受到与教师相同的几何监督排序目标 (Ldisc) 的约束,作为弱正则项以保留由教师学到的判别结构。
- 推理: 推理阶段仅使用学生编码器,无需多视图输入、相机位姿或几何模型。
3. 核心贡献
- 框架: 引入了一种利用多视图教师和单视图学生的 3D 感知几何基础特征蒸馏框架。
- 训练策略: 提出了一种通过 几何监督排序(确保局部可分性)和 特征空间锚定(保留语义结构)来训练多视图教师的新方法。
- 性能: 在对应关系、密集预测迁移和显式 3D 提升评估中展示了持续的增益,实现了几何一致性、判别性和语义保留之间的平衡。
4. 实验结果
该方法在多个维度上与包括 DINOv2(冻结)、Fit3D、MEF 和 SnD 在内的基线模型进行了对比评估:
- 直接特征质量:
- 分离度: DDMS 在 ScanNet 上实现了对应点与非对应点之间最大的间距,表明增强了特征的辨识度。
- 几何对应关系: 与所有基线相比,在 ScanNet 和 Navi-Wild 上的最近邻匹配准确率有了实质性提升。
- 语义对应关系: 在 SPair-71k 和 DAVIS 上表现强劲,表明几何性能的提升并未以牺牲语义匹配为代价。
- 密集预测迁移(线性探测):
- 语义分割: DDMS 在 ScanNet 和 ScanNet++ 上达到或略微超过了 SnD 的水平,同时显著优于 Fit3D 和 MEF。
- 深度估计: 该方法产生了连贯的深度结构,在 NYUv2 和 ScanNet 上优于 SnD。
- 3D 提升与渲染:
- 3D 点云分割: 在将特征聚合到 3D 点云后,DDMS 保持了高水平的分割准确度。
- 特征喷绘(Feature Splatting): 在神经渲染场景(3D Gaussian Splatting)中,DDMS 特征在 2D 输入与渲染视图之间保持了连贯性和一致性,而其他方法由于平滑或不匹配现象表现出差异。
- 消融实验: 证实了排序目标(用于判别性)和锚定损失(用于语义保留)的必要性,以及多视图教师条件化对于提升性能的重要性。
5. 意义与主张
本文声称 DDMS 成功弥合了 语义丰富度 与 3D 几何感知能力 之间的鸿沟。
- 平衡的表示: 不同于以往侧重于一致性(牺牲判别性)或侧重于匹配(牺牲语义)的工作,DDMS 产生的特征同时具备 3D 一致性、局部辨识度和语义迁移能力。
- 实用价值: 通过将多视图知识蒸馏到单视图学生模型中,该方法保留了标准 2D 骨干网络的效率和易用性,同时继承了多视图模型的几何鲁棒性。
- 泛化性: 该方法在不同规模的骨干网络(ViT-S, ViT-B, ViT-L)和基础模型(DINOv2, DINOv3)上均表现出色,表明这是一种增强视觉基础特征的通用策略。
作者强调,该方法在推理时不需要多视图输入,使其适用于仅有单张图像可用、但需要 3D 一致性的现实场景,如视觉定位、SLAM 和场景理解。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。