在数字世界中,三维物体无处不在,从机器内部的齿轮到博物馆中保存的古代文物皆是如此。为了在成千上万个数字模型中找到特定的物体,计算机需要一种能够理解物体从各个角度看去是什么样子的方法。几十年来,研究人员一直试图通过从多个侧面拍摄物体的照片来教机器识别这些形态,就像摄影师绕着雕像走动以捕捉其完整形态一样。早期的尝试依赖于人类编写的简单规则来描述形状,但这些规则往往无法捕捉到现代设计的复杂细节。近年来,强大的计算机系统已经学会了自主识别图像中的模式,但在尝试将数十张不同的照片组合成对一个物体的清晰理解时,它们仍然面临困难。挑战在于如何帮助计算机不仅看到单张照片,还要看到它们之间的几何关系,确保无论从正面、侧面还是倒置的角度观察,一把椅子看起来都还是一把椅子。
哈尔滨工业大学与中国科学院的研究团队开发了一种名为“多视角聚合 Transformer”(Multi-View Aggregation Transformer)的新系统来解决这一问题。他们将识别三维形状的任务视为一场由许多不同相机视角进行的对话。该系统并非只是简单地将图像堆叠在一起,而是使用了一种基于十二面体(一种具有十二个平坦面和二十个顶点的固体)形状的特殊相机设置。通过将虚拟相机放置在每个顶点并指向中心,他们捕获了物体的六十个不同视角。这种特定的排列方式确保了整个表面被均匀覆盖,提供了物体的完整几何图谱。随后,该系统使用一种被称为“视觉 Transformer”(Vision Transformer)的高级人工智能来分析这六十张图像。与那些可能会忽略遥远视角之间联系的旧方法不同,这个新系统会关注每一个视角如何与其他所有视角相互关联,从而构建出物体的统一结构图景。
研究人员发现,仅仅收集这些视角是不够的;计算机需要一种理解由其相机布局所产生的特定关系的方法。为了实现这一点,他们设计了一个分为三层的层次化注意力系统。首先,它观察大局,理解所有视角如何连接并构成整个物体。其次,它专注于位于虚拟十二面体同一平面上的视角组,识别局部模式。最后,它检查从完全相同位置但轻微旋转后拍摄的视角之间的细微差异,这有助于区分外观非常相似的物体。这种循序渐进的关注方式使得系统比以往的方法能更有效地学习几何形状。为了进一步完善对物体的最终描述,他们添加了特殊的模块来调整不同特征的重要性,确保关键细节被突出显示,同时过滤掉不太有用的信息。
他们工作中的一个关键创新是衡量两个物体相似度的新方法。传统方法通常将一个物体及其镜像视为完全不同的个体,因为其数据点的数学方向是相反的。然而,对于寻找特定部件或设计而言,数据的方向并不如形状本身那么重要。研究人员引入了一种度量标准,将相反的方向视为等效,这使得系统即使在内部数据点朝向相反时也能识别出两个物体是相同的。这种灵活性使该系统在大型数据库中进行匹配时表现得更加出色。在针对包括通用物体(如椅子和桌子)以及复杂机械零件在内的标准三维模型集合进行测试时,该新系统取得了卓越的准确率。它在通用数据集上的识别成功率达到了 93.2%,在机械部件上的成功率达到了 95.4%,超越了以往所有的研究方法。
团队还发现,训练系统的方式与系统本身同样重要。他们使用了一个三阶段的过程来教导计算机。首先,他们教它从单张图像中识别形状。接着,他们冻结了这部分知识,并教它如何在不忘记已学知识的前提下如何组合多个视角。最后,他们让整个系统协同学习,以微调其理解能力。这种精心的训练策略防止了系统因任务的复杂性而产生混乱。结果表明,即使在物体被随机旋转的情况下,该系统依然保持稳健,而旋转是现实应用中的常见挑战。通过结合几何智能的相机布局、层次化的注意力系统以及灵活的相似度测量方法,这项研究为数字设计、制造业和文化遗产保护提供了一个强大的新工具,证明了理解三维形状的关键在于我们如何教机器观察全局。
技术摘要:基于对比学习的多视图聚合 Transformer 用于 3D 形状检索
1. 问题陈述
3D 形状检索是机械设计、数字遗产和多媒体系统中的一项基础任务。虽然深度学习已经超越了传统的对手工特征描述符,但现有的基于视图的方法面临三个核心局限性:
- 感受野受限: 基于 CNN 的方法难以对多视图特征之间的长程依赖关系进行建模。
- 几何失配: 标准的注意力机制无法与多视图相机布局固有的几何对称性相匹配,导致归纳偏置(inductive bias)欠佳。
- 方向过度约束: 使用标准余弦相似度的传统对比学习施加了严格的方向约束。它会区分相反的特征向量,但这对于检索任务而言是不必要的,因为检索的目标是语义或几何相似性,而非保持向量的方向性。此外,标准的通道注意力通常将特征限制在非负空间,从而限制了基于角度度量指标的有效性。
2. 方法论
作者提出了 MVAT(多视图聚合 Transformer),这是一个旨在通过结构化流水线解决上述局限性的几何对齐框架。
2.1 数据获取与骨干网络
- 相机布局: 系统使用基于正十二面体的正则相机配置渲染 3D 模型的 60 个视图。该布局将相机放置在正十二面体的 20 个顶点处,每个顶点具有三个平面内方向,确保了均匀的球面覆盖和结构化的几何关系。
- 骨干网络: 使用预训练的 MaxViT (Vision Transformer) 从 60 幅渲染图像中提取单视图特征(维度 C=512)。
2.2 分层多视图注意力 (MVA)
为了利用正十二面体布局的几何结构,MVAT 引入了一个包含三个级联组件的多视图注意力模块:
- 全局注意力 (GA): 在所有 60 个视图之间计算全自注意力,以捕捉全局形状依赖关系。
- 面注意力 (FA): 对应于正十二面体 12 个五边形面的重叠视图组进行建模,捕捉局部表面一致性的上下文。
- 顶点注意力 (VA): 对每个顶点处的三个平面内方向进行细粒度相关性建模,捕捉方向敏感的变化。
- 顺序: 组件按 GA→FA→VA 的顺序进行级联,实现从全局到局部几何邻域的渐进式依赖建模。
2.3 有符号通道注意力和精炼
为了提高特征融合和判别力,引入了两个模块:
- 通道注意力聚合 (CAA): 通过结合最大池化和平均池化来聚合多视图特征。至关重要的是,它采用 tanh 激活函数(而非 sigmoid)来产生范围在 (−1,1) 之间的有符号通道调制。这使得网络能够保留正向和负向的特征响应,有利于基于角度的相似性度量。
- 残差通道注意力 (RCA): 由 16 个残差块组成的堆栈,用于精炼全局特征。它使用有界残差缩放(因子在 (0,2) 之间)来自适应地抑制或增强通道,而不产生不受控制的放大,从而确保稳定的渐进式精炼。
2.4 绝对余弦相似度 (ACS) 与训练
- 度量指标: 本文引入了绝对余弦相似度 (ACS),定义为 Sij=∣fi⊤fj∣/(∥fi∥∥fj∥)。该指标将相反的特征方向视为等价,在实射影空间中运行。
- 理论基础: 作者提供了几何可行性分析,表明 ACS 允许正交直线原型配置来实现符号不变的类别分离。这使得同类样本可以位于同一条直线上(无论哪个方向),而不同类别的样本则保持正交,从而放宽了标准余弦相似度的约束。
- 损失函数: 使用对称交叉熵损失进行监督对比学习,且无需温度参数进行优化,以降低对超参数的敏感性。
- 三阶段训练流水线:
- 第一阶段: 使用标准交叉熵对 ViT 骨干网络进行单视图预训练。
- 第二阶段: 冻结骨干网络进行聚合训练,仅使用对比损失训练聚合网络(MVA、CAA、RCA)。
- 第三阶段: 对整个网络进行全端到端微调。
3. 核心贡献
- 几何对齐的分层注意力: MVA 模块将正十二面体布局的几何归纳偏置显式编码到注意力机制中,通过建模全局、面级和顶点级相关性来提高旋转鲁棒性。
- 用于判别性融合的有符号通道注意力: CAA 和 RCA 模块利用有符号调制(通过 tanh)和有界残差缩放,在全特征空间中实现有效的特征精炼,克服了非负注意力策略的局限性。
- 符号不变的对比学习: 引入的绝对余弦相似度 (ACS) 为监督检索提供了一个几何目标,将相反的方向视为等价。理论分析证实了其通过正交直线原型实现高维多类分离的可行性。
4. 实验结果
该方法在三个基准测试上进行了评估:ModelNet40、ModelNet10 和 机械部件基准 (MCB-B)。
- ModelNet40: MVAT 达到了 93.2% mAP,超越了之前的 SOTA 方法 MVTN (92.9%),并显著超过了经典的 MVCNN (80.2%)。
- ModelNet10: MVAT 达到了 95.1% mAP,优于 SPNet (94.2%) 和 VAM-IAM (93.6%)。
- MCB-B (工业部件): MVAT 达到了 95.4% mAP,88.6% F1@N,以及 96.0% NDCG@N,在 mAP 上比最强的对比方法高出 4.3%。
- 旋转鲁棒性: 在对模型进行随机角度旋转(最高 ±180∘)测试时,mAP 下降极小(不超过 1.2 个百分点),展示了强大的鲁棒性。
- 消融实验:
- 去除分层 MVA 或使用非分层顺序会导致性能下降(例如,完整的 GA→FA→VA 顺序为 93.2%,而无 MHA 时为 91.9%)。
- 将 ACS 替换为传统余弦相似度会导致性能下降 1.2% mAP。
- 三阶段训练流水线被证明优于一阶段或两阶段方法,最终阶段带来了 0.7% 的提升。
5. 重要性与主张
本文声称 MVAT 通过有效地弥合 2D 视觉表示学习与 3D 几何理解之间的差距,建立了基于视图的 3D 形状检索的新 SOTA。其重要性在于:
- 几何归纳偏置: 成功地将神经网络注意力机制与多视图相机布局(正十二面体)的物理对称性相对齐,而通用的注意力模块无法做到这一点。
- 放宽方向约束: 证明了对于检索任务,保持特征向量的方向是不必要的。所提出的 ACS 指标和直线原型配置为高维嵌入提供了一个更灵活且更有效的几何目标。
- 工业适用性: 该方法在 MCB-B 基准测试上表现尤为出色,表明其在几何相似性至关重要的工业部件检索领域具有很高的应用潜力。
作者总结道,虽然该方法在干净的 CAD 模型上表现良好,但未来的工作将侧重于将该框架应用于噪声较大的真实世界扫描数据,并整合多模态表示(点云、网格)。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。