← 最新论文
💻 computer science

Multi-View Aggregation Transformer with Contrastive Learning for 3D Shape Retrieval

本文提出了多视图聚合 Transformer(MVAT),这是一个几何对齐框架,通过整合层级化多视图注意力、专门的通道调制模块以及绝对余弦相似度度量,在多个基准测试中实现了 3D 形状检索的最先进性能。

原作者: Ze Zhang, Xiaojun Wu, Chenxi Wu, Guoyuan Liang

发布于 2026-09-04
📖 1 分钟阅读☕ 轻松阅读

原作者: Ze Zhang, Xiaojun Wu, Chenxi Wu, Guoyuan Liang

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在数字世界中,三维物体无处不在,从机器内部的齿轮到博物馆中保存的古代文物皆是如此。为了在成千上万个数字模型中找到特定的物体,计算机需要一种能够理解物体从各个角度看去是什么样子的方法。几十年来,研究人员一直试图通过从多个侧面拍摄物体的照片来教机器识别这些形态,就像摄影师绕着雕像走动以捕捉其完整形态一样。早期的尝试依赖于人类编写的简单规则来描述形状,但这些规则往往无法捕捉到现代设计的复杂细节。近年来,强大的计算机系统已经学会了自主识别图像中的模式,但在尝试将数十张不同的照片组合成对一个物体的清晰理解时,它们仍然面临困难。挑战在于如何帮助计算机不仅看到单张照片,还要看到它们之间的几何关系,确保无论从正面、侧面还是倒置的角度观察,一把椅子看起来都还是一把椅子。

哈尔滨工业大学与中国科学院的研究团队开发了一种名为“多视角聚合 Transformer”(Multi-View Aggregation Transformer)的新系统来解决这一问题。他们将识别三维形状的任务视为一场由许多不同相机视角进行的对话。该系统并非只是简单地将图像堆叠在一起,而是使用了一种基于十二面体(一种具有十二个平坦面和二十个顶点的固体)形状的特殊相机设置。通过将虚拟相机放置在每个顶点并指向中心,他们捕获了物体的六十个不同视角。这种特定的排列方式确保了整个表面被均匀覆盖,提供了物体的完整几何图谱。随后,该系统使用一种被称为“视觉 Transformer”(Vision Transformer)的高级人工智能来分析这六十张图像。与那些可能会忽略遥远视角之间联系的旧方法不同,这个新系统会关注每一个视角如何与其他所有视角相互关联,从而构建出物体的统一结构图景。

研究人员发现,仅仅收集这些视角是不够的;计算机需要一种理解由其相机布局所产生的特定关系的方法。为了实现这一点,他们设计了一个分为三层的层次化注意力系统。首先,它观察大局,理解所有视角如何连接并构成整个物体。其次,它专注于位于虚拟十二面体同一平面上的视角组,识别局部模式。最后,它检查从完全相同位置但轻微旋转后拍摄的视角之间的细微差异,这有助于区分外观非常相似的物体。这种循序渐进的关注方式使得系统比以往的方法能更有效地学习几何形状。为了进一步完善对物体的最终描述,他们添加了特殊的模块来调整不同特征的重要性,确保关键细节被突出显示,同时过滤掉不太有用的信息。

他们工作中的一个关键创新是衡量两个物体相似度的新方法。传统方法通常将一个物体及其镜像视为完全不同的个体,因为其数据点的数学方向是相反的。然而,对于寻找特定部件或设计而言,数据的方向并不如形状本身那么重要。研究人员引入了一种度量标准,将相反的方向视为等效,这使得系统即使在内部数据点朝向相反时也能识别出两个物体是相同的。这种灵活性使该系统在大型数据库中进行匹配时表现得更加出色。在针对包括通用物体(如椅子和桌子)以及复杂机械零件在内的标准三维模型集合进行测试时,该新系统取得了卓越的准确率。它在通用数据集上的识别成功率达到了 93.2%,在机械部件上的成功率达到了 95.4%,超越了以往所有的研究方法。

团队还发现,训练系统的方式与系统本身同样重要。他们使用了一个三阶段的过程来教导计算机。首先,他们教它从单张图像中识别形状。接着,他们冻结了这部分知识,并教它如何在不忘记已学知识的前提下如何组合多个视角。最后,他们让整个系统协同学习,以微调其理解能力。这种精心的训练策略防止了系统因任务的复杂性而产生混乱。结果表明,即使在物体被随机旋转的情况下,该系统依然保持稳健,而旋转是现实应用中的常见挑战。通过结合几何智能的相机布局、层次化的注意力系统以及灵活的相似度测量方法,这项研究为数字设计、制造业和文化遗产保护提供了一个强大的新工具,证明了理解三维形状的关键在于我们如何教机器观察全局。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →