Category-Level Fine-Grained Sketch-Based 3D Shape Retrieval
本文通过引入一个包含54个子类的新数据集,并提出一种具有专门特征提取器和优化跨域对齐的方法,以有效检索匹配输入草图细粒度细节的3D形状,从而解决了类别级细粒度草图驱动的3D形状检索这一挑战。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在数字时代,三维形状是构建我们虚拟世界的基石,为从视频游戏角色到建筑模型再到工业设计的一切事物提供动力。随着这些数字对象的数量增长到数百万之多,快速找到其中一个特定的对象变得一项艰巨的任务。虽然人们可以使用文本关键词或上传相似物品的照片来搜索这些对象,但还有一种更直观的搜索方式:绘画。一张手绘草图捕捉了物体的本质——整体结构和关键细节——而无需追求完美的写实感。这种利用简单的二维绘图来搜索三维形状的方法被称为基于草图的三维形状检索。然而,目前的系统对于实际应用来说往往过于宽泛。它们可能会在被要求寻找“椅子”时成功找到一把椅子,但在区分特定类型的椅子(例如“悬臂式”椅与“梯背式”椅)时却显得力不从心。这种精确度的缺失限制了该技术在用户需要寻找精确匹配而非仅仅是通用类别的现实场景中的实用性。
来自天津大学和普林斯顿大学的研究团队通过解决细粒度检索这一挑战,在解决这一问题方面迈出了重要一步。他们的工作旨在解决寻找与用户草图属于同一特定子类别、而非仅仅是同一大类别的三维形状的难题。为此,他们首先必须创建一个新的基础,因为目前还没有适合这项特定任务的数据。他们组建了一个庞大的新数据集,其中包含 7,666 幅手绘草图和 20,445 个对应的三维形状。这些项目被精心组织成跨越三个大类(飞机、汽车和椅子)的 54 个不同子类别。例如,在“汽车”类别内,他们并没有将所有车辆归为一类,而是将它们细分为轿车、卡车和巴士等特定类型。为了确保数据的准确性和平衡性,他们聘请了领域专家来定义这些子类别,并监督研究生对现有的图像和三维模型进行重新分类,同时让学生绘制新的草图以填补集合中的任何空白。
有了这个新数据集,研究人员开发了一个专门的系统,以弥合扁平的二维绘图与复杂的三维对象之间的鸿沟。他们意识到,一种旨在识别现实世界物体照片的标准计算机视觉工具并不能很好地适用于手绘草图,因为草图通常包含大量的空白区域且风格差异巨大。因此,他们设计了一种专门针对草图的新型特征提取器,调整了网络的结构,以更好地处理人类绘画的独特特征。对于三维形状,他们创建了一个从多个角度观察物体的系统,就像一个人绕着雕塑走动以从各个侧面观察它一样。该系统特别关注物体表面的微小且关键的细节,识别并评分形状中最重要的部分,从而创建一个精确的数字指纹。
他们方法中最具创新性的部分涉及如何教这两种不同类型的数据相互理解。由于三维模型通常比粗略的草图更详细且更容易被计算机分析,研究人员使用三维模型作为引导。他们首先训练系统完美理解三维形状,然后利用这种理解来教系统如何解读草图,有效地利用来自三维世界的更丰富信息来补偿绘图的抽象性和稀缺性。这种“三维形状引导”的学习策略使系统能够在共享空间中对齐这两种不同的数据,使得即使在视觉差异巨大的情况下,也能将草图与其精确的三维对应物进行匹配。
当研究人员测试他们的新方法时,结果令人瞩目。在他们的新细粒度数据集上,他们的系统表现显著优于所有现有方法,在寻找正确子类别的准确率方面,在某些情况下提高了一倍以上。它成功检索出正确的飞机、汽车或椅子子类型的频率远高于以往的技术。此外,该系统证明了其鲁棒性;当在并非为细粒度任务设计的旧有、宽泛的数据集上进行测试时,它的表现仍然优于目前最先进的方法。这表明他们开发的技术不仅仅是针对特定问题的局部修复,而是对计算机理解绘图与三维对象之间关系的更普遍的改进。通过创建一个专门的数据集和定制的学习策略,这项工作使该领域更接近于这样一个未来:即通过一次快速的草图绘制,就能可靠地找到用户所需的精确数字对象。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。