Convolutional Neural Shading for High-Quality 3D Reconstruction from Multi-View Images
本文提出了卷积神经网络着色(Convolutional Neural Shading, CNS),这是一种利用神经着色器和细微细节位移网络来克服现有方法中单点几何信息局限性的新颖流水线,从而实现从多视图图像中重建出质量显著更高的 3D 重建结果,尤其是在黑暗和无纹理区域。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图为你最好的朋友制作一座完美的 3D 雕像,但你手里只有一堆从不同角度拍摄的平面照片。这就是 3D 重建(3D reconstruction)的日常挑战——这是计算机视觉的一个分支,旨在将 2D 图片转化为 3D 世界。多年来,艺术家们必须手工雕刻这些模型,但现在计算机已经学会了自动完成这项工作。现代方法中的“秘密武器”通常被称为神经辐射场(Neural Radiance Fields,简称 NeRFs)。把 NeRFs 想象成一种填充在物体周围空间的、神奇且隐形的雾气。通过向这团雾气发射虚构的激光束,计算机可以推测出雾气在每一个点上的颜色和密度,从而使生成的图像与照片相匹配。这就像是通过观察云朵的影子来推测云朵的形状一样。然而,这种“雾气”方法存在一个缺陷:它将空间中的每个点都视为一个孤立的岛屿。它不知道紧邻其它的点其实是同一个褶皱或纹理的一部分,这会导致结果出现模糊或凹凸不平的情况,尤其是在暗处或像黑色 T 恤这样的光滑表面上。
这时,一群新的研究人员决定用一种名为卷积神经着色(Convolutional Neural Shading,简称 CNS)的巧妙新流程来解决这个“岛屿问题”。他们不再将 3D 世界中的每个点视为孤独的数据点,而是让其方法表现得像一名观察邻里的侦探。他们意识到,要理解一个表面,你需要看到一个点是如何与其邻居相关的,就像通过阅读整个单词而非仅仅是一个字母来理解一个词一样。他们的系统使用了一个“卷积神经着色器”,这基本上是一个超级智能的过滤器,它会扫描 3D 形状并说道:“嘿,这个点就在那个点旁边,所以它们看起来应该很相似。”他们还添加了一个“精细细节位移网络”(fine-detail displacement network),它就像一个数字雕塑家,根据照片中看到的阴影和边缘,将微小的凸起和褶皱精准地推入正确的位置。
论文发现,这种新方法在创建高质量 3D 形状方面明显优于目前的顶尖方法。当研究人员在标准数据集上测试其系统时,他们的法实现了 0.49 的倒角距离(Chamfer distance,一个衡量 3D 模型与真实物体接近程度的分数),击败了此前表现最好的方法 Neuralangelo(其得分为 0.61)。在棘手的 DTU 数据集上,他们的平均得分是 0.49,而亚军 Neuralangelo 的得分是 0.61。更令人印象深刻的是,当他们尝试重建黑暗、无纹理的物体(如穿着黑色连帽衫的人)时,他们的方法得分达到了 0.41,彻底碾压了竞争对手(次优方法为 0.72)。在仅有极少照片(仅 8 个视角)的测试中,他们的系统仍能构建出清晰的形状,而其他方法则难以处理其中的空白区域。
作者认为,旧方法使用的“单点信息”是导致 3D 模型效果不佳的主要原因。他们明确排除了仅仅通过增加标准神经网络层数就足够解决问题的想法;相反,他们证明了你必须使用卷积层来理解点与邻居之间的空间关系。他们还发现,从一个粗糙的 3D 网格(即线框笼子)开始并进行精细化处理,比直接使用“隐形雾气”从零开始构建形状的效果更好。在实验中,移除其特殊的“位移网络”会导致误差分数从 0.50 跳升至 0.79,而移除“卷积着色器”则会让分数飙升至 1.42,这证明了这两个部分都是必不可少的。
然而,论文也谨慎地指出,这并不是应对所有情况的灵丹妙药。该方法在受控且有界限的空间内效果最好。如果你尝试将其用于大规模、无界限的场景,或者背景杂乱、存在严重遮挡(即一个物体完全挡住另一个物体)的情况,质量会显著下降。作者建议,虽然该方法在精细、受控的 3D 重建方面迈出了重要一步,但未来的工作仍需研究如何处理这些混乱的、开放世界的场景。不过就目前而言,他们已经证明,通过教计算机去观察 3D 点的“邻里关系”而非仅仅关注点本身,我们可以构建出比以往任何时候都更锐利、更平滑、更真实的数字雕像。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。