← 最新论文
💻 computer science

CoMVS-GS: Collaborative Multi-View Stereo and 3D Gaussian Splatting for Surface Reconstruction

CoMVS-GS 是一种新颖的表面重建框架,它通过集成用于几何鲁棒初始化的多视图立体视觉(Multi-View Stereo)、采用 PatchMatch-3DGS 相互监督来优化弱约束区域,以及利用 Delaunay 图割(Delaunay graph-cut)流水线进行高质量网格提取,从而增强了 3D 高斯泼溅(3D Gaussian Splatting)的效果,在室内和室外场景中均实现了卓越的几何精度和网格紧凑性。

原作者: Shihan Chen, Junjing Zhang, Qingsong Yan, Haibing Liu, Haofan Ren, Fei Deng

发布于 2026-08-20
📖 1 分钟阅读☕ 轻松阅读

原作者: Shihan Chen, Junjing Zhang, Qingsong Yan, Haibing Liu, Haofan Ren, Fei Deng

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

从一系列二维照片中创建现实世界的三维模型是计算机视觉领域的一个基本挑战。几十年来,科学家们一直依赖两种主要方法来解决这个问题。第一种被称为多视图立体视觉(multi-view stereo),它的工作原理类似于人类大脑:它从不同的角度观察同一个物体,寻找匹配的点,并计算它们的距离以构建代表表面的密集点云。第二种是一种较新的方法,称为3D高斯泼溅(3D Gaussian Splatting),它不将场景表示为固体物体,而是将其表示为在空间中漂浮的一群微小的、有颜色的、透明的椭球体。当相机观察这群椭球体时,这些椭球体会融合在一起,形成清晰、逼真的图像。虽然这种新方法速度极快且能产生惊人的视觉效果,但在构建实际三维形状方面存在一个显著缺陷。在相机观察角度较少或物体被其他物体遮挡的区域,这些漂浮的椭球体可能会发生漂移,或者形成不稳定、幽灵般的结构,这些结构在照片中看起来很好,但并不代表真实的、固体的表面。

武汉大学和杭州电子科技大学的研究人员开发了一种名为CoMVS-GS的新框架来解决这个问题。他们的目标是将漂浮椭球体的速度和视觉质量与传统基于点的方法的几何可靠性结合起来。他们没有将这两种技术视为独立的工具,而是将它们编织进了一个统一的过程中。其结果是一个能够重建小型物体和大型户外环境准确、固体三维网格的系统,即使在光照困难或场景部分被遮挡的情况下也是如此。团队发现,通过利用旧的、较慢的方法来引导新的、较快的方法,他们可以消除漂浮的伪影,并生成既具有视觉说服力又具有几何精确性的表面。

该过程在主优化开始之前就有一个关键步骤。传统方法通常从稀疏的点集开始,留下巨大的间隙让计算机去猜测如何填充。研究人员则使用由标准多视图立体视觉算法生成的密集点云来初始化他们的模型。他们获取这些点,并在从一开始就使漂浮的椭球体匹配局部表面的方向和厚度。想象一下,你试图建造一面墙,首先是在空中散布一些砖块,然后希望它们能自然沉降成一条直线;而这种新方法会在施工开始前,将砖块精准地放置在它们应该在的位置,并使其与墙面对齐。这为系统提供了强大的几何起点,防止了椭球体在训练早期阶段形成不稳定的结构。

一旦模型初始化完成,研究人员就在这两种技术之间引入了一个连续的反馈循环。系统会渲染一张深度图(本质上是一张显示场景中每个点距离远近的图像),并利用该图像来优化多视图立体视觉算法。反过来,经过优化的多视图立体视觉算法会生成更准确的深度图,进而用于修正漂浮的椭球体。这种相互监督意味着系统一直在检查自己的工作。如果椭球体漂移到了不该出现的地方,多视图立体视觉数据就会将其拉回。如果多视图立体视觉数据因为缺乏纹理而无法确定,密集的椭球体云则会提供一个稳定的引导。这种往复式的精炼使得模型能够填补间隙并平滑以往方法难以处理的表面。

最后一步涉及将这些精炼后的椭球体转化为固体网格,即用于表示三维物体的线框皮肤。许多现有方法尝试通过将整个三维空间划分为微小立方体的网格来完成这一过程。这种方法对立方体的大小非常敏感:如果立方体太大,精细细节就会丢失;如果太小,计算机就会耗尽内存,尤其是在大型户外场景中。研究人员通过使用一种称为德洛内图切割网格化(Delaunay graph-cut meshing)的不同技术避开了这个陷阱。该方法不依赖于刚性的网格,而是直接连接表面点,并利用相机的视线来确定空间的哪些部分在物体内部,哪些部分在外部。这使他们能够创建一个干净、完整的表面,而不会产生与基于网格的方法相关的内存负担或细节丢失。

团队在多个数据集上测试了他们的方法,包括用于物体级重建的标准DTU基准测试,以及来自GauU-Scene V2和MatrixCity数据集的大规模户外场景的新子集。在DTU基准测试中,他们的方法实现了具有竞争力的平均误差率,在重建几何精度方面往往优于现有技术。在户外场景中,这种差异更加显著。当其他方法在水域或建筑立面等区域产生漂浮碎片或大型孔洞时,CoMVS-GS生成了干净、连续的表面。研究人员指出,他们的模型生成的网格面数显著减少——平均约为876万个面,而某些竞争对手则超过5000万个面——同时保持了更高的几何精度。这种紧凑性表明,该模型更高效地捕捉了场景的真实形状,而没有为了填补间隙而增加不必要的复杂性。

该研究还包括了测试其系统的哪些部分最为重要的实验。当他们移除密集点云初始化时,模型在处理从锐角观察的建筑立面等平面时难以收敛。当他们移除相互监督循环时,几何精度下降,表面变得不再平滑。最后,当他们将新的网格化技术换回传统的基于网格的方法时,生成的模型出现了孔洞和不完整区域,证实了他们的图切割方法对于处理复杂的户外场景至关重要。研究人员得出结论,通过将多视图立体视觉不仅作为最后一步,而且作为初始化、持续监督和表面提取的来源,他们可以实现一种单一方法无法达到的几何稳定性。

尽管该方法代表了向前迈出的重要一步,但作者也承认,它在面对高度反射或透明表面时仍面临挑战,因为在这些表面上很难找到不同相机视角之间的匹配点。此外,定期精炼深度图的过程会增加一些计算成本,这对于超高分辨率场景可能是一个因素。然而,结果表明,将传统摄影测量学的几何严谨性与现代神经渲染的高效性相结合,是实现更鲁棒、更准确的三维重建的一条可行路径。这项工作表明,三维建模的未来可能不在于在不同的技术之间做出选择,而在于寻找让它们协同工作的方法,利用各自的优势来克服对方的弱点。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →