← 最新论文
💻 computer science

SplatGuide: Geometric Priors from 3D Gaussians for Pose-Free Novel View Synthesis

SplatGuide 通过统一来自单个 3D 高斯场景的渲染图像、单高斯可见性投票图和重建标记,为多视图扩散提供全面的几何与特征引导,从而实现了最先进的无位姿新视角合成。

原作者: Yejun Zhang, Zihan Wang, Xu Ji, Yihao Wang, Yuxin Hou, Junyuan Fang, Juho-Matti Kilpeläinen, Arno Solin, Hamed Rezazadegan Tavakoli, Esa Rahtu, Juho Kannala

发布于 2026-08-18
📖 1 分钟阅读☕ 轻松阅读

原作者: Yejun Zhang, Zihan Wang, Xu Ji, Yihao Wang, Yuxin Hou, Junyuan Fang, Juho-Matti Kilpeläinen, Arno Solin, Hamed Rezazadegan Tavakoli, Esa Rahtu, Juho Kannala

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你手里拿着一部智能手机,在走过一个房间时随手拍了几张照片。你没有使用任何特殊设备,没有测量距离,也没有记录相机当时指向何处。现在,想象一下要求计算机根据这些照片,生成一张同一房间内全新且逼真的图像,而这个视角是你从未站过的位置,甚至可能是看向一个你从未见过的转角。这就是从无位姿图像中创建新视角的挑战。多年来,科学家们一直依赖两种独立的工具来解决这个问题。一种工具擅长理解场景的形状和布局,从平面照片中构建出粗略的3D地图,但它难以创造出它从未见过的细节。另一种工具是强大的图像生成器,它可以创造出令人惊叹的新图片,但它通常需要关于相机精确位置的精准指令,而这种指令在随手拍摄的照片中极少存在。当研究人员尝试结合这些工具时,他们经常发现3D地图与图像生成器之间的连接很弱,导致系统不得不去猜测几何结构,或者完全忽略地图。

现在,一组研究人员通过一种名为 SplatGuide 的新方法弥合了这一差距。SplatGuide 并没有将 3D 重建和图像生成视为两个独立的步骤,而是设计了一个系统,三次重复使用同一个 3D 模型来引导整个过程。首先,系统获取那些无位姿的照片,并构建出一个由数百万个微小的彩色云团(称为高斯点,Gaussians)组成的 3D 场景。这是表示 3D 空间的一种标准方式,但研究人员注意到,现有方法会丢弃该模型所持有的绝大部分信息。SplatGuide 保留了每一件数据。它利用 3D 模型为新视角绘制出一幅粗略的几何图像,为图像生成器提供一个坚实的锚点。接着,它利用该模型来确定哪些原始照片在新的视角下是可见的,从而忽略掉那些被墙壁或家具遮挡的照片,确保系统只参考最有帮助的参考资料。最后,它从 3D 模型中提取高层特征,向生成器传达房间的整体风格和结构,而不仅仅是它能看到的像素。

结果表明,这种方法效果显著。通过向图像生成器输入这三种不同的信号——粗略的几何图像、智能选择的参考照片以及结构化特征,该系统创建的新视角比以往的方法更清晰、更准确。在标准数据集的测试中,该方法生成的图像非常具有说服力,甚至超过了那些在输入照片足够多时、即便拥有完美地面真值相机位置信息的系统。研究人员发现,最显著的改进来自于他们如何选择参考照片。该系统并非仅仅挑选拍摄角度相近的照片,而是通过观察 3D 地图,查看哪些照片真正展示了从新位置可见的场景部分。这防止了系统在冗余图像上浪费时间,也避免了因物体遮挡视线而产生困惑。

该系统的鲁棒性(稳健性)很大程度上源于其灵活性。该系统并不依赖于构建 3D 地图的特定方式;它可以更换不同的重建工具而无需重新训练,这意味着随着底层工具的进步,它也会自动提升。研究人员还在从未见过的场景中测试了该系统,包括大型户外环境和复杂的室内空间,并保持了高质量表现。虽然该系统并不完美,如果原始照片过于模糊或场景中包含移动物体,它可能会遇到困难,但它代表了一个重大的进步。它证明了通过仔细复用 3D 重建中已有的信息,计算机可以学会以三维的方式观察世界,并以一种此前难以企及的清晰度来构想新的视角。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →