VidSplat: Gaussian Splatting Reconstruction with Geometry-Guided Video Diffusion Priors
VidSplat 是一个无需训练的生成式框架,它利用视频扩散先验来迭代合成新视角并引导几何感知去噪,从而能够从稀疏输入甚至单张图像实现鲁棒的 3D 场景重建。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图构建一个房间的详细 3D 模型,但你只有五张从不同角落拍摄的模糊照片。大多数计算机程序会尝试基于这五张照片猜测房间的其余部分,但它们通常最终得到的模型充满了空洞、漂浮的伪影或奇怪的扭曲,因为它们没有足够的信息来了解墙壁或家具后面隐藏的内容。
VidSplat 是一款新工具,它通过扮演一位“创意建筑师”的角色来解决这个问题:这位建筑师不仅进行猜测,而是利用强大的“视频大脑”去想象缺失的部分,然后根据物理定律(几何学)检查其工作,以确保建筑能够稳固矗立。
以下是其工作原理,分解为简单的步骤:
1. 问题:“盲区”
将传统的 3D 重建想象成试图完成一个拼图,但你只拥有 5% 的拼图块。如果你强行将这些块拼在一起,画面看起来就是破碎的。现有方法试图填补空白,但它们经常产生幻觉(编造)出与房间真实形状不符的事物,或者干脆将不可见的部分留为空洞。
2. 解决方案:拥有“几何罗盘”的“视频梦想家”
VidSplat 使用一种特殊的 AI,称为视频扩散模型。你可以将这种 AI 想象成一个“视频梦想家”,它观看了数百万小时的电影,知道当你绕着物体走动时,物体看起来是什么样子的。
- 梦想: AI 接收你仅有的几张照片,开始“梦想”出新的相机角度,想象墙壁另一侧的房间看起来是什么样子。
- 罗盘(几何引导): 梦想家的问题在于,它们有时会编造出不可能的事物(比如一把悬浮在空中的椅子)。为了解决这个问题,VidSplat 为 AI 配备了一个几何罗盘。
- 它根据你的照片渲染出房间的粗略 3D 地图。
- 当 AI 尝试生成新的视频帧时,罗盘会不断检查:“这张新图像是否与我们已知的 3D 形状相匹配?”
- 如果 AI 试图在错误的位置绘制一面墙,罗盘会将其推回正确的几何位置。这确保了“梦想”始终忠于场景的物理现实。
3. 过程:“猜测、检查与优化”的循环
VidSplat 不会只做一次;它是一个循环,就像雕塑家在一块石头上不断凿刻:
- 粗略草图: 它从你仅有的几张照片开始,构建一个粗略的 3D 骨架(点云)。
- 扩展: 它选择一个它尚未见过的新的相机角度(就像绕过拐角行走)。
- 梦想: 它要求视频 AI 生成该新角度应该看起来的样子。
- 现实检查: 它利用几何罗盘确保生成的视频与 3D 骨架相匹配。如果 AI 产生幻觉,罗盘会对其进行修正。
- 更新: 它将新的、经过修正的“想象”照片添加到训练集中。现在,3D 模型拥有了更多数据。
- 重复: 它一遍又一遍地重复此过程,逐渐填补空洞,扩展视野,并细化细节,直到整个场景完整且平滑。
4. “分阶段”的魔法
VidSplat 使用的巧妙技巧之一在于它如何处理“梦想”过程。想象一下你正在画一幅画:
- 早期阶段(轮廓): 在开始时,AI 非常严格。它只允许那些严格遵循已知形状的变化。这就像绘制房屋的轮廓;你不想让屋顶飘走。
- 中期阶段(细节): 随着画面变得清晰,AI 被允许更具创造性,以填充纹理和颜色。
- 后期阶段(抛光): 最后,AI 可以自由地添加微小的、逼真的细节(如桌上的灰尘或砖块的纹理),使其看起来真实,但它仍然不能改变房屋的基本形状。
5. 结果
论文表明,VidSplat 可以仅凭5 张照片(甚至1 张照片)将其转化为完整、高质量的 3D 场景。
- 它可以“看到”相机从未见过的拐角处。
- 它可以填充从视野中隐藏起来的物体背面。
- 最终结果是一个看起来坚固且逼真的 3D 模型,没有其它方法产生的空洞或奇怪的故障。
简而言之,VidSplat 结合了视频生成 AI 的想象力与 3D 建筑师的严谨性,使其能够仅凭 handful( handful 意为“ handful",此处指“少量”)快照构建完整的 3D 世界。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。