想象一下,你正试图仅用一台摄像机,构建一部完美的、动态的繁忙公园 3D 电影。你希望树木和长凳能够固定不动,而奔跑的孩子们则能自然地移动,同时还要避免树木看起来在融化,或者孩子们留下虚幻的残影。这就是“动态场景重建”的梦想——这个领域致力于尝试将平面视频转化为可以步入其中的 3D 世界。为了实现这一目标,科学家们使用了一个巧妙的技巧,叫做“高斯泼溅”(Gaussian Splatting)。把这想象成不是用坚实的色块,而是用成千上万个微小的、模糊的 3D 颜料云来绘制场景。每一朵云都有特定的颜色、特定的形状和特定的位置。当你观察场景时,计算机将这些云融合在一起,创造出一幅清晰、逼真的图像。问题在于,当场景中的物体移动时,这些云会感到困惑。如果计算机试图让云朵在改变颜色的同时又进行移动,静态部分(如树木)就会开始晃动,而移动部分(如孩子)则会留下模糊的涂抹痕迹。这就像是穿着一套沉重且僵硬的服装跳舞;一切都会缠绕在一起。
这正是题为《SplitGaussian》的研究人员试图解决的谜题。他们注意到,以往的方法试图强迫同一组颜料云承担两个相互冲突的任务:既要保持完美静止以代表背景,又要通过拉伸和挤压来代表移动物体。这种“纠缠”导致了背景发生畸变,以及移动物体出现闪烁。为了解决这个问题,团队提出了一个简单但强大的想法:不要试图让云朵做所有事情。相反,将任务拆分为两个独立的团队。一组云完全致力于静态世界(背景),并被告知永远不要改变它们的位置,只在光照变化时稍微改变颜色。另一组云则完全致力于动态世界(移动物体),它们可以跳舞、拉伸和旋转,但要保持它们的“颜料”(颜色)一致。通过从一开始就将“几何结构”(物体在哪里)与“外观”(物体看起来如何)分离,计算机可以学习得更快,并创建一个更加干净、稳定的 3D 世界。
这篇论文指出,这种“视觉几何分解”(Visual Geometry Decomposition)是解锁高质量单视频 3D 电影的关键。作者发现,通过让背景云冻结在空间中,仅允许它们调整亮度或颜色,可以防止通常会导致静态物体看起来在晃动的“运动泄漏”。与此同时,移动的云可以集中所有的精力去研究如何变形和移动,而不必担心改变它们的纹理。他们在多个数据集上测试了这个想法,包括用 iPhone 拍摄的真实世界视频以及带有闪亮物体的复杂 3D 场景。结果显示,他们的这种方法 SplitGaussian 比之前的顶尖方法产生了更清晰的图像和更少的怪异伪影。例如,在一个具有挑战性的数据集上,他们的方法达到了 24.03 PSNR(一种衡量图像质量的指标),击败了其他领先的技术。他们还发现,如果不对那些不常被看到的“模糊云”进行清理(他们称之为“可见性驱动剪枝”过程),视频的边缘看起来会显得杂乱且多噪点。