想象一下,试图捕捉一个移动的场景,比如一个人在烹饪或一个孩子在奔跑,然后从一个全新的角度重新呈现它,仿佛你站在了一个你从未真正站立过的地方。这就是被称为“新视角合成”(novel-view synthesis)的领域所追求的目标,这项技术为从沉浸式虚拟现实到先进机器人技术的方方面面提供了动力。多年来,科学家们一直使用数字模型来表示世界,将场景视为由携带颜色和位置信息的微小、发光点组成的集合。当计算机从特定角度观察这些点时,它会将它们融合在一起以创建逼真的图像。然而,当场景移动,或者当我们尝试对摄像机视图进行放大或缩小操作时,这些数字模型往往会崩溃。它们开始闪烁、模糊,或者显示出现实中并不存在的奇怪、锯齿状图案。这些被称为“混叠”(aliasing)的视觉瑕疵之所以发生,是因为计算机正试图从过少的信息中推测过多的细节,就像试图在微小的低质量屏幕上查看高分辨率照片一样。
来自印度科学理工学院和三星印度研发中心的研究小组开发了一种解决这一移动场景问题的新方法。他们专注于一种使用三维高斯形状(3D Gaussian shapes)来表示世界的特定类型的数字模型。虽然这些模型在渲染静态物体方面表现出色,但在物体移动或摄像机缩放时却显得力不从心。研究人员发现,用于平滑这些图像的标准方法在处理静态照片时效果很好,但在处理运动物体时却完全失效。在静态场景中,摄像机与物体之间的距离保持不变,因此平滑滤波器可以设定一次后便不再更改。但在动态场景中,物体可能在前一刻离摄像机很近,而在下一刻又变得很远,或者它可能在摄像机缩放时进行横向移动。如果滤波器不知道这种运动,它要么会让图像过于模糊,要么无法阻止锯齿状伪影的产生。
为了解决这个问题,该团队创建了一个“运动感知”滤波器,其行为会根据物体的移动速度和方向而改变。该方法不再对整个场景应用单一、僵化的规则,而是观察每个微小数字点的历史记录。它学习每个点与摄像机之间的距离随时间变化的方式。通过分析这段历史,系统可以精确预测在任何给定时刻需要多少程度的平滑处理。如果一个点移动得很快或者摄像机正在放大,滤波器会立即进行调整,以在不产生那些令人分心的视觉瑕疵的情况下保留清晰的细节。研究人员在各种数据集上测试了这种方法,包括人们烹饪的真实视频录像和移动物体的合成场景。他们发现,当他们在低分辨率图像上训练模型,然后尝试以更高的分辨率进行渲染时,他们的方法比以往的技术产生了显著更清晰、更准确的结果。
当摄像机放大时,结果尤其令人瞩目。其他方法经常导致移动物体消失或融入背景,而这种新方法则保持了边缘的锐利和细节的完整。例如,在展示手搅拌锅中物体或人走路的场景中,新方法保持了其他系统会丢失的精细纹理和清晰线条。研究人员还表明,这种技术不仅适用于一种特定的模型类型,还可以添加到不同的现有系统中以改进它们。虽然这种新方法确实需要更多的计算机内存来存储每个点的运动历史,但这种权衡带来了视觉质量的巨大提升。这项工作表明,通过教计算机将运动理解为一个变化的变量而非固定状态,我们可以创造出即使我们在其中移动也看起来真实的数字世界。这一进步让我们离无缝的虚拟体验更近了一步,在这种体验中,真实视频与计算机生成视图之间的区别几乎难以分辨。
技术摘要:迈向具有运动感知滤波的无混叠 4D 高斯表示
问题陈述
动态场景的新视角合成(NVS)对于 AR/VR 应用至关重要,但目前仍面临挑战。虽然最近的方法通过引入时间维度,将 3D 高斯泼溅(3DGS)和神经辐射场(NeRF)扩展到了 4D 表示,但这些方法存在显著的混叠伪影问题。当在不同视角进行生成时(例如在放大或缩小操作期间),这些伪影尤为明显。
现有的静态场景抗混叠解决方案(如 Mip-Splatting)基于 Nyquist 准则应用静态 3D 平滑滤波器。然而,由于缺乏运动感知能力,这些方法在动态场景中表现不佳。静态滤波器无法考虑场景的几何变化;因此,它会对运动物体应用错误的滤波强度,导致持续存在的伪影,如原语消失、模糊或物体与背景融合。
方法论
作者提出了一种专门为 4D 高斯表示设计的运动感知 3D 平滑滤波器。其核心洞察在于:高斯原语的采样间隔(定义为焦距与深度的比值,f/d)并非随时间恒定,而是随着物体的移动而变化。
关键技术组件:
联合密度估计:
该方法不再估计单一的静态采样率,而是学习每个高斯原语在时间(t)和焦距与深度比(f/d)上的联合密度函数。
- 作者利用Parzen 窗口核密度估计(一种非参数方法)从累积的训练数据点中估计该联合分布 P(X,T)。
- 他们对 f/d 分量采用了 Weibull 分布(偏向最大值以满足 Nyquist 准则),对时间分量采用了 高斯分布。
- 为了确保尺度不变性,f/d 的值在进行密度估计前会通过每个原语的最大值(xmax)进行归一化,使其落在 [0,1] 区间内。
运动感知推理:
在推理过程中,针对特定的查询时间 t:
- 算法提取该分布的条件密度 P(X∣T=t)。
- 它识别该分布的众数(最大概率值)来确定最优采样率 ν^(t)。
- 随后,该随时间变化的采样率被用于在 3D 高斯原语进行渲染(rasterization)之前对其应用高斯低通滤波器。
集成:
该方法旨在实现表示无关性。它作用于任何 4D 表示的投影 3D 高斯,通过将常数采样率替换为随时间变化的采样率。作者通过将其滤波器与 SARO-GS(其基础模型)以及 SpeeDe3DGS 进行集成,证明了这一点。
核心贡献
- 运动感知平滑滤波器: 引入了一种能根据局部运动信息调整强度的滤波器,有效缓解了动态场景中的混叠问题,且不损害渲染质量。
- 联合分布估计: 一种使用非参数估计(Parzen 窗口)来建模时间与焦距/深度比联合分布的新策略,相比直接基于时间戳的估计,实现了更平滑且更准确的采样间隔估计。
- 表示无关性: 该方法具有模块化特征,可以插入到各种现有的 4D 表示中。
- 全面评估: 在标准真实世界数据集(Plenoptic Video, HyperNeRF)和合成数据集(D-NeRF)上验证了其有效性。
实验结果
作者使用了单尺度训练与多尺度测试(在低分辨率下训练,在高分辨率下测试以模拟放大,反之亦然)来评估其方法。
定量性能:
- 在 Plenoptic Video 数据集上,所提方法在 4 倍分辨率(放大)下比 SARO-GS 的 PSNR 提升了 2.11 dB,显著优于受到严重混叠影响的基线模型(如 4DGS, Spacetime-GS 和 Grid4D)。
- 在 D-NeF 合成数据集上,该方法在 4 倍分辨率下比 Deformable3DGS 提升了 5.06 dB,比 SARO-GS 提升了 5.21 dB。
- 时间稳定性: 该方法展现了卓越的时间相干性,其 W-Temporal Error(0.608)最低,W-SSIM(0.994)最高。
- 缩小(Zoom-Out): 在小于 1 倍分辨率的评估中,该方法在不同尺度下保持了近乎恒定的 PSNR(~35.9 dB),而基础表示的性能显著下降(降至 28.1 dB)。
定性性能:
- 定性对比显示,基线方法会产生模糊细节、丢失精细结构(如倒水、手部动作)或在物体与背景融合处出现伪影。
- 所提方法在静态和动态区域均能保持高频细节和锐利边缘。
消融实验与集成:
- 将滤波器集成到 SpeeDe3DGS 中,在减少原语数量的同时,使 PSNR 提升了 4.45 dB,证实了该方法的泛化能力。
- 开销较小,每次训练仅增加约 2 分钟时间和每个场景约 17.7 MB 的内存。
重要性与主张
论文指出,当前 4D 高斯表示的主要局限在于由于缺乏运动感知滤波,无法处理动态场景中的混叠问题。通过估计时间与采样需求的联合分布,所提方法实现了动态场景的无混叠渲染。
作者强调,其方法:
- 解决了动态区域中抗混叠与细节保留之间的权衡问题,而静态滤波器(如 Mip-Splatting)在此类问题上表现不佳。
- 保持了高保真度,即使在低分辨率数据上训练并在更高分辨率下评估时也是如此,这对于可扩展的 AR/VR 应用至关重要。
- 提供了灵活性,因为它并不绑定于特定的 4D 架构,而是作为一个通用的增强模块。
论文总结道,尽管由于存储密度矩阵会带来一定的内存占用,但未来的工作可以通过共享网络或聚类进行优化,目前的实现已成功证明了运动感知抗混叠在实现高保真 4D 重建方面的可行性。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。