← 最新论文
💻 computer science

Towards Alias-Free 4D Gaussian Representations with Motion-Aware Filtering

本文提出了一种运动感知 3D 平滑滤波器,该滤波器通过估计时间与焦距-深度比的联合密度来动态适应局部运动,从而有效地消除了用于动态场景新视角合成的 4D 高斯表示中的混叠伪影。

原作者: Ankit Dhiman, Kunal A Kathare, Pranav Vignesh, Lokesh R Boregowda, Venkatesh Babu Radhakrishnan

发布于 2026-08-25
📖 1 分钟阅读☕ 轻松阅读

原作者: Ankit Dhiman, Kunal A Kathare, Pranav Vignesh, Lokesh R Boregowda, Venkatesh Babu Radhakrishnan

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,试图捕捉一个移动的场景,比如一个人在烹饪或一个孩子在奔跑,然后从一个全新的角度重新呈现它,仿佛你站在了一个你从未真正站立过的地方。这就是被称为“新视角合成”(novel-view synthesis)的领域所追求的目标,这项技术为从沉浸式虚拟现实到先进机器人技术的方方面面提供了动力。多年来,科学家们一直使用数字模型来表示世界,将场景视为由携带颜色和位置信息的微小、发光点组成的集合。当计算机从特定角度观察这些点时,它会将它们融合在一起以创建逼真的图像。然而,当场景移动,或者当我们尝试对摄像机视图进行放大或缩小操作时,这些数字模型往往会崩溃。它们开始闪烁、模糊,或者显示出现实中并不存在的奇怪、锯齿状图案。这些被称为“混叠”(aliasing)的视觉瑕疵之所以发生,是因为计算机正试图从过少的信息中推测过多的细节,就像试图在微小的低质量屏幕上查看高分辨率照片一样。

来自印度科学理工学院和三星印度研发中心的研究小组开发了一种解决这一移动场景问题的新方法。他们专注于一种使用三维高斯形状(3D Gaussian shapes)来表示世界的特定类型的数字模型。虽然这些模型在渲染静态物体方面表现出色,但在物体移动或摄像机缩放时却显得力不从心。研究人员发现,用于平滑这些图像的标准方法在处理静态照片时效果很好,但在处理运动物体时却完全失效。在静态场景中,摄像机与物体之间的距离保持不变,因此平滑滤波器可以设定一次后便不再更改。但在动态场景中,物体可能在前一刻离摄像机很近,而在下一刻又变得很远,或者它可能在摄像机缩放时进行横向移动。如果滤波器不知道这种运动,它要么会让图像过于模糊,要么无法阻止锯齿状伪影的产生。

为了解决这个问题,该团队创建了一个“运动感知”滤波器,其行为会根据物体的移动速度和方向而改变。该方法不再对整个场景应用单一、僵化的规则,而是观察每个微小数字点的历史记录。它学习每个点与摄像机之间的距离随时间变化的方式。通过分析这段历史,系统可以精确预测在任何给定时刻需要多少程度的平滑处理。如果一个点移动得很快或者摄像机正在放大,滤波器会立即进行调整,以在不产生那些令人分心的视觉瑕疵的情况下保留清晰的细节。研究人员在各种数据集上测试了这种方法,包括人们烹饪的真实视频录像和移动物体的合成场景。他们发现,当他们在低分辨率图像上训练模型,然后尝试以更高的分辨率进行渲染时,他们的方法比以往的技术产生了显著更清晰、更准确的结果。

当摄像机放大时,结果尤其令人瞩目。其他方法经常导致移动物体消失或融入背景,而这种新方法则保持了边缘的锐利和细节的完整。例如,在展示手搅拌锅中物体或人走路的场景中,新方法保持了其他系统会丢失的精细纹理和清晰线条。研究人员还表明,这种技术不仅适用于一种特定的模型类型,还可以添加到不同的现有系统中以改进它们。虽然这种新方法确实需要更多的计算机内存来存储每个点的运动历史,但这种权衡带来了视觉质量的巨大提升。这项工作表明,通过教计算机将运动理解为一个变化的变量而非固定状态,我们可以创造出即使我们在其中移动也看起来真实的数字世界。这一进步让我们离无缝的虚拟体验更近了一步,在这种体验中,真实视频与计算机生成视图之间的区别几乎难以分辨。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →