← 最新论文
💻 computer science

Grassmannian Splatting I: Moving rank-2 Spacetime Surfels for Dynamic Scene Rendering

本文介绍了 Grassmannian Splatting,这是一种利用定义在 R4\mathbb{R}^4 中 3-平面上的秩-2 时空 surfel 构建的动态场景表示,通过采用与标准 3D Gaussian Splatting 光栅化器兼容的闭式运动模型,实现了最先进的渲染质量以及显著提升的训练速度。

原作者: Aaron Maurice Berman, Shantanu Dave

发布于 2026-07-14
📖 1 分钟阅读☕ 轻松阅读

原作者: Aaron Maurice Berman, Shantanu Dave

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图拍摄一个繁忙的街道场景:汽车疾驰而过,人们挥手致意,一个气球向上飘升。为了在计算机中重现这个场景,大多数方法都试图为每个物体构建一个 3D 模型,然后教它如何随时间摇摆、拉伸或变形。这就像是在尝试通过手动逐帧挤压和拉伸一个粘土雕塑来进行动画制作。

但本文的作者 Aaron Maurice Berman 和 Shantanu Dave 有一个不同的想法。他们建议我们不要再尝试挤压粘土,而是开始思考“时空片层”(spacetime sheets)。

核心理念:移动的纸片

作者们提议,与其构建随形状变化的 3D 团块,不如使用生活在四维世界中平坦三维片层上的高斯函数(Gaussians,它们就像是带有颜色的柔软、模糊的云团)。你可以将这个四维世界想象为拥有三个空间维度(上/下,左/右,前/后)和一个时间维度。

在这个系统中,每一个小小的“喷溅”(splat,即带颜色的模糊点)都固定在一个特定的平坦片层上。因为该片层是平坦的且存在于时空中,它具有一个非常特殊的属性:它以恒定的速度沿直线移动。

这里有一个魔术技巧:

  1. 片层(The Sheet): 想象一张漂浮在空中的纸。在这个四维世界中,这张纸并不只是静止不动;它正在穿过时间滑动。
  2. 切片(The Slice): 当你想观察某一特定时刻(例如下午 2:00)的场景时,你在那个时间点对四维世界进行“切片”。
  3. 结果(The Result): 当你切开这个移动的四维片层时,你在 3D 视图中会得到一个完美的、平坦的 2D 圆盘(即 surfel)。随着时间的推移,该圆盘会在屏幕上以稳定的速度滑动,就像它所属的那个片层一样。

论文将此称为 Grassmannian splatting(格拉斯曼喷溅)。这是一个华丽的名字,描述的是一个简单的概念:如果你将物体定义为在时间中移动的平坦片层,你就不需要教它们如何移动。运动本身就内置在片层的几何结构之中。

他们对什么说“不”

作者们非常明确地说明了他们不是在做什么。

  • 拒绝变形场(No Deformation Fields): 他们明确拒绝使用复杂的“变形场”(即告诉每个点如何扭曲和变形的数学映射)。他们的方法不学习如何弯曲或拉伸;它只学习如何滑动。
  • 无需定制代码(No Custom Code): 他们不需要编写特殊的、复杂的计算机代码(定制 CUDA 内核)来实现这一功能。他们使用的是每个人都在使用的标准“光栅化器”(rasterizer,即把 3D 数据转化为 2D 图像的引擎)。他们只是输入了某种略有不同的数据。
  • 拒绝“秩为 4”的团块(No "Rank-4" Blobs): 其他方法使用“全秩”四维高斯函数,它们就像是四维蛋,被切开后变成 3D 蛋。作者认为,对于动态场景,我们实际上需要的是“秩为 2”的圆盘(扁平的煎饼),而不是 3D 蛋。他们的数学证明了,切开他们特定的四维片层总是会得到这些扁平的 2D 圆盘。

他们有多确定?

作者对他们的数学和结果相当自信,但对自己的主张也非常谨慎。

  • 数学已获证明: 他们在数学上证明了,如果切开他们的四维片层,会得到一个以恒定速度移动的平坦 2D 圆盘。他们使用了几何学和线性代数(具体涉及所谓的“Schur 补”)来证明这一点。
  • 速度经过测量: 他们在 17 个不同的视频场景(来自基准测试 MonoDyGauBench)上测试了该方法。他们发现,与那些专注于质量的竞争方法相比,他们的方法训练速度快了 4.9 到 5.6 倍。他们在约 1,814 秒(大约 30 分钟)内完成了训练,而排名第二的方法则需要超过 8,000 秒。
  • 质量很高,但并不完美: 在图像质量方面(通过 PSNR、MS-SSIM 和 LPIPS 衡量),他们的方法在测试的所有方法中排名第二。他们非常接近冠军(4DGS),但仍稍逊一筹。
    • 他们承认了一个特定的局限性:对于旋转或进行协调旋转的物体(如旋转的扇子或做转体动作的人),该方法表现不佳。因为他们的片层只能沿直线滑动,所以必须使用数百个微小的、短命的片层来伪造旋转。这就是为什么他们在处理这类运动时,无法击败那些“变形”类方法的原因。

“秘密武器”细节

  • “软钳制”(The "Soft Clamp"): 在数学运算中有一个棘手的时刻,即当一个片层完全静止(不在时间中移动)时,数学逻辑可能会崩溃。作者添加了一个“软钳制”(一个微小的数值安全网),它能平滑地连接移动片层与静态片层之间的间隙,从而防止计算机崩溃。
  • “提升”(The "Lift"): 由于他们的圆盘在数学上是完美的扁平状(“秩为 2”),它们在技术上是“奇异的”(难以被计算机处理)。为了解决这个问题,他们在绘制图像之前添加了一层极小的、不可见的厚度(称为“秩提升”或 "rank-lift")。这使得数学运算能够顺利进行,而不会改变图像的实际外观。
  • 结果: 在 17 个测试场景中,他们的方法达到了 25.05 dB 的 PSNR,非常接近最高分 25.70 dB。他们在 NVIDIA A10G 上训练了 1,814 秒,而最强竞争对手(4DGS)在 RTX 3090 上则需要 10,171 秒

总结

这篇论文表明,通过改变我们看待 3D 物体的方式——将其视为在时间中滑动的平坦片层,而非挤压的团块——我们可以使动态场景的渲染变得更快、更简单。这是一种聪明的几何捷径,避开了学习复杂变形的繁重工作。虽然它在某些类型的运动(尤其是旋转运动)上并非绝对最优,但它在速度和简洁性方面取得了巨大的胜利,证明了有时,让场景动起来最好的方式就是让数学自然滑动。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →