想象一下,你正试图仅通过一系列照片来制作一段繁忙街道场景的高速视频。你希望移动的汽车看起来平滑且真实,同时又希望静态的建筑物保持纹丝不动。
在计算机图形学领域,人们曾尝试过两种主要的方法,但两者都存在重大缺陷:
- “弹性衣”法(基于变形的方法): 想象场景中的每个物体都穿着一件弹力衣。为了让汽车移动,你只需拉伸这件衣服。
- 问题在于: 如果汽车在旋转车轮或者闪光灯闪烁,这件衣服就会产生混乱。它会试图通过拉伸汽车的车身来解释旋转的车轮,导致汽车看起来模糊且融化。它对于处理快速、杂乱的细节来说过于僵硬了。
- “瞬间克隆”法(基于 4D 原语的方法): 想象在每一个微小的时刻,计算机都会为每一个像素创建一个全新的、微小的 3D 物体。
- 问题在于: 这会产生数以百万计的“幽灵”物体,它们出现一瞬间后便消失不见。它能完美捕捉每一个细节,但极其沉重、缓慢且混乱。计算机在试图追踪所有这些转瞬即逝的幽灵时会被压垮。
走进 Multi4D:“专业团队”法
Multi4D 的作者们说:“为什么要强迫一种方法去做所有的事呢?让我们雇佣一支能够胜任不同工作的专家团队吧。”
他们将场景分解为三个不同的数字“点”(称为高斯点/Gaussians)组成的团队,这些团队协同工作但各司其职:
- 建筑师(静态高斯点): 他们是永久居民。他们负责处理建筑物、道路以及任何不移动的事物。他们驻守原地,提供一个稳定的基础。
- 演员(持续动态高斯点): 他们是主角,比如走路的人或行驶的汽车。他们拥有关于自身形状的“记忆”,并随时间平滑地移动。他们处理主要的运动,而不会感到困惑。
- 特效组(瞬态高斯点): 他们是短命的高速粒子。他们只会在极短的时间内出现,用来处理诸如轮胎飞溅出的火星、阳光的突然闪光或水花的溅射。一旦特效结束,他们就会消失。
他们如何协作:“竞争”机制
Multi4D 的奥秘在于,这三支团队共享同一个相机视角,并且通过竞争来解释计算机所看到的内容。
- 如果计算机看到一栋建筑,建筑师会说:“这归我管!”然后其他团队退后。
- 如果计算机看到一辆移动的汽车,演员会说:“由我来处理运动,”然后接管控制权。
- 如果计算机看到一个不符合汽车形状的突然闪光,特效组就会介入,解释那个闪光,然后消失。
因为他们在竞争,所以不会浪费精力去做彼此的工作。“演员”不会试图通过拉伸来解释一次闪光,而“特效组”也不会试图承担整辆汽车的重量。
结果
通过使用这种“分而治之”的策略,Multi4D 实现了两个惊人的成就:
- 超高质量,更低存储: 它创建的视频比之前的方法看起来更清晰、更真实,但使用的移动数字物体数量减少了 25 倍。这就像是一部高清电影,却能装进一个微小的 U 盘而非巨大的硬盘中。
- 更快的速度: 因为它不需要追踪数百万个“幽灵”物体,所以它可以更快地渲染(绘制)场景,从而实现实时观看。
- 更好的追踪能力: 因为“演员”拥有稳定的身份(他们不会被不断更换的新幽灵所取代),计算机可以轻松地随着时间追踪“谁是谁”。这使得它在进行物体识别和分离(分割)方面比以前快得多。
简而言之,Multi4D 不再试图强迫一个庞大且混乱的系统去做所有事情。相反,它组织了一个高效的小型团队,每个人都知道自己的特定角色,从而创造出一个更干净、更快、更真实的动态 3D 世界。
技术摘要:Multi4D
问题陈述
动态 3D 高斯泼溅(3DGS)面临着运动一致性(随时间追踪物体身份)与视觉保真度(渲染高频细节)之间的根本权衡。目前的各种方法通常属于两个对立的领域,且各自存在特定的局限性:
- 基于变形的方法(Deformation-based Approaches): 这些方法维护一组固定的规范高斯(canonical Gaussians),并通过神经网络或轨迹建模对其进行变形。虽然它们保留了时间对应关系,但往往会出现**运动过度因子化(motion over-factorization)**的问题,即变形场会导致高频动态过度平滑。此外,它们经常将复杂的表观变化(如高光反射)误解为物理运动,从而导致几何变形伪影。由于在每个时间戳都需要进行逐原语(per-primitive)的变形查询,这些方法还带来了显著的计算开销。
- 基于 4D 原语的方法(4D-Primitive-based Approaches): 这些方法将场景建模为 4D 时空超圆柱体,并在每个时间戳进行切片。虽然它们能有效捕捉精细的视觉细节和瞬态几何,但却存在**时间过度参数化(temporal over-parameterization)**的问题。它们倾向于将物理运动建模为瞬态表观变化,从而产生数百万个短命的原语,这破坏了物体的身份连续性并导致严重的存储开销。此外,由于缺乏整体几何约束,它们在稀疏或单目监督下难以实现泛化。
方法论:多级竞争分配
作者提出了 Multi4D,这是一个通过将建模能力分布在三个结构化层级而非依赖单一表示来解决上述矛盾的框架。其核心理念是残差驱动分配(residual-driven allocation),即不同的高斯子集通过一个统一的可微渲染器动态地竞争来解释光度误差。
场景被表示为三个子集的并集:G=Gs∪Gd∪Gt。
1. 三个高斯子集
- 静态高斯 (Gs): 与时间无关的 3D 高斯,通过密集初始化(例如通过 COLMAP)来锚定场景的稳定结构骨干。
- 持久动态高斯 (Gd): 由仅几何变形场 (Φg) 驱动的规范高斯。这些原语进行刚性变形,以保持长期的身份一致性和可追踪性,而不会在表观上发生漂移。
- 瞬态高斯 (Gt): 专门用于建模高频表观残差和瞬态几何的短命 4D 时空原语。
2. 关键技术组件
- 统一渲染与竞争: 所有子集都在单次传递中进行渲染。共享的透射率累积耦合了它们的梯度,创造了一个竞争环境。一旦某个子集(例如 Gs)解释了某个区域,其他子集的残差驱动致密化(densification)就会受到抑制,从而防止冗余建模。
- 自底向上训练策略:
- 初始化: Gs 进行密集初始化;Gd 进行稀疏初始化;Gt 从空集开始。
- 速度感知的周期性提升(Velocity-Aware Periodical Lifting): 一旦动态-静态分离趋于稳定,来自 Gd 的活跃原语会被定期“提升”到 Gt 中。这一过程利用了动量继承(Momentum Inheritance),即新的 4D 原语会继承父级的速度,并将其 4D 主轴与时空轨迹对齐。这为瞬态子集提供了强大的运动先验。
- 掩码感知的基于效用的剪枝(Mask-Aware Utility-Based Pruning): 一种剪枝机制根据原语对最终渲染的贡献度将其移除,并受动态-静态掩码的控制。这确保了 Gd 和 Gs 不会进行不必要的重叠,并抑制了隐藏在实体几何背后的瞬态噪声。
- 自监督分解: 该框架通过预测动态掩码并惩罚投影到静态区域的持久高斯,学习在没有地面真值追踪标签的情况下分离静态和动态内容。
3. 下游应用:4D 分割
由于该表示显式地追踪了随时间变化的紧凑持久高斯(Gp=Gs∪Gd),语义特征可以在优化之后进行嵌入。通过将语义优化限制在这一持久子集上,该方法丢弃了瞬态表观噪声,从而实现了高效且准确的 4D 分割。
核心贡献
- 多级分解: 一种将静态结构、持久动态几何和瞬态表观分离的新颖框架,调和了运动一致性与光度保真度之间的矛盾。
- 自正则化训练: 一种包含速度感知提升和掩码感知剪枝的自底向上策略,实现了结构化专业化和紧凑表示,且无需预设分解。
- 性能提升: 在实现极少动态原语的同时,达到了最先进(SOTA)的渲染质量,并提升了运行性能。
- 高效 4D 分割: 证明了分解后的表示天然支持高效的 4D 分割,在推理速度上实现了数量级的提升。
实验结果
作者在三个任务上评估了 Multi4D:多视角动态新视角合成(NVS)、单目动态 NVS 和 4D 分割。
- 新视角合成 (Technicolor & Neu3D): Multi4D 实现了 SOTA PSNR 分数(例如,在 Technicolor 上为 34.30 dB,在 Neu3D 上为 32.30 dB),同时保持了实时渲染速度(分别为 161 FPS 和 217 FPS)。它超越了变形类和 4D 原语基准方法,成功保留了高频细节,同时避免了前者的时空模糊和后者的几何破碎问题。
- 单目 NVS (NeRF-DS): 在稀疏监督下,Multi4D 显著优于 4D 原语方法(后者常产生漂浮伪影)。Multi4D 保持了连贯的几何结构和精细的高光细节。
- 4D 分割 (Neu3D-Mask): 该方法实现了 0.9142 的 SOTA mIoU。至关重要的是,它仅需 13k 个动态高斯(相比之下,基准方法 TRASE 需要 624k 个),实现了 204 FPS 的语义特征渲染速度(比 21 FPS 的基准速度快了约 10 倍)。
- 效率: 与 4DGS 相比,Multi4D 将动态高斯数量减少了 25 倍(从 4.2M 降至 165k),模型存储从 2.6 GB 降至 214.7 MB,且训练收敛速度快了 4.6 倍。
重要性与主张
论文声称 Multi4D 从根本上解决了动态场景重建中物理合理性与视觉保真度之间的紧张关系。通过显式分离结构持久性与瞬态建模,它实现了:
- 自适应专业化: 模型可以根据需要动态分配容量,无需手动分解。
- 紧凑性与速度: 大幅降低了存储和计算成本,同时提高了渲染质量。
- 鲁棒性: 由于引入了持久的几何骨干,提高了在稀疏和单目输入下的泛化能力。
- 下游效用: 对持久高斯的显式追踪使得该表示天然适用于高效的 4D 语义推理,而这种能力在其他动态高斯方法中常因瞬态噪声或变形复杂性而受到阻碍。
作者指出,虽然该方法通过优化实现了结构紧凑性,但尚未引入显式的属性压缩(如量化),并将其列为未来的研究方向。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。