想象一下,你正试图仅用一部普通手机拍摄的单段视频,来重现一个动态的 3D 世界(例如一个人跳舞或一辆车行驶)。这对计算机而言是一个巨大的难题。本文介绍了一种名为RiGS(刚体感知 4D 高斯泼溅)的新解决方案,旨在破解这一难题。
以下是其工作原理,通过简单的类比进行解释:
问题:一种尺寸无法适配所有情况
以往的方法试图用同一种“工具”来描述视频中每一个运动部分。
- 有些工具擅长描述缓慢、平滑的运动(例如汽车在直路上行驶),但当物体快速移动或形状迅速变化时(例如狗摇尾巴),它们就会失效。
- 其他工具擅长处理快速、混乱的运动,但它们会让视频在时间推移中显得抖动且不稳定。
作者意识到,现实世界的运动就像一座双峰山脉:一个峰代表漫长、平滑的运动,另一个尖锐的峰代表短暂、快速且复杂的运动。试图用一种工具攀登这两座峰,效果并不理想。
解决方案:三工具套件
RiGS 通过根据视频中正在发生的事情,使用三种不同类型的“数字积木”(称为高斯原语)来构建 3D 场景,从而解决这一问题:
静态积木(背景):
将它们想象成房间的墙壁。它们永远不会移动。无论视频是在开始还是结束,这些积木都保持在原位,用来代表地板、墙壁或天空。
刚体积木(平滑舞者):
想象一个刚性机械臂或一个实心木箱。这些积木作为一个整体单元一起移动。它们非常适合那些滑动、旋转或平稳行驶而不改变形状的事物。它们处理“长期”的平滑运动。
瞬态积木(烟花):
它们就像烟花或一群蜜蜂。它们被设计为仅出现极短的时间,向疯狂的方向移动,然后消失。它们处理“短期”的快速、复杂或摇摆运动(例如飘扬的旗帜或晃动的狗尾巴),这是刚体积木无法处理的。
魔法技巧:角色转换
RiGS 的巧妙之处在于,这些积木可以在计算机学习过程中转换角色。
- 如果一个“刚体积木”(平滑舞者)试图模拟过于快速或过于摇摆的运动,它会意识到自己难以胜任。
- 系统随后会说:“好吧,你不再是平滑舞动了;你变成了烟花!”于是它转变为瞬态积木。
- 这使得系统能够自动决定视频的每一个部分最适合哪种工具,从而确保结果既平滑又细节丰富。
“物体”规则
为了确保计算机不会混淆,RiGS 使用了一条特殊规则,称为物体级动态掩码。
- 旧方法: 计算机查看单个像素。如果狗的尾巴在摇动,但狗的其他部分静止,它可能会感到困惑,认为整只狗一半在动、一半静止。
- RiGS 方法: 计算机观察整个物体(整只狗)。如果狗的任何部分在移动,计算机就将整只狗视为一个移动物体。这保持了 3D 模型的一致性,防止视频出现闪烁或断裂。
结果
通过这种混合搭配的方法,RiGS 可以将单段视频转化为高质量的 3D 场景,你可以从任何角度观看。
- 它捕捉平滑、长时的运动(例如人行走),而不会使其模糊。
- 它捕捉快速、细致的运动(例如面部表情或飘动的衣物),而不会让视频抖动。
简而言之,RiGS 就像一个智能施工队,知道何时使用稳定的起重机、灵活的机械臂,或是一群无人机,以便从单个视频文件中构建出完美的 3D 电影。
技术摘要:RiGS – 基于单目视频的刚性感知 4D 高斯泼溅
问题陈述
从单目视频重建动态 3D 场景是计算机视觉和图形学中的基本挑战,在 VR/AR、自动驾驶和机器人领域具有广泛应用。现有方法在建模不同时间尺度的运动时面临关键权衡:
- 逐帧优化方法能够捕捉高频运动细节,但往往遭受时间一致性差和几何结构不稳定的困扰。
- 基于刚性的方法(例如使用“尽可能刚性”假设的方法)保持了几何稳定性并能很好地处理大视角变化,但无法建模发生大幅变形或快速非刚性运动的区域,导致重建不完整。
作者指出了基于刚性的 高斯表示中的一个特定局限性:它们难以同时捕捉长期的平滑变换和短期的复杂变形。对基于刚性的动态高斯的分析揭示了时间持续性的双峰分布,表明刚性表示能有效建模稳定、长期的运动,但无法表示短期、细粒度的动态。
方法论:RiGS
提出的**刚性感知 4D 高斯泼溅(RiGS)**框架通过在统一优化框架内将场景运动分解为三种不同类型的高斯原语来解决这些局限性:
1. 三层高斯表示
- 静态高斯(gs): 表示在整个视频中持续存在的时间不变背景。
- 刚性高斯(gr): 旨在建模长期、低频、平滑的运动。这些高斯通过 SE(3) 变换(无变形的旋转和平移)和共享运动基进行参数化,以确保连贯的运动。
- 瞬态高斯(gt): 旨在处理短期、高频和复杂的非刚性动态。这些高斯拥有完全可学习的运动速度向量,允许它们向任何方向自由移动以捕捉快速变化。
2. 对象级动态分解
为了引导静态和动态区域的分离,RiGS 引入了对象级动态掩码。与以往缺乏跨整个对象的时间和空间一致性的像素级方法不同,RiGS 在对象层面聚合了长程时空运动信息。
- 该方法使用 SAM2 进行对象分割,并基于光流不确定性和桑普森误差(Sampson error)计算运动分数。
- 如果对象的任何部分在任何时间表现出运动,则整个对象被视为动态。这防止了静态和动态高斯对同一对象的不同部分进行冗余建模,从而确保全局一致的表示。
3. 自适应过渡与联合优化
- 软门控与过渡: 刚性高斯配备了一个软门控函数,根据其持续时间(β)和中心(γ)控制其时间不透明度衰减。在优化过程中,持续时间较短的刚性高斯会动态转换为瞬态高斯。这使得系统能够随着运动复杂性的增加,自适应地从刚性建模转向灵活建模。
- 场景流引导: 为了提供稠密的 3D 运动监督,该方法利用度量深度和相机参数将 2D 光流提升至 3D 场景流。该场景流引导了刚性和瞬态高斯的运动方向,解决了动态区域监督信号稀疏的问题。
4. 优化策略
该框架采用联合优化策略,包括:
- 预热阶段: 初始化静态高斯、刚性高斯和运动基,以建立稳定的几何结构。
- 联合训练: 所有三种高斯类型一起优化。系统使用光度损失、几何损失(深度和法线一致性)、对应损失(跟踪和光流)以及正则化项来防止伪影和过拟合。
主要贡献
- 多尺度运动建模: RiGS 引入了一个统一框架,联合建模静态、刚性和瞬态高斯,从而能够捕捉跨多个时间尺度的运动(从长期平滑运动到短期高频动态)。
- 对象级动态掩码: 提出了用于静态 - 动态分解的对象级动态掩码,该掩码聚合时空信息以确保时间一致性并防止对象表示不一致。
- 结合场景流的联合优化: 一种策略,利用稠密的 3D 场景流监督指导跨尺度运动的学习,并包含一种基于时间持续性的机制,使刚性高斯能够过渡为瞬态高斯。
实验结果
作者在多个基准测试中评估了 RiGS,包括Nvidia 动态场景数据集、DyCheck iPhone 数据集以及来自DAVIS 数据集的极端运动场景。
- 定量性能: RiGS 在新视图合成基准测试中取得了最先进(SOTA)的性能。在 Nvidia 动态场景数据集上,它在 PSNR、SSIM 和 LPIPS 指标上优于之前的 SOTA 方法(包括基于 NeRF 和基于高斯的方法,如 MoSca 和 DynPoint)。例如,在"Playground"场景中,RiGS 的 PSNR 达到 24.73,而 MoSca 为 24.25。
- 定性性能:
- 在具有大幅非刚性变形的场景中(例如"Umbrella"场景),RiGS 成功建模了变形,而没有出现以往方法中的伪影或不一致的几何结构。
- 在复杂的多对象场景中(例如"Playground"),RiGS 保留了细粒度细节(如面部表情),而仅基于刚性或基于节点插值的方法未能重建这些细节。
- 在极端运动场景中(例如来自 DAVIS 的"Judo"和"Dog-agility"),RiGS 成功捕捉了其他方法无法恢复细节的快速运动区域。
- 效率: 该方法在约 30 分钟内训练一个 270 帧的视频(480×360),并实现了约 160 FPS 的渲染速度。
意义与主张
论文声称,RiGS 通过明确解决跨多个时间尺度建模运动的挑战,代表了动态场景重建的重大进步。通过将场景分解为静态、刚性和瞬态组件,该方法克服了纯刚性或纯逐帧方法的局限性。
作者断言,他们的对象级动态掩码提供了更可靠的静态和动态区域分离,而刚性高斯与瞬态高斯之间的过渡机制,结合场景流引导的优化,提供了稠密且连贯的 3D 运动监督。广泛的实验表明,这种方法带来了更优越的重建质量和时间一致性,为现实应用中更鲁棒的动态场景建模铺平了道路。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。