想象你正拿着手机,录制一段繁忙公园的随意视频。你看到人们在行走,狗狗在奔跑,树木在风中摇曳。现在,想象试图将那段扁平的二维视频转变为一个三维世界,在那里你可以绕着树木行走,并从不同角度观察狗狗。这极其困难,因为你的视频仅展示了一个视角,而且相机本身在移动,使得难以分辨哪些运动是由相机移动引起的,哪些是物体自身的运动。
本文介绍了RoDyGS,一种旨在解决这一难题的新工具。将 RoDyGS 想象为一位“数字时空穿梭雕塑家”,它能将你手持拍摄的晃动视频重建为完整的三维场景,包括物体随时间如何运动。
以下是其工作原理,分解为简单的概念:
1. “静态与动态”分类帽
这类视频最大的问题在于混淆。那棵树是在移动,是因为风吹动了它,还是因为你从它旁边走过?
- 类比:想象一场混乱的派对,有些客人静止不动(墙壁、地板),而其他人则在疯狂跳舞(人、汽车)。如果你试图一次性描述整个房间,那将是一团糟。
- 解决方案:RoDyGS 戴上了一顶“分类帽”。它立即将场景分为两组:静态(不移动的背景)和动态(移动的物体)。通过将它们分开处理,系统不再混淆是相机在移动还是物体在移动。
2. “驱魔”正则化
当你尝试从单个视频中重建移动物体时,其部分往往会被其他物体遮挡(遮挡)。如果一个人走到汽车后面,系统会暂时失去对他们的追踪。如果没有帮助,三维模型可能会出现故障,将人变成一团模糊或幽灵般的 smear。
- 类比:想象试图猜出一个玩具车的形状,而有人不断用毯子盖住它。如果你只是随机猜测,你可能会认为汽车正在融化。
- 解决方案:RoDyGS 使用“物理规则”(称为正则化)来保持模型的真实性。
- 距离保持:它提醒系统:“嘿,汽车轮子之间的距离不应该仅仅因为你有一瞬间看不见它们就发生变化。”它保持物体的刚性。
- 表面平滑:它确保物体表面保持平滑,像一个真实的球体,而不是看起来像锯齿状、像素化的岩石。
- 稳定运动:它假设物体不会在帧与帧之间瞬移或剧烈抖动。如果一个球在滚动,它会保持平滑滚动,而不是在原地振动。
3. “自我校正相机”
通常,要构建三维模型,你需要确切知道每一秒相机的位置。但在随意视频中,你没有这些数据。
- 类比:这就像蒙着眼睛穿过城市试图绘制地图,只知道你眼前的景象。
- 解决方案:RoDyGS 像一名侦探。它观察场景中的静态部分(地面、建筑物),以推断相机必定所在的位置。它在构建三维模型的同时,不断校正自己对相机路径的猜测。
4. 新的“训练健身房”(Kubric-MRig)
作者意识到,现有的这些工具测试过于简单或不切实际。这就像在平坦空旷的停车场上测试赛车。
- 类比:他们建立了一个名为Kubric-MRig的新“障碍赛”。这是一个由计算机生成的合成世界,他们可以控制一切。他们创建了具有剧烈相机运动、物体四处飞散以及复杂背景的场景,所有这些都配有“完美答案键”(真实值),以便他们能够证明其工具确实有效。
结果
当他们在这一新障碍赛以及真实的 iPhone 视频上测试 RoDyGS 时,其表现优于以往的方法。
- 结果:它生成了更清晰、更锐利的三维视频。如果你观看一段旋转风扇的视频,RoDyGS 可以重建风扇叶片,使其看起来坚固真实,而旧方法可能会使它们看起来像模糊的 smear 或幽灵。
总结:RoDyGS 是一个智能系统,它将移动物体与静止物体分离,利用严格的规则防止移动物体变成数字幽灵,并自行推断相机的路径。这使得它能够将简单、晃动的手机视频转化为高质量、三维、可“时空穿梭”的体验。
技术摘要:RoDyGS:面向休闲视频的鲁棒动态高斯泼溅
1. 问题陈述
从休闲拍摄的单目视频重建 4D 场景(3D 几何 + 时间)是计算机视觉领域的一项重大挑战。尽管神经辐射场(NeRF)和 3D 高斯泼溅(3DGS)的最新进展改善了静态新视图合成,但由于两个主要因素,从单目、未校准视频中进行动态重建仍然困难:
- 相机 - 物体运动模糊性:从单视角联合估计相机轨迹和动态场景几何本质上存在模糊性。
- 遮挡与时空一致性:动态物体频繁被遮挡,导致观测缺失,从而破坏场景元素随时间的一致性。
现有方法通常依赖专门的采集设置(多视图、深度传感器)、预校准的姿态或严格的场景约束(例如前向相机、小幅度运动),限制了其在通用“野外”场景中的适用性。此外,当前的基准测试往往缺乏真实相机姿态或同步的多视图采集,使得对无姿态动态方法的严格评估变得困难。
2. 方法论:RoDyGS
作者提出了RoDyGS(鲁棒动态高斯泼溅),这是一个端到端框架,直接从休闲单目视频重建动态场景表示,无需外部传感器或手动校准。该方法联合优化动态高斯泼溅和相机运动。
核心组件
静态 - 动态部分分离:
场景被显式划分为两组高斯:静态(GS)和动态(GD)。
- 静态元素:与相机参数联合优化,以确保时间连贯的背景表示。
- 动态元素:独立优化以满足运动约束。
- 优势:这种分离将相机运动与动态物体运动解耦,显著减少了模糊性并提高了优化稳定性。
初始化:
- 相机姿态与几何:使用MASt3R [36](一种数据驱动的先验模型)进行初始化,以提供鲁棒的初始相机姿态和点云。
- 运动掩码:使用Track Anything Model (TAM) [65] 识别动态区域,将运动物体与背景分离。
- 深度:使用DepthAnything [66] 估计单目深度图,以进行几何监督。
时空正则化:
为了强制符合物理的几何和自然的运动,RoDyGS 为动态高斯引入了特定的正则化项:
- 距离保持正则化(Ldp):通过维持高斯与其 K 个最近邻在时间步之间的相对距离,强制时间一致性。即使在遮挡期间,这也保持了物体的刚性。
- 表面平滑正则化(Lsurf):通过惩罚高斯与其邻居平均位置的偏差,确保局部表面平滑,防止局部扰动。
- 平稳运动正则化(Lsm):基于现实世界运动在短时间间隔内是一致的这一假设,该项对运动基函数进行正则化以防止漂移。
- 加权运动正则化:为了避免过度平滑复杂运动,对运动基元素应用加权方案,允许对不同运动频率的正则化强度进行显式控制。
优化目标:
该框架使用复合损失函数联合优化高斯属性、运动基参数和相机姿态:
- 光度损失(Lrecon):渲染图像与目标图像之间的 L1 和 SSIM 损失。
- 深度损失(Ldepth):Pearson 深度损失,以最大化渲染深度与估计单目深度之间的线性相关性(处理尺度模糊性)。
- 几何损失(Lgeo):Ldp 和 Lsurf 的组合。
- 运动损失(Lsm):平稳运动正则化。
3. 主要贡献
- RoDyGS 框架:一种针对休闲单目视频的鲁棒重建方法,通过显式部分分离和时空正则化实现高保真渲染。其性能优于之前的无姿态动态新视图合成方法。
- Kubric-MRig 基准测试:一个新的、具有挑战性的数据集,旨在评估动态场景中的姿态估计和渲染质量。与之前的基准测试不同,Kubric-MRig 具有以下特点:
- 同步多视图采集(真实值)。
- 广泛的相机和物体运动。
- 真实相机姿态。
- 背景元素(在其他动态数据集中通常缺失)。
- 综合评估:在 Kubric-MRig 数据集上展示了最先进的性能,并在 iPhone 数据集 [15] 和 Tanks and Temples 数据集 [30] 上取得了具有竞争力的结果,在保持处理动态能力的同时,匹配了无姿态静态方法的渲染质量。
4. 实验结果
- 动态新视图合成:在 Kubric-MRig 数据集上,RoDyGS 在 PSNR、SSIM 和 LPIPS 方面显著优于之前的无姿态方法(例如 RoDynRF [39]、SoM [57])。它在使用真实相机姿态训练的方法面前也取得了具有竞争力的结果。
- 静态新视图合成:在静态场景(Tanks and Temples)上评估时,RoDyGS 实现了与 CF-3DGS [13] 相当的渲染质量,并显著优于其他基线,同时保持了具有竞争力的相机姿态估计精度。
- 消融实验:实验证实,部分分离和提出的正则化项都至关重要。移除部分分离会导致严重的不一致和形状失真,而正则化项则锐化了物体边界并保持了结构一致性。
- 鲁棒性:即使在大幅度的相机和物体运动下,RoDyGS 也能保持刚性物体几何,而依赖长期点跟踪的基线方法往往因复杂动态中的不准确跟踪而失败。
5. 意义与局限性
意义:
论文声称,RoDyGS 解决了从休闲单目视频重建动态 4D 场景的关键差距,无需依赖专用硬件或预校准姿态。通过引入包含真实值和多样化运动的综合基准测试(Kubric-MRig),作者为评估未来的动态重建方法提供了严格的标准。该方法分离静态和动态元素的能力,使得在模糊场景中的优化更加稳定。
局限性:
作者承认存在若干局限性:
- 遮挡:与其他 4D 重建方法一样,RoDyGS 只能重建场景中可见的部分。完全遮挡的区域或长期遮挡无法在没有生成先验(例如扩散模型)的情况下恢复。
- 刚性假设:正则化项假设动态元素不表现出高度复杂的非刚性变形(例如人体或宽松衣物)。泛化到此类场景需要参数化模型(例如 SMPL)或更强的数据驱动先验。
- 初始化依赖:该方法依赖 MASt3R 进行初始相机姿态;不准确的初始化可能会降低渲染质量,尽管联合优化有助于对其进行细化。
总之,RoDyGS 代表了使 4D 重建适用于日常休闲拍摄视频的一步,提供了一种在几何一致性与运动保真度之间取得平衡的鲁棒解决方案。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。