← 最新论文
💻 computer science

RoDyGS: Robust Dynamic Gaussian Splatting for Casual Videos

本文介绍了 RoDyGS,这是一种通过显式利用时空正则化分离静态与动态元素,从而从随意单目视频中重建动态三维场景的方法,同时提出了一项新的综合基准 Kubric-MRig,用于评估此类无姿态动态新视图合成方法。

原作者: Junmyeong Lee, Hoseung Choi, Yoonwoo Jeong, Minsu Cho

发布于 2026-05-07
📖 1 分钟阅读☕ 轻松阅读

原作者: Junmyeong Lee, Hoseung Choi, Yoonwoo Jeong, Minsu Cho

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你正拿着手机,录制一段繁忙公园的随意视频。你看到人们在行走,狗狗在奔跑,树木在风中摇曳。现在,想象试图将那段扁平的二维视频转变为一个三维世界,在那里你可以绕着树木行走,并从不同角度观察狗狗。这极其困难,因为你的视频仅展示了一个视角,而且相机本身在移动,使得难以分辨哪些运动是由相机移动引起的,哪些是物体自身的运动。

本文介绍了RoDyGS,一种旨在解决这一难题的新工具。将 RoDyGS 想象为一位“数字时空穿梭雕塑家”,它能将你手持拍摄的晃动视频重建为完整的三维场景,包括物体随时间如何运动。

以下是其工作原理,分解为简单的概念:

1. “静态与动态”分类帽

这类视频最大的问题在于混淆。那棵树是在移动,是因为风吹动了它,还是因为你从它旁边走过?

  • 类比:想象一场混乱的派对,有些客人静止不动(墙壁、地板),而其他人则在疯狂跳舞(人、汽车)。如果你试图一次性描述整个房间,那将是一团糟。
  • 解决方案:RoDyGS 戴上了一顶“分类帽”。它立即将场景分为两组:静态(不移动的背景)和动态(移动的物体)。通过将它们分开处理,系统不再混淆是相机在移动还是物体在移动。

2. “驱魔”正则化

当你尝试从单个视频中重建移动物体时,其部分往往会被其他物体遮挡(遮挡)。如果一个人走到汽车后面,系统会暂时失去对他们的追踪。如果没有帮助,三维模型可能会出现故障,将人变成一团模糊或幽灵般的 smear。

  • 类比:想象试图猜出一个玩具车的形状,而有人不断用毯子盖住它。如果你只是随机猜测,你可能会认为汽车正在融化。
  • 解决方案:RoDyGS 使用“物理规则”(称为正则化)来保持模型的真实性。
    • 距离保持:它提醒系统:“嘿,汽车轮子之间的距离不应该仅仅因为你有一瞬间看不见它们就发生变化。”它保持物体的刚性。
    • 表面平滑:它确保物体表面保持平滑,像一个真实的球体,而不是看起来像锯齿状、像素化的岩石。
    • 稳定运动:它假设物体不会在帧与帧之间瞬移或剧烈抖动。如果一个球在滚动,它会保持平滑滚动,而不是在原地振动。

3. “自我校正相机”

通常,要构建三维模型,你需要确切知道每一秒相机的位置。但在随意视频中,你没有这些数据。

  • 类比:这就像蒙着眼睛穿过城市试图绘制地图,只知道你眼前的景象。
  • 解决方案:RoDyGS 像一名侦探。它观察场景中的静态部分(地面、建筑物),以推断相机必定所在的位置。它在构建三维模型的同时,不断校正自己对相机路径的猜测。

4. 新的“训练健身房”(Kubric-MRig)

作者意识到,现有的这些工具测试过于简单或不切实际。这就像在平坦空旷的停车场上测试赛车。

  • 类比:他们建立了一个名为Kubric-MRig的新“障碍赛”。这是一个由计算机生成的合成世界,他们可以控制一切。他们创建了具有剧烈相机运动、物体四处飞散以及复杂背景的场景,所有这些都配有“完美答案键”(真实值),以便他们能够证明其工具确实有效。

结果

当他们在这一新障碍赛以及真实的 iPhone 视频上测试 RoDyGS 时,其表现优于以往的方法。

  • 结果:它生成了更清晰、更锐利的三维视频。如果你观看一段旋转风扇的视频,RoDyGS 可以重建风扇叶片,使其看起来坚固真实,而旧方法可能会使它们看起来像模糊的 smear 或幽灵。

总结:RoDyGS 是一个智能系统,它将移动物体与静止物体分离,利用严格的规则防止移动物体变成数字幽灵,并自行推断相机的路径。这使得它能够将简单、晃动的手机视频转化为高质量、三维、可“时空穿梭”的体验。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →