← 最新论文
💻 computer science

4DSloMo: 4D Reconstruction for High Speed Scene with Asynchronous Capture

本文介绍了 4DSloMo,这是一种高速 4D 重建系统,它通过异步采集方案以及一种用于修正稀疏视角伪影的新型视频扩散生成模型,使标准 25 FPS 摄像头的等效帧率达到 100–200 FPS。

原作者: Yutian Chen, Shi Guo, Tianshuo Yang, Lihe Ding, Xiuyuan Yu, Jinwei Gu, Tianfan Xue

发布于 2026-06-17
📖 1 分钟阅读☕ 轻松阅读

原作者: Yutian Chen, Shi Guo, Tianshuo Yang, Lihe Ding, Xiuyuan Yu, Jinwei Gu, Tianfan Xue

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图用慢动作拍摄一只蜂鸟的翅膀。为了看清翅膀的动作,你需要一台每秒能拍摄数百张照片的摄像机。但大多数普通摄像机每秒只能拍摄 25 或 30 张照片。如果你尝试用这种慢速摄像机拍摄蜂鸟,翅膀看起来就像一团模糊的影子;如果你试图根据这些模糊的照片重建鸟的 3D 形状,整个模型就会崩塌。

这篇题为 4DSloMo 的论文通过一个巧妙的两部分方案解决了这个问题:一个硬件上的“黑客技巧”和一个软件上的“魔法咒语”。

第一部分:硬件黑客技巧——“接力赛”

通常,当科学家使用一组摄像机拍摄 3D 场景时,他们会命令所有摄像机在完全相同的时间按下快门(同步拍摄)。如果你有 4 台摄像机,你每秒会得到 4 张照片。

作者们意识到,他们可以在不购买昂贵、高速摄像机的情况下“作弊”。他们没有让所有摄像机同时按下快门,而是让它们在略微不同的时间按下快门,就像运动员在进行接力赛传递接力棒一样。

  • 类比: 想象一排站着 4 个人。如果他们同时鼓掌,你会听到一声巨大的“啪”。但如果他们一个接一个地快速鼓掌,听起来就像是一阵密集的机枪声。
  • 结果: 通过错开摄像机启动的时间,他们将一个标准的每秒 25 帧的设置,变成了一个感觉像是在捕捉 每秒 100 到 200 帧 的系统。他们不需要新的、昂贵的摄像机;他们只是改变了时序。

第二部分:软件魔法——“艺术修复师”

这个时序技巧带来了一个问题。因为摄像机是在不同时间按下快门的,所以在任何一个特定的瞬间,系统只有少数几台摄像机在观察场景,而不是全部。这就像是试图画一幅肖像画,但手里只有几支画笔,而不是一整套画笔。其结果是 3D 重建结果中充满了“漂浮物”(幽灵般的、漂浮的伪影)和缺失的细节。

为了修复这个问题,作者们训练了一位特殊的 AI 艺术家(视频扩散模型)。

  • 类比: 想象你有一张正在跳舞的舞者的草图,由于参考照片不足,这张草图有点抖动且有些污点。你把这张草图交给一位看过成千上万段舞者视频的大师级画家。这位画家不仅仅是修复单帧画面,他们还会观察 整个视频,以理解舞者的手臂在每一秒之间是如何移动的。他们填补了缺失的细节,并抹平了那些幽灵般的污点,确保舞者看起来形态稳固且动作自然。
  • 创新之处: 之前的 AI 工具试图单独修复每一帧,这导致舞者在帧与帧之间看起来在不停地抖动或随机改变形状。而这个新的 AI 会观察 整个视频,在保持运动平滑和一致的同时,清理掉混乱的痕迹。

最终结果

通过将“接力赛”式的摄像机时序与“艺术修复师”AI 相结合,该团队可以:

  1. 使用廉价的标准摄像机捕捉快速、复杂的动作(如跳舞的人或飞舞的布料)。
  2. 重建这些场景的高质量 3D 图像,尽管从技术上讲这些摄像机是“慢速”的。
  3. 创建一个新的真实世界快速运动视频数据集,以帮助他人测试自己的想法。

简而言之,他们找到了如何让慢速摄像机表现得像超高速摄像机的方法,然后利用智能 AI 清理了时序技巧造成的模糊混乱,最终得到了快速运动场景的高清 3D 电影。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →