← 最新论文
💻 computer science

Forge4D: Feed-Forward 4D Human Reconstruction and Interpolation from Uncalibrated Sparse-view Videos

Forge4D 是一个前馈模型,它通过将流式 3D 高斯重建与自监督密集运动预测及遮挡感知融合进行联合优化,实现了对来自未校准稀疏视角视频的动态 3D 人体的快速、高效重建与插值。

原作者: Yingdong Hu, Yisheng He, Jinnan Chen, Weihao Yuan, Kejie Qiu, Zehong Lin, Siyu Zhu, Zilong Dong, Steven Hoi, Jun Zhang

发布于 2026-08-27
📖 1 分钟阅读☕ 轻松阅读

原作者: Yingdong Hu, Yisheng He, Jinnan Chen, Weihao Yuan, Kejie Qiu, Zehong Lin, Siyu Zhu, Zilong Dong, Steven Hoi, Jun Zhang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,试图捕捉一个人在房间中移动的过程,然后瞬间从任何角度——甚至是任何摄像机从未捕捉到的角度,或者任何从未被记录的时间点——重现那种动作。这就是四维重建的梦想:构建一个不仅存在于空间,而且存在于时间中的、活生生的数字孪生体。多年来,实现这一目标要么需要一整个布满同步摄像机的摄影棚,要么需要数小时耗费大量计算资源的缓慢处理过程,这使得实时交互变得不可能。目标始终是将区区几段零散的视频片段转化为一个完整的、流动的3D世界,在这个世界里,人们可以从任何角度、在任何时刻观察一个人,而数字模型不会因此崩塌或变得模糊混乱。

一组研究人员现在通过一个名为 Forge4D 的新系统,向实现这一梦想迈出了重要的一步。Forge4D 并没有试图一次性解决整个移动3D形状的问题(这往往会导致混乱和错误),而是将任务分解为两个更简单且相互关联的工作。首先,该系统根据几路未经校准的视频流,构建出人物及其周围环境的静态3D模型。可以将此想象为为场景创造了一座高质量的、冻结的雕塑。其次,系统会预测这座雕塑的每一个微小部分在每一秒钟之间是如何运动的。通过将形状与运动分离,研究人员发现了一种方法,使该过程能够快到足以进行实时应用,即使录制场景的摄像机没有完美对齐或校准。

他们发现的核心在于如何处理数据。以往的方法通常试图一次性处理整个视频序列,这会使计算机内存过载并降低速度。Forge4D 则采取了不同的方法,将视频视为一个流。它逐帧处理视频,使用一种特殊的记忆工具来记住前一时刻发生的情况,而无需重新加载整个历史记录。这使得系统在人物移动时能够保持一致的比例感和位置感,确保数字模型在视频播放过程中不会缩小、变大或发生漂移。这是一种能保持重建稳定性与高效性的方法,即使在输入数据稀疏且不完美的情况下也是如此。

一旦系统拥有了稳定的3D模型,它就面临着预测运动的挑战。由于没有关于人体每个点在现实世界中如何运动的完美地图来作为“老师”,研究人员发明了一种新的方式来教导计算机。他们让系统猜测运动,然后尝试根据这个猜测将3D模型向前扭曲(warp)到未来的时间。如果扭曲后的模型看起来与视频的下一帧一致,那么这个猜测就是正确的;如果看起来不对,系统就会调整其对运动的理解。这种自我修正的循环,结合对光影通常行为的检查,使得计算机能够在不需要预写剧本的情况下,学习人类运动的复杂舞蹈。它还开发出了一种处理被遮挡部位的方法,确保当人转身或物体遮挡视线时,数字模型依然保持完整,不会出现闪烁或故障。

这种方法的成果是令人瞩目的。在包括人物与物体互动的复杂场景在内的各种数据集测试中,该系统生成的图像比以往的方法更清晰、更逼真。它可以从从未拍摄过的角度创建场景的新视角,并能为从未捕捉到的时刻生成平滑、自然的运动。在测试中,该系统能够以每帧不到四分之一秒的速度生成这些高质量图像,这一速度为虚拟现实、直播和沉浸式通信等交互式应用打开了大门。研究人员指出,虽然该系统对于常规运动表现出色,但如果运动极其迅速或帧间间隔过大,它可能会遇到困难,这表明对平滑、连续运动的假设存在局限性。

最终,这项工作证明了从简单的、未经校准的视频中重建动态人类场景是可能的,其速度和质量在以前是无法企及的。通过将问题简化为易于处理的步骤,并教导计算机从自身的预测中学习,研究人员创造了一个工具,让我们离能够即时生成数字分身并进行实时交互的未来更近了一步。该系统不仅仅是在捕捉一个瞬间;它理解了那个瞬间内时间的流动,让我们能够步入视频之中,仿佛真的置身其中一般进行观察。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →