← 最新论文
💻 computer science

See4D: Pose-Free 4D Generation via Auto-Regressive Video Inpainting

本文提出了 See4D,一种无需相机姿态监督的 4D 生成框架,它通过将显式轨迹预测替换为固定虚拟相机渲染,并结合视图条件视频修复与自回归推理管线,实现了从随意视频中生成连贯且泛化能力强的 4D 内容。

原作者: Dongyue Lu, Ao Liang, Tianxin Huang, Xiao Fu, Yuyang Zhao, Baorui Ma, Liang Pan, Wei Yin, Lingdong Kong, Wei Tsang Ooi, Ziwei Liu

发布于 2026-03-13
📖 1 分钟阅读☕ 轻松阅读

原作者: Dongyue Lu, Ao Liang, Tianxin Huang, Xiao Fu, Yuyang Zhao, Baorui Ma, Liang Pan, Wei Yin, Lingdong Kong, Wei Tsang Ooi, Ziwei Liu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一个名为 SEE4D 的新技术,它的核心目标非常酷:把一段普通的手机拍摄视频,瞬间变成可以“360 度自由观看”的 4D 动态场景。

想象一下,你用手机拍了一段在公园散步的视频,只能看到眼前的画面。有了 SEE4D,你不仅能看到眼前的,还能“穿”进视频里,走到树后面看,或者飞到半空中俯瞰,而且视频里的人还在继续走动,就像真的进入了那个世界一样。

为了让你更容易理解,我们可以用几个生活中的比喻来拆解这项技术:

1. 以前的痛点:需要“专业导游”

以前的方法(比如 TrajectoryCrafter 等)想要实现这种效果,通常需要给视频里的每一帧都贴上“专业导游”的标签(也就是精确的相机位置数据)。

  • 比喻:这就像你想让一个画家画出一幅从不同角度看的风景画,但你必须拿着尺子,精确地告诉画家:“第一笔在左边 3 厘米,第二笔在右边 5 厘米,相机要转 30 度……"
  • 问题:对于我们在网上随手拍的视频(野路子视频),根本没人会去贴这些标签。而且,如果标签贴错一点点,画出来的东西就会扭曲、变形,非常脆弱。

2. SEE4D 的绝招:不需要导游,只要“透视眼”

SEE4D 不需要那些麻烦的标签。它换了一种思路:“先猜位置,再补画面”

第一步:给视频装上“透视眼”(深度估计与扭曲)

它先给视频里的每一帧估算一个“深度图”(也就是告诉电脑哪里近、哪里远)。

  • 比喻:就像给平面的照片强行加上了厚度,把它变成了一个立体的“纸模”。
  • 操作:然后,它把这个“纸模”按照你想看的角度(比如走到树后面)进行扭曲和拉伸。
  • 结果:这时候你会得到一张“半成品”图。因为有些东西被挡住了(比如树挡住了人),或者因为深度猜得不准,画面会裂开、有洞。

第二步:请一位“超级修补匠”(视频修复模型)

这时候,SEE4D 的核心模型登场了。它就像一个拥有“透视眼”的超级修补匠。

  • 比喻:想象你在修补一幅被撕破的挂毯。挂毯上裂开的地方(因为视角变化露出的空白),修补匠不需要知道挂毯原本是怎么挂的(不需要相机轨迹),他只需要看着挂毯的纹理和周围的颜色,就能脑补出裂开后面应该是什么图案。
  • 创新点:以前的修补匠容易“照猫画虎”,把裂开的地方直接填成原来的样子。SEE4D 的修补匠很聪明,它知道哪些地方是猜出来的(有噪点),哪些地方是真实的,它会动态调整,既保留真实感,又填补空白。

3. 如何搞定长视频和大幅移动?(自动递归推理)

如果视频很长,或者你想从“正面”直接跳到“背面”,跨度太大,直接修补会糊成一团。SEE4D 用了两个聪明的策略:

  • 空间策略:走“小台阶”

    • 比喻:如果你想从山脚走到山顶,不要试图一步跨上去,那样会摔跟头。SEE4D 会先插好一排“虚拟相机”作为台阶,从山脚走到半山腰,修补好;再走到半山腰,修补好……一步步平滑过渡到山顶。
    • 效果:这样每一步的变形都很小,修补匠能修得很完美,最后连起来就是流畅的大跨度视角转换。
  • 时间策略:像“接龙”一样

    • 比喻:拍长视频时,电脑一次只能处理一小段(比如 16 秒)。如果直接切段,中间会断片。SEE4D 就像玩“接龙”,处理完前 16 秒后,它会把最后几秒的画面“留”下来,作为下一段 16 秒的开头。
    • 效果:这样视频就像流水一样,首尾相接,没有任何卡顿或跳变。

4. 这项技术能干什么?

论文里展示了它非常实用的场景:

  • 机器人抓东西:机器人只有一个摄像头,但 SEE4D 能帮它“脑补”出侧面的视角,让它知道桌子底下有没有东西,抓得更准。
  • 自动驾驶:车上的摄像头只能看前面,SEE4D 可以生成虚拟的“侧视”和“后视”画面,帮司机看清盲区。
  • 游戏与电影:玩家拍了一段游戏画面,导演可以直接把镜头拉远、旋转,甚至穿过墙壁看角色,就像真的在拍电影一样,不需要重新拍摄。

总结

SEE4D 就像是一个不需要专业设备、不需要复杂标注的"4D 魔法相机”。它通过“先猜深度,再智能修补”的方法,把我们在日常生活中随手拍的视频,变成了可以随意穿梭、自由观察的沉浸式世界。这不仅让 VR(虚拟现实)内容创作变得极其简单,也让机器拥有了更强大的“空间感知”能力。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →