← 最新论文
💻 computer science

Efficient Camera-Controlled Video Generation of Static Scenes via Sparse Diffusion and 3D Rendering

本文介绍了 SRENDER,这是一种用于静态场景相机控制视频生成的效率方法,它通过利用扩散模型生成稀疏关键帧并结合 3D 重建合成完整视频,实现了超过 40 倍的加速,同时能够根据相机轨迹的复杂度自适应地优化关键帧数量。

原作者: Jieying Chen, Jeffrey Hu, Joan Lasenby, Ayush Tewari

发布于 2026-01-15
📖 1 分钟阅读☕ 轻松阅读

原作者: Jieying Chen, Jeffrey Hu, Joan Lasenby, Ayush Tewari

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你想制作一部电影,镜头在静态的房间(比如客厅或街道场景)中平滑地穿梭。

旧方法(“暴力破解”法):
目前的 AI 视频生成器就像一群才华横溢但速度极慢的艺术家。为了制作一段 20 秒的视频,它们试图从头开始,一帧一帧地绘制每一张画面。尽管房间本身没有变化,但它们却为每一张图片都重新绘制墙壁、家具和地板。这需要耗费大量的时间和计算能力——通常为了制作短短几秒钟的视频,就需要进行数分钟的高强度计算。这就像是每当你走进房子迈出一步时,都要雇一名画家把整栋房子重新粉刷一遍。

新方法 (SRENDER):
剑桥大学的研究人员(Jieying Chen, Jeffrey Hu, Joan Lasenby, 和 Ayush Tewari)提出了一种更聪明的策略,称为 SRENDER。它不再是绘制每一帧,而是采用了一种“稀疏”的方法。你可以这样理解:

  1. 草图阶段(关键帧): AI 只沿着摄像机将要经过的路径绘制几张“关键”图片(关键帧)。如果摄像机移动得很慢,它就只画很少的图片。如果摄像机剧烈旋转,它就会多画一些。这就像一位艺术家从几个不同的角度勾勒房间的轮廓,以确定布局。
  2. 3D 模型阶段: 完成这些少量的草图后,系统会利用它们构建一个快速的数字 3D 模型。这就像是将那些 2D 草图瞬间拼凑成一个虚拟现实模型。
  3. 穿梭阶段: 现在,不再是要求那位缓慢的艺术家去画新的图片,计算机只需让一个虚拟摄像机在那个 3D 模型中“飞行”。因为模型已经存在,计算机可以几乎瞬间生成两个草图之间的缺失帧。

“智能预算”功能:
该系统在工作量分配上也十分聪明。它有一个“预测器”,会在开始前观察摄像机的路径。

  • 如果摄像机只是平稳地滑过一条走廊,系统会说:“简单,我只需要 4 张草图。”
  • 如果摄像机正在转角处进行复杂的旋转,它会说:“好吧,我需要 30 张草图来确保效果正确。”
    这确保了系统不会在不需要的时候浪费时间去绘制过多的图片。

结果:

  • 速度: 这种方法比之前的最优方法快了 43 倍。以前需要数分钟才能生成的视频,现在仅需约 16 秒。它已经足够快,可以达到“实时”(即你生成视频的速度与观看速度相当)。
  • 质量: 尽管它跳过了绘制大部分帧的过程,但视频看起来依然一样好,甚至更好。它避免了其他 AI 在尝试猜测每一帧时经常出现的“闪烁”或“晃动”等伪影问题。
  • 一致性: 因为它先构建了一个 3D 模型,所以场景非常稳定。随着摄像机的移动,墙壁不会发生变形或改变形状,而这是其他 AI 视频工具常见的缺陷。

简而言之:
与其试图为电影的每一秒都画出一幅画,SRENDER 是先画出几张关键帧,从中构建出一个 3D 世界,然后仅仅是拍摄摄像机在这个世界中移动的过程。这就像是为电影的每一秒都手绘一幅壁画,与搭建一个实景布景并拍摄摄像机在其中移动之间的区别。

注:该论文专门针对*静态场景(不动的房间、建筑、景观)。它并不声称目前能处理复杂的动态人物或动作场面,尽管作者表示这一基础可以为未来的研究提供帮助。*

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →