← 最新论文
💻 computer science

4Director: Controlling Video World Models with Rigid 3D Geometry

该论文介绍了 4Director,这是一种通过以显式 4D 刚性几何和运动适配器为条件进行生成,从而实现精确摄像机与物体控制的视频世界模型,并通过一个新的数据集和评估指标进行了验证,其在视觉质量和运动一致性方面均优于现有方法。

原作者: Wei Cao, Hao Zhang, Vikram Voleti, Yuqun Wu, Mallikarjun B R, Shimon Vainer, Mark Boss, Yaoyao Liu

发布于 2026-10-02
📖 1 分钟阅读☕ 轻松阅读

原作者: Wei Cao, Hao Zhang, Vikram Voleti, Yuqun Wu, Mallikarjun B R, Shimon Vainer, Mark Boss, Yaoyao Liu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象这样一个世界:一台计算机只需观看一张静态照片,就能从中构思出一场正在上演的电影。这就是视频世界模型(video world models)所许下的诺言——这是人工智能领域一个快速发展的方向,机器通过学习来预测场景随时间变化的规律。多年来,研究人员一直试图通过向系统展示数千小时的视频,教它们生成动态图像,希望计算机能自发地学习物理规则和运动规律。然而,一个重大的障碍始终存在:尽管这些计算机在创造逼真运动方面变得越来越出色,但它们却极难被“指挥”。如果用户希望某个物体转身,或者希望摄像机绕过一个角落,计算机往往会忽略指令,或者生成一个看起来虽然合理但在几何结构上错误的结果。物体可能会在移动时缩小,而不是远离;或者当摄像机移动时,物体可能会模糊成一片幽灵般的痕迹。核心挑战在于如何弥合人类清晰的三维意图与计算机基于二维平面模式进行猜测的倾向之间的鸿沟。

来自 Stability AI 和伊利诺伊大学厄巴纳-香槟分校的研究团队推出了一种名为 4Director 的新方法来解决这个问题。4Director 不再要求计算机去猜测物体的路径,而是在视频生成开始之前,就为计算机提供一张完整的场景三维地图。在这个系统中,原始照片中的每个物体都被重建为一个实心的数字 3D 模型,就像雕塑家创作一个具有前、后、侧面的粘土塑像一样,即便原始照片只展示了正面。背景也被提升为空间中的点云。一旦这个数字世界构建完成,用户就可以绘制一条摄像机路径和一条物体路径,就像电影导演规划镜头那样。随后,计算机将这些实心的 3D 模型沿着预设路径进行刚性运动,确保如果一个物体在旋转,它会作为一个整体进行旋转;如果摄像机移动,背景也会进行正确的偏移。

这项创新的核心在于如何利用这个刚性骨架来引导最终的视频生成。系统首先渲染一张简单的黑白深度图,展示随着物体沿路径移动时,每个表面距离摄像机的距离。这张深度图充当了一个严格的支架,精确定义了每个像素在空间和时间上的位置。研究人员称之为“运动适配器”(Motion Adapter)的专门训练模块,随后会接过这个刚性骨架,并填充缺失的细节。它学习如何在固定的 3D 结构之上,描绘出表面纹理、光影效果以及细微的非刚性运动——例如手臂的摆动或旗帜的飘动。这确保了最终的视频既遵循用户对位置和朝向的精确指令,又看起来像是一个自然、生动的场景。

为了教会系统如何运作,研究人员不得不创建一套全新的大规模数据集,因为现有的任何视频集都不具备必要的 3D 地图。他们建立了一个自动化流水线,对 20,000 多个视频片段进行了逆向工程,将每一个片段转化为具有摄像机路径和物体路径的刚性 3D 场景。这个名为 RealCOD-Rigid 的数据集让运动适配器能够学习区分实体的刚性运动与现实世界中细节的柔性运动。结果显示,该方法较以往的方法有了显著提升。在测试中,即使在物体完全转身或移出视野后再回到视野的情况下,4Director 仍能保持物体的连贯性和可识别性,而其他系统在这些任务中往往会因丢失物体身份或将其模糊进背景而失败。

研究人员还开发了一种衡量成功的新方法,他们意识到,如果物体本身发生了改变,仅仅检查物体是否处于正确位置是不够的。他们的新指标会同时检查物体的“位置”和“身份”,以确保转弯的汽车看起来仍然是同一辆车。在与其它领先的视频生成工具对比时,4Director 生成的视频在视觉质量以及对场景内摄像机和物体的控制精度上,都表现出了持续且更高的水准。该系统证明,通过在生成视频之前赋予计算机对世界的清晰三维理解,可以实现此前难以企及的控制水平,让用户能够像专业电影制作人一样,精准地导演场景的流动。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →