想象这样一个世界:一台计算机只需观看一张静态照片,就能从中构思出一场正在上演的电影。这就是视频世界模型(video world models)所许下的诺言——这是人工智能领域一个快速发展的方向,机器通过学习来预测场景随时间变化的规律。多年来,研究人员一直试图通过向系统展示数千小时的视频,教它们生成动态图像,希望计算机能自发地学习物理规则和运动规律。然而,一个重大的障碍始终存在:尽管这些计算机在创造逼真运动方面变得越来越出色,但它们却极难被“指挥”。如果用户希望某个物体转身,或者希望摄像机绕过一个角落,计算机往往会忽略指令,或者生成一个看起来虽然合理但在几何结构上错误的结果。物体可能会在移动时缩小,而不是远离;或者当摄像机移动时,物体可能会模糊成一片幽灵般的痕迹。核心挑战在于如何弥合人类清晰的三维意图与计算机基于二维平面模式进行猜测的倾向之间的鸿沟。
来自 Stability AI 和伊利诺伊大学厄巴纳-香槟分校的研究团队推出了一种名为 4Director 的新方法来解决这个问题。4Director 不再要求计算机去猜测物体的路径,而是在视频生成开始之前,就为计算机提供一张完整的场景三维地图。在这个系统中,原始照片中的每个物体都被重建为一个实心的数字 3D 模型,就像雕塑家创作一个具有前、后、侧面的粘土塑像一样,即便原始照片只展示了正面。背景也被提升为空间中的点云。一旦这个数字世界构建完成,用户就可以绘制一条摄像机路径和一条物体路径,就像电影导演规划镜头那样。随后,计算机将这些实心的 3D 模型沿着预设路径进行刚性运动,确保如果一个物体在旋转,它会作为一个整体进行旋转;如果摄像机移动,背景也会进行正确的偏移。
这项创新的核心在于如何利用这个刚性骨架来引导最终的视频生成。系统首先渲染一张简单的黑白深度图,展示随着物体沿路径移动时,每个表面距离摄像机的距离。这张深度图充当了一个严格的支架,精确定义了每个像素在空间和时间上的位置。研究人员称之为“运动适配器”(Motion Adapter)的专门训练模块,随后会接过这个刚性骨架,并填充缺失的细节。它学习如何在固定的 3D 结构之上,描绘出表面纹理、光影效果以及细微的非刚性运动——例如手臂的摆动或旗帜的飘动。这确保了最终的视频既遵循用户对位置和朝向的精确指令,又看起来像是一个自然、生动的场景。
为了教会系统如何运作,研究人员不得不创建一套全新的大规模数据集,因为现有的任何视频集都不具备必要的 3D 地图。他们建立了一个自动化流水线,对 20,000 多个视频片段进行了逆向工程,将每一个片段转化为具有摄像机路径和物体路径的刚性 3D 场景。这个名为 RealCOD-Rigid 的数据集让运动适配器能够学习区分实体的刚性运动与现实世界中细节的柔性运动。结果显示,该方法较以往的方法有了显著提升。在测试中,即使在物体完全转身或移出视野后再回到视野的情况下,4Director 仍能保持物体的连贯性和可识别性,而其他系统在这些任务中往往会因丢失物体身份或将其模糊进背景而失败。
图像平面线索的歧义性: 基于 2D 边界框、拖拽路径或点追踪的控制在深度和旋转方面具有歧义。2D 投影与多种 3D 运动是一致的;例如,一个缩小的边界框无法区分物体是在远离还是仅仅在变小;此外,2D 路径会将摄像机视差与物体运动混淆。
3D 控制中的几何不完整性: 虽然 3D 感知控制(如 3D 框、追踪点或高斯团块)减少了歧义,但它们通常缺乏完整的物体几何结构。提升后的代理(lifted proxies)通常只能捕捉输入视角可见的“外壳”。因此,当摄像机移动或物体旋转时,新视角中显现的几何结构必须在每一帧中独立进行幻觉生成,从而导致外观和结构的连贯性缺失。此外,基于点的代理需要繁琐的逐点轨迹设计。
论文声称 4Director 代表了迈向专业级视频控制的重要一步,因为它将运动的精确定义(通过刚性 3D 几何)与外观及动力学的合成解耦。通过将场景视为显式的、可编辑的 4D 状态而非交互式展开过程,它确保了显露的几何结构是被渲染出来的,而不是被重新生成的。
然而,作者也指出了一项特定的局限性:该表示仅在刚体层面控制运动。它无法规定关节运动或变形运动(例如人跑步或跳跃);此类非刚性动力学完全由生成器决定。在涉及关节物体的失败案例中,生成器可能会让物体保持初始姿态而不是动画化肢体,因为刚性控制信号并未指定这些更精细的动作。作者建议,将刚性 3D 场景扩展到包含关节部分是自然而然的下一步工作。