Stream4D: 4D-Consistency for Streaming Autoregressive Diffusion Video Models
Stream4D 通过引入前馈 4D 重建奖励和运动先验来取代静态判别器,从而增强了自回归扩散视频模型,进而防止几何漂移并保持长时视频生成中连贯且自然的运动。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,试图教会一台计算机实时、逐帧地构思一部电影,仿佛它是一个活生生的世界。多年来,研究人员一直在构建能够根据简单的文本描述生成视频的人工智能模型。这些系统通过预测序列中的下一个时刻来工作,就像讲故事的人在猜测故事中的下一句话一样。当这些模型被设计为无止尽地流式传输视频时,它们面临着一个独特的挑战:随着故事变得越来越长,角色和物体往往会开始发生漂移、失去形状或冻结成不自然的静止状态。计算机难以保持世界几何结构的连贯性,导致汽车突然拉伸成一条长长的丝带,或者人完全消失。当人工智能被要求生成长篇、连续的场景时,这个问题尤为严重,因为一个时刻产生的微小误差会不断堆积,最终毁掉整个幻觉。
为了解决这个问题,来自加州大学洛杉矶分校(UCLA)和清华大学的研究团队开发了一种名为 Stream4D 的新方法。他们的工作针对了当前这些 AI 模型训练中的一个特定缺陷。以往修复“漂移问题”的尝试依赖于一种将视频视为刚性、不变的 3D 物体的技术。计算机试图将视频重建为一个静态雕塑,如果视频发生了运动,系统就会将这种运动视为一种错误。这产生了一种反向激励:AI 学会了获得高分的最高效方式就是完全停止运动。结果是,视频中摄像机可能会平移,但其中的人物和物体却保持静止,就像博物馆里的雕像一样。研究人员意识到,要创造一个可信的世界,人工智能需要理解物体可以在运动和变化的同时,依然保持其身份的一致性。
该团队引入了一种新的训练方法,用动态的 4D 透视图取代了僵硬的 3D 视角。他们不再要求 AI 构建一个静态雕塑,而是要求它构建一个随时间演变的生动场景。他们使用一种专门的工具,可以将视频重建为移动的点云,从而让计算机能够观察到一个角色如何奔跑或一辆车如何行驶,同时保持其形状和身份。这个新系统奖励 AI 创造连贯的运动,而不是惩罚运动。为了确保运动看起来自然而非抖动或混乱,他们增加了第二层引导,以鼓励适度的运动,防止视频变得过于静止或过于紊乱。第三个组件则充当视觉锚点,确保生成的图像保持美观并忠于原始风格。
在对几种不同的视频生成模型进行测试时,这种新方法产生了显著更好的结果。在涉及长达十秒视频的实验中,新方法大幅提升了 3D 重建的清晰度和一致性,某些模型的质量指标提升了近七分贝。更重要的是,人类评估者和自动评判者都更青睐这些视频,因为其中的主体保持完整且运动自然。与旧方法经常导致的场景冻结或形体扭曲不同,Stream4D 让角色能够在不丢失形态的情况下奔跑、跳跃并与环境互动。研究人员发现,这种技术适用于不同类型的 AI 骨干网络,表明它是解决长期视频一致性问题的一个稳健方案。
该研究明确排除了“静态 3D 重建足以用于训练视频模型”的观点,并证明这种方法反而会损害运动质量。作者展示了当训练系统惩罚运动时,AI 会学会通过冻结场景来最大化得分。通过转向一个理解动态变化的系统,他们成功扭转了这一趋势。研究结果在数百个提示词和多种模型架构上进行了测量,为该方法提供了强有力的证据。虽然研究人员指出,他们的系统仍然依赖于关于摄像机运动的某些假设,但在保留物体身份和运动方面,其改进是显而易见的。这项工作为创造能够生成长篇、交互式视频流的人工智能提供了一条切实可行的路径,让生成的视频世界感觉真实、连贯且充满活力。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。