From Dense Prediction to Visual Editing: Structured Supervision for Unified Image and Video Creation
本文提出了一种统一的图像与视频生成框架,该框架通过在共享的多模态扩散 Transformer 主干网络中引入深度与表面法线预测作为结构化视觉监督,从而将有用的结构知识迁移至下游生成任务,进而增强了精确且具有时间一致性的编辑能力。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象这样一个世界:计算机不仅能根据描述画出一幅画,还能通过一段现有的视频改变其中的一个特定细节——比如将阴雨天变为晴天,或者增加一只奔跑的狗——而不会改变场景的其他部分,也不会让视频产生闪烁。这就是统一视觉创作(unified visual creation)所承诺的前景,在这个领域中,人工智能学习如何从同一套指令中生成并编辑图像和视频。为了让这些系统良好运行,它们不仅要理解像“增加一只狗”这样的词汇含义,还要理解场景的物理结构:物体在哪里、它们如何重叠,以及它们如何随时间移动。如果没有这种结构性的理解,计算机可能会执行添加一只狗的指令,却不小心抹去了站在它旁边的行人,或者让新出现的动物在视频播放过程中闪烁不定。挑战在于,如何教导一个单一的模型在遵循多样化指令的同时,保持视觉世界的底层几何结构和身份特征完整不变。
研究人员开发出一种新方法,教导计算机在学习创造世界的同时,也学会以三维视角观察世界。该团队并没有仅仅向模型展示图像或视频对并要求它猜测变化,而是增加了一个新的训练层。他们要求模型预测其处理的每一幅图像中的两个特定要素:场景的深度(即物体距离有多远)以及表面法线(即描述表面朝向的方向,例如墙壁的倾斜度或球体的曲率)。这些预测并不是最终目标;研究人员并不是试图构建一个最好的 3D 扫描仪。相反,他们利用这些任务作为一种手段,迫使模型去关注图像中隐藏的骨架。通过学习重建这些结构图,模型能够更好地感知边界在哪里以及物体之间如何相互关联,这有助于它在随后被要求编辑内容时保留这些细节。
为了实现这一点,该团队构建了一个将指令的含义与其需要遵循的视觉证据相分离的系统。系统的其中一部分负责读取文本指令并理解意图,而另一部分则观察源图像或视频的实际像素,以保持空间细节的锐利。这两股信息流在同一个共享的大脑中结合,从而学习生成新的内容。至关重要的是,研究人员还创建了一种特殊的训练数据生成方法。他们并没有仅仅编辑视频的第一帧并将该变化向后复制(这往往会导致错误),而是教导系统生成成对的视频,其中变化发生在不同的时间点。一段视频可能展示一个场景,而配对的视频则展示了同一个场景,但其中的变化在视频中途开始或在片段结束前结束。这教会了模型准确地在何时以及何处应用变化,确保视频的其余部分保持稳定和一致。
这种方法的实验结果表明,加入这些结构性课程显著提高了编辑质量。在针对标准视频编辑任务的测试中,接受了这种额外训练的模型得分高于以往的系统,特别是在需要添加或改变局部物体而不干扰背景的任务中。这种提升在保持未编辑部分看起来自然且稳定方面最为明显。研究人员发现,这种方法在广泛的任务中都表现出色,从从头开始创建新视频,到根据文本指令或参考图像编辑现有视频。他们证明了一个单一模型可以处理所有这些不同的工作,并取得了超过目前现有的其他统一系统的综合高分。
然而,研究人员谨慎地界定了他们成功的局限性。他们明确表示,其目标并非创建一个更优越的深度或表面角度测量工具,也并未针对这些特定任务对模型进行测试。深度和法线预测的价值完全在于它们如何辅助创作过程,而非在于这些地图本身的准确性。这项研究表明,这种结构性知识的迁移是真实且可衡量的,但它并不声称模型已经实现了对物理世界的通用理解。该系统在处理极长的视频时仍会遇到困难,例如角色可能会发生漂移或改变外观,并且在处理极小的物体或多个参考信息冲突时也会遇到麻烦。这项工作代表了向更可靠的视觉编辑迈出的重要一步,它表明教导模型理解场景结构能让它成为一名更好的艺术家,即便这位艺术家目前还不是一名完美的建筑师。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。