← 最新论文
💻 computer science

Bernini: Latent Semantic Planning for Video Diffusion

Bernini 是一个统一的视频生成与编辑框架,它采用分工机制,其中基于多模态大语言模型的规划器在视觉 Transformer 嵌入空间中进行语义推理,以指导基于扩散 Transformer 的渲染器,并通过高效的独立训练以及诸如“感知片段的 3D 旋转位置编码”等新颖组件,实现了最先进的性能。

原作者: Bernini Team, Chenchen Liu, Junyi Chen, Lei Li, Lu Chi, Mingzhen Sun, Zhuoying Li, Yi Fu, Ruoyu Guo, Yiheng Wu, Ge Bai, Zehuan Yuan

发布于 2026-05-22
📖 1 分钟阅读☕ 轻松阅读

原作者: Bernini Team, Chenchen Liu, Junyi Chen, Lei Li, Lu Chi, Mingzhen Sun, Zhuoying Li, Yi Fu, Ruoyu Guo, Yiheng Wu, Ge Bai, Zehuan Yuan

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是关于Bernini论文的解读,使用类比转化为通俗易懂的语言。

核心理念:建筑师与建造者

想象一下你想建造一座定制房屋。你有两位专家:

  1. 建筑师(多模态大语言模型,MLLM): 这个人擅长理解你模糊的想法、阅读复杂的蓝图,并弄清楚房子应该是什么样子。他们非常擅长推理,但完全不擅长实际砌砖。
  2. 建造者(扩散模型): 这位是工艺大师。他们可以砌砖、粉刷墙壁、安装窗户,达到照片级的完美效果。然而,如果你只是说“弄好看点”,当你想要一座小屋时,他们可能会建出一座城堡。他们需要非常具体的指令。

Bernini是一个将这两位专家结合起来的系统。它不强迫建筑师去砌砖,也不强迫建造者去做复杂的推理,而是赋予他们一种专用语言来进行交流。

工作原理:“秘密蓝图”

过去,试图将这两种类型的 AI 结合起来往往很混乱。Bernini 通过建立“分工”来解决这个问题:

  1. 规划阶段(建筑师):
    当你给 Bernini 一个指令(例如“把天气改成暴风雨之夜,让狗开心起来”)时,MLLM 规划器不会尝试直接绘制视频。相反,它像一位建筑师,勾勒出一张高层蓝图

    • 秘诀所在: 这张蓝图既不是图片也不是句子。它是一组数学代码(称为"ViT 嵌入”),代表了场景的含义。这就像建筑师递给建造者一份坐标和情感基调的清单,而不是一张图画。
  2. 渲染阶段(建造者):
    DiT 渲染器(即建造者)接收这张蓝图。它还会查看原始视频(如果你是在进行编辑),以保持背景的一致性。以蓝图为指导,它逐帧生成实际像素,创造出照片级的视频。

这为什么很酷? 因为建筑师和建造者可以分别进行训练。建筑师持续变得更擅长理解人类语言,而建造者持续变得更擅长制作漂亮的图像。它们只需要学习如何读懂彼此的“秘密蓝图”语言,这比从头重新训练整个系统要容易得多。

新工具:“姓名标签”与“思考步骤”

为了让这一切完美运作,研究人员添加了两个巧妙的技巧:

  • “姓名标签”系统(SA-3D RoPE):
    想象你在一个拥挤的房间里,每个人都穿着同样的衣服。如果你大喊“看那个戴红帽子的人”,如果现场有三个戴红帽子的人,这就很令人困惑。
    在视频编辑中,AI 经常需要同时查看原始视频参考图像新视频。有时,原始视频中的某个像素与新视频中的某个像素处于完全相同的位置。
    Bernini 为谜题的每一部分都贴上了一个**“姓名标签”**(分段索引)。这告诉 AI:“这顶红帽子属于原始视频,而那顶红帽子属于视频。”这防止了 AI 感到困惑并将源与结果混淆。

  • “大声思考”步骤(思维链):
    有时,简单的指令是不够的。如果你说“让它看起来像卡通”,AI 可能只会改变颜色。
    Bernini 的规划器被教导在绘制蓝图之前要大声思考。它将任务分解:“首先,我需要理解光照。其次,我需要改变皮肤的纹理。第三,我需要调整运动。” 这种逐步推理帮助 AI 处理复杂的任务,例如改变天气,使视频中的火焰自然地熄灭(因果推理)。

它能做什么?

论文表明,Bernini 是视频的“瑞士军刀”。它可以:

  • 文生视频: 根据描述从头创建视频。
  • 视频转视频编辑: 改变风格、添加或移除物体,或改变现有视频中的天气。
  • 参考引导编辑: “让视频中的这个人看起来像这张照片里的人。”
  • 动作迁移: “让这张照片里的人像这个视频里的人一样跳舞。”

结果:赢得比赛

研究人员在他们创建的新基准测试Bernini-Bench上,将 Bernini 与其他顶级视频 AI 模型(如 Kling、Wan 等)进行了测试。

  • 得分: Bernini 赢得了“视频编辑排行榜”,在一致性和遵循指令方面击败了竞争对手。
  • 关键胜利: 它在保持视频一致性方面特别出色。当你编辑视频的一部分时,视频的其余部分不会变形或出现故障。它在只改变你所要求的内容的同时,保持与原始场景的真实一致。

总结

Bernini 就像聘请了一位天才建筑师,为大师级建造者撰写一套完美的指令。通过让他们使用一种专用的“蓝图语言”交流,并赋予他们工具来追踪视频的哪一部分是哪一部分,Bernini 创造出的视频不仅美观,而且足够智能,能够理解复杂、逻辑性的变化。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →