Baton: Explicit Semantic Blueprints for Joint Video-Audio Generation
Baton 是一个新颖的框架,通过引入 VA-Planner 来创建显式的、语义对齐的“蓝图”,并采用相对语义 RoPE 机制,从而克服现有扩散模型在引导和协调方面的粗糙问题,生成稳定、同步且细粒度的音视频内容。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在执导一个电影场景,其中的演员(视频)和音效(音频)必须完美同步。
问题:模糊的“导演”
当前用于生成视频和音频的人工智能模型,就像那些只给出非常模糊指令的导演。他们可能会说:“让它变得刺激!”然后把工作交给两个独立的团队:一个负责摄影组,一个负责音效组。
- 摄影组听到“刺激”,便开始拍摄爆炸场面。
- 音效组听到“刺激”,便开始播放响亮的音乐。
- 结果: 爆炸发生在音乐开始之后,或者声音与动作不匹配。由于团队之间没有共享的详细计划,它们各自偏离,导致出现奇怪的故障、扭曲的面孔,或者声音与嘴唇不同步。
解决方案:Baton 的“蓝图”
这篇论文介绍了一个名为 Baton 的新系统。它不像只是给出模糊指令,而是像一位在动工前绘制详细蓝图的总建筑师。
以下是其逐步工作原理:
1. 建筑师(VA-Planner)
在人工智能开始“绘制”视频或“混音”音频之前,它首先运行一个名为 VA-Planner 的特殊规划模块。
- 它的作用: 它读取你的提示词(例如:“一名士兵在爆炸击中时畏缩”),并将其分解为精确的、分步的时间表。
- 类比: 这就像编写一个剧本,其中写道:“在第 1 秒,士兵向左看。在第 1.5 秒,爆炸声响起。在第 2 秒,他捂住耳朵。”
- 神奇之处: 它创建了两个同步的“规划令牌”(数字笔记)列表。一个列表用于视频,一个用于音频。关键在于,这些列表是共同编写的,因此它们确切知道何时进行匹配。这防止了视频团队和音频团队进行猜测。
2. 施工现场(扩散模型)
一旦蓝图准备就绪,实际的生成过程就开始。人工智能使用一个强大的引擎(称为 DiT)来创建视频和音频。
- 蓝图的问题: 通常,蓝图(计划)和施工现场(正在绘制的视频帧)说着不同的语言。蓝图可能说“第 1 秒”,但施工现场是按“像素”和“帧”来计数的。它们无法完美对齐,就像试图把方钉塞进圆孔里。
- 修复方案(相对语义 RoPE): Baton 发明了一种特殊的翻译器,称为 Relative Semantic RoPE。
- 类比: 想象蓝图和施工现场是同一座城市的两张不同地图。一张地图使用“英里”,另一张使用“街区”。翻译器实时将蓝图中的“英里”转换为施工现场的“街区”。
- 结果: 现在,当施工现场在“第 5 街区”工作时,它确切知道要看蓝图的哪一部分。它确保出拳的声音发生在拳头接触的那一精确像素时刻。
3. 结果:完美同步的电影
因为 Baton 将思考(规划故事)与执行(绘制像素)分离开来,它解决了人工智能视频中最大的问题:稳定性。
- 旧方法: 人工智能一次性猜测整个故事,感到困惑,导致视频扭曲或音频漂移。
- Baton 方法: 人工智能首先就共享的时间表(蓝图)达成一致,然后严格遵循该时间表。即使是涉及多人对话、移动物体和声音变化的复杂场景,视频和音频也能保持锁定同步。
总结
该论文声称,通过强制人工智能先规划故事(使用 VA-Planner),然后完美地将该计划转换到绘制过程中(使用 Relative Semantic RoPE),我们可以生成比之前的开源模型更稳定、更同步且更能遵循复杂指令的视频和音频。它将混乱的即兴表演转变为排练完善的演出。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。