想象你正在执导一场电影场景:一名演员在雨中一边弹吉他一边唱歌。在一个完美的世界里,歌声、吉他扫弦声和雨声会在恰好的时刻同时发生,融合成一种优美而自然的体验。
然而,当前试图制作这类视频的 AI 工具往往力不从心。它们可能会把演员的声音调得过大,以至于盖过了吉他和雨声;或者让演员的嘴唇随着吉他音符开合,而不是随着歌词动作。这就像一支乐队,歌手在乐器声之上嘶吼,而鼓手则节奏混乱。
这篇论文介绍了一种名为Unison(意为“协同一致”)的新 AI 框架,旨在解决这些问题。你可以将 Unison 想象为一位技艺高超的音视频指挥,确保视频中的每个元素都能完美和谐地协作。
以下是它如何通过简单的类比解决两个主要问题:
1. “音量旋钮”问题(语音与音效)
问题所在: 在以往的 AI 模型中,“语音”(演员说话或唱歌)就像派对上的一个霸凌者。它会占据所有空间,将“音效”(如雨声、风声或吉他扫弦)挤到背景中,直到几乎听不见。其结果是音频平淡乏味,环境显得虚假。
Unison 的解决方案: Unison 扮演一位拥有两个独立调音台的智能音频工程师的角色。
- 分离: Unison 不再试图将人声和吉他混在一个杂乱的堆里,而是在两条独立的音轨上分别构建它们。
- “智能门控”(SCG): 想象一个交通信号灯系统。如果场景主要是演员在说话,系统会自动将背景噪音的音量降低到刚好让人声清晰的程度。但如果场景是音乐会或暴风雨,系统则会调高背景声音,防止它们被人声淹没。
- “握手”(Bi-ACA): 人声音轨和声音音轨不断相互“交流”。它们互相检查,确保人声不会意外吞掉吉他声,反之亦然。这确保了最终的音频是一个平衡、丰富的混音,你能清晰地听到歌手和雨声。
2. “唇形同步”问题(动作与声音)
问题所在: 视频和音频经常不同步。演员可能会在声音发出后的一刹那才张开嘴,或者在听到音符之前就开始扫弦。这感觉就像视频和音频是两个从未一起排练过的不同的人。
Unison 的解决方案: Unison 使用一种称为“跨模态强制”的训练演练。
- 类比: 想象两位舞者正在学习一套舞蹈。通常,他们会尝试以完全相同的速度学习整支舞。如果其中一人绊倒,另一人也会绊倒,两人都会感到困惑。
- Unison 的转折: Unison 让其中一位舞者(比如音频)以稍快且更清晰的速度学习舞步,而另一位(视频)则稍慢。这位“更清晰”的舞者随后充当向导,向那位“更杂乱”的舞者精确展示下一步该踩在哪里。
- 结果: 通过让更清晰的信号引导较杂乱的那个,AI 学会了将视频动作和声音完美地锁定在一起。久而久之,演员的嘴唇会在说出话语的同一时刻移动,吉他的扫弦也会在手指触弦的同一瞬间响起。
最终结果
当你将这两个解决方案结合起来时,Unison 创造出的视频感觉真实。
- 不再互相淹没: 你既能听到歌手,也能听到背景音乐。
- 不再延迟: 动作和声音在同一时刻发生。
论文表明,Unison 不仅让视频看起来好看,还让它们听起来悦耳、感觉同步,从而创造出比以往 AI 模型更具沉浸感的体验。它无需庞大的计算机即可实现这一目标,证明了智能的组织方式(如分离音轨和引导学习)与原始算力同样重要。
技术摘要:Unison——为以人为中心的音视频生成协调运动、语音与声音
1. 问题陈述
该论文指出了当前以人为中心的音视频生成模型中存在的两个根本性挑战,这些挑战阻碍了逼真、沉浸式内容的创作:
- 音频内部干扰(语音主导): 现有模型往往无法平衡音频流中的异构声学元素。结构化的语音成分倾向于主导并掩盖瞬态环境声音(例如脚步声、乐器拨弦或环境噪音),导致听觉场景扁平化。这在“边演奏乐器边唱歌”等场景中尤为 problematic,因为模型缺乏解耦并平衡语音与音效的机制。
- 跨模态错位: 运动与音频生成通常仅通过隐式的架构交叉注意力进行关联,而缺乏显式的同步目标。这导致手势、口型动作与声学起始点不同步。虽然某些近期方法实现了帧级同步,但它们往往缺乏显式的一致性约束,导致视觉动作与其对应声音之间出现时间漂移。
2. 方法论:Unison 框架
Unison 是一个统一框架,旨在以连贯、同步的方式生成运动、语音和音效。它采用双分支架构(视频和音频),通过双向交叉注意力进行耦合,并建立在流匹配(Flow Matching, FM)基础之上,融合了扩散强制(Diffusion Forcing, DF)原则。
2.1 架构概述
- 双分支结构: 该框架利用基于 Wan2.2-5B 的视频分支和基于 MMAudio 构建的音频分支,并辅以 Zipformer 以增强鲁棒的语音生成能力。
- 集成: 各分支通过帧级双向交叉注意力连接,其中视频和音频潜在变量互为查询,以促进无缝的信息交换。
- 输入/输出: 系统接收描述文本(κ)和转录文本(τ)作为输入,生成同步的视频(ν)和音频(α)。
2.2 解决方案 1:语义引导的协调策略(音频流)
为了解决音频内部干扰,Unison 将语音和音效(SFX)的生成解耦为独立的流,同时保持它们的交互。
- 双向音频交叉注意力(Bi-ACA): 音频潜在变量被表示为包含语音(hsp)和音效(hsfx)成分的双流张量。这些流在 Transformer 块内经历“交互 - 合并 - 拆分”循环。它们被拼接,通过带有模态特定偏置的共享自注意力进行处理以防止语义混淆,随后再拆分。关键在于,Bi-ACA 在两个流之间执行双向交叉注意力,使它们能够相互细化特征并确保声学一致性,而无需完全依赖视觉线索。
- 语义条件门控(SCG): 为了防止无约束的上下文注入,SCG 自适应地调节跨流更新。源自描述文本(ca)和转录文本(cs)的全局语义向量被用于预测门控系数(gsp,gsfx)。
- 在叙述主导的场景中,SCG 衰减音效特征以保持语音纯度。
- 在复杂声景中(例如音乐表演),它增强跨流影响以丰富非语音声学。
- 监督: 模型使用 Mel-Roformer 将混合音频解耦为真实语音和音效潜在变量,通过独立的流匹配损失(LspCFM+LsfxCFM)优化双流解码器。
2.3 解决方案 2:双向跨模态强制策略(运动 - 音频对齐)
为了解决运动与音频的失步问题,Unison 引入了一种训练策略,显式地对齐不同模态的去噪进度。
- 解耦的时间步: 与先前使用相同时间步的工作不同,Unison 为每个模态独立采样时间步(视频为 tv,音频为 ta)。这使得“更干净”的模态(噪声水平较低)能够引导“更嘈杂”的模态。
- 方向性引导: 方向指示器(d)识别哪个模态处于主导地位。损失函数被动态重新加权以优先处理噪声较大的分支,迫使其通过跨模态条件从更干净的对应方中提取更强的监督信号。
- 渐进式训练课程: 为确保稳定性,训练遵循三阶段课程:
- 同步预热: 强制 tv=ta 以建立基础对齐。
- 增量解耦: 激活独立采样,同时对噪声差距施加约束(∣tv−ta∣≤0.25)。
- 完全独立: 采用无约束的解耦更新。
这种渐进过程防止了由极端噪声差异引起的优化不稳定。
3. 主要贡献
- 统一框架: 提出了 Unison,这是一个显式强制跨模态一致性的框架,以协调的方式生成运动、语音和声音,超越了以往音视频模型的松散耦合。
- 语义引导的协调: 引入了一种策略,利用 双向音频交叉注意力(Bi-ACA) 和 语义条件门控(SCG) 来解耦语音和音效生成。这解决了声学干扰,防止语音主导,并实现了可控的、分层的音频生成。
- 双向跨模态强制: 开发了一种策略,通过解耦的去噪时间表允许更干净的模态引导更嘈杂的模态,从而加强时间依赖性,有效弥合了运动与声学之间的差距。
4. 实验结果
作者在包含 1,000 个样本的精选测试集上评估了 Unison,并与最先进的基础模型(包括 Universe-1、UniAVGen、MOVA 和 LTX-2)进行了对比。
- 定量性能:
- 音频保真度: Unison 在感知质量(PQ: 6.34)、内容实用性(CU: 5.61)和词错误率(WER: 0.22)方面取得了最高分数,优于参数量显著更大的模型(例如 LTX-2 的 19B 参数对比 Unison 的 5B 视频骨干网络)。
- 同步性: 该模型表现出卓越的跨模态一致性,取得了最佳的 DeSync(DS: 0.08)和具有竞争力的唇语 - 语音同步(LSE-C: 3.30)分数。
- 定性改进:
- 视觉比较显示,Unison 成功合成了和谐的语音和音效(例如平衡唱歌与吉他拨弦),而基础模型则存在语音主导或缺失音效的问题。
- 消融实验证实,移除语义引导的协调策略会导致音频质量显著下降,而移除跨模态强制策略则会导致时间失步急剧增加(DS 上升至 0.19)。
- 用户研究: 在涉及 25 名参与者的研究中,Unison 获得了主导性的整体偏好,在语音 - 声音和谐度以及运动 - 音频对齐方面排名最高。
5. 意义与主张
该论文主张,Unison 通过显式解决跨模态时间特性的异质性,建立了一种以人为中心的视频生成的原则性方法。
- 平衡的听觉场景: 通过解耦语音和音效,该框架确保环境声音不会被人声抑制,从而增强了感知真实感。
- 鲁棒的同步性: 双向跨模态强制策略创造了一个稳定的训练环境,使音频和视频相互增强,从而在不单纯依赖大规模参数扩展的情况下实现更紧密的时间对应。
- 灵活性: 对称设计实现了双向生成(音频到视频和视频到音频),证明了该框架作为多模态内容创作统一模型的适应性。
作者得出结论,显式的多模态协调对于下一代生成式人工智能至关重要,而 Unison 的架构创新有效地捕捉了高保真的视听相关性。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。