Native Audio-Visual Alignment for Generation
NAVA 是一个用于联合音视频生成的新颖框架,它在“先对齐后融合”的 MMDiT 架构中采用原生音视频对齐策略,仅使用 63 亿参数即可实现卓越的同步性、视频质量以及可控的语音音色。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你想创作一个电影场景,其中一名角色一边骑自行车一边说话。你需要两件事完美同步:自行车移动的视频,以及风声和人声的音频。
长期以来,计算机尝试分别生成这两者,然后在最后将它们拼接在一起。这就像让一位艺术家绘制自行车,而让另一位完全不同的艺术家录制人声,然后再试图让它们在后期匹配。结果往往是,人声与口型动作略有不同步,或者声音听起来并不属于那个特定场景。
其他较新的方法则尝试将艺术家、配音演员和导演全部塞进同一个狭小的房间里,让他们同时处理所有工作。虽然这有助于他们彼此沟通,但会变得混乱不堪。“导演”(文本指令)最终会与“音响工程师”(噪音的时序)混淆,导致难以控制诸如“谁”在说话或“声音听起来如何”等具体细节。
引入 NAVA:“排练室”方法
这篇论文介绍了 NAVA(原生音视频对齐),它改变了工作流程。NAVA 不再将工作分开进行,也不将所有内容混在一个大锅里,而是采用了一种巧妙的两步流程,称为“先对齐,后融合”。
把它想象成一场戏剧排练:
- 排练(对齐): 首先,演员(音频)和舞台工作人员(视频)在一个专门的“排练室”里见面。在这里,他们在导演不给出新台词的情况下共同练习。他们弄清楚脚步声的音频如何与脚落地的画面精确匹配,或者吉他扫弦如何与手部动作相匹配。他们在声音与画面之间建立起一种自然的、原生的联系。
- 演出(融合): 一旦他们掌握了如何协同动作和说话,导演(文本提示)便介入。导演不再需要教他们如何同步;导演只需告诉他们“做什么”。“现在,角色应该用一种愤怒的声音说出这句话。”由于演员和工作人员已经知道如何同步动作,他们能够立即适应新指令,而不会打乱节奏。
秘诀:“上下文中的音色”
NAVA 还有一个处理多说话者的特殊技巧。想象一个剧本,其中一位母亲和她的孩子正在对话。你不希望母亲的声音听起来像孩子的声音。
旧的方法可能有一个独立的“语音切换”按钮来改变整个场景的语音。NAVA 则更聪明。它将语音风格(音色)视为剧本本身的一部分。它为母亲的台词附加一个特定的“语音标签”,为孩子的台词附加另一个不同的“语音标签”。当计算机生成场景时,它确切地知道哪句台词属于哪个声音,就像导演阅读带有说话人注释的剧本一样。
论文发现
研究人员使用名为 Verse-Bench(测试音视频匹配程度)和 Seed-TTS(测试语音控制能力)的基准测试,将 NAVA 与其他顶级模型进行了测试。
- 更好的同步: NAVA 在确保声音与视觉事件(如关门或嘴唇移动)发生的精确时刻完全一致方面表现最佳。
- 高质量: 视频效果出色,音频听起来清晰且逼真。
- 高效性: 尽管比许多竞争对手更小(仅使用 63 亿个“脑细胞”或参数),它的表现却优于大得多的模型。
- 可控性: 它能够在同一场景中无缝切换不同的说话者,保持声音的清晰和准确。
总结
NAVA 通过为声音和视频提供一个专用空间,让它们在学习如何协同动作之后再尝试遵循复杂指令,从而解决了音视频生成的问题。这就像教一对舞蹈搭档在编舞者告诉他们要跳哪首歌之前,先掌握他们的舞步。其结果是,电影场景中的声音和画面感觉像是天生一体,而非仅仅被拼接在一起。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。