Hierarchical Codec Diffusion for Video-to-Speech Generation
本文提出了 HiCoDiT,一种利用残差矢量量化(RVQ)码本层级结构的新颖视频转语音生成模型,通过分层生成块和双尺度自适应实例归一化机制,分别捕捉说话人语义与细粒度韵律,从而实现了更优的音视频对齐及高保真度的语音合成。
原始论文根据 CC0 1.0(http://creativecommons.org/publicdomain/zero/1.0/)发布到公有领域。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
这篇论文介绍了一个名为 HiCoDiT 的新系统,它的核心功能是:看着一段没有声音的视频,就能自动生成出完美匹配的口型、语气和情感的语音。
想象一下,你有一部老电影,画面里的人在说话,但声音带子丢了。以前的技术就像是一个“笨拙的配音员”,虽然能模仿口型,但声音听起来要么像机器人,要么情绪不对(比如画面在哭,声音却在笑)。
HiCoDiT 之所以能做得这么好,是因为它用了一种**“分层构建”**的聪明策略。我们可以用两个生动的比喻来理解它的工作原理:
1. 声音的“洋葱”结构(分层思想)
以前的方法是把声音当成一个扁平的、混在一起的大杂烩。但 HiCoDiT 发现,声音其实像洋葱,或者像盖房子,是有层次的:
- 底层(洋葱的外层/地基): 这里包含了**“谁在说话”(声音像谁)和“说了什么”(具体的字词内容)。这部分主要靠嘴巴怎么动**(唇形)和长什么样(人脸特征)来决定。
- 高层(洋葱的内层/装修): 这里包含了**“怎么说话”(语气、情感、抑扬顿挫)。这部分主要靠脸上的表情**(是开心还是生气)来决定。
HiCoDiT 的聪明之处: 它不再把眼睛看到的画面一股脑全塞给声音生成器,而是**“分而治之”**:
- 它把嘴巴动作和人脸长相专门用来控制声音的底层(确保声音像本人,口型对上)。
- 它把面部表情专门用来控制声音的高层(确保语气有感情,比如生气时声音更急促)。
2. 像“填字游戏”一样的生成过程(扩散模型)
传统的生成方法可能像“从头写到尾”的写作,容易写偏。HiCoDiT 用的是**“扩散模型”,这更像是一个“填字游戏”**:
- 开始: 系统先拿一张全是“乱码”(或者全是空白)的纸。
- 逐步修正: 它像一位经验丰富的编辑,看着视频画面,一步步把乱码擦掉,填上正确的字。
- 分层填词:
- 先填底层:看着嘴巴动,先把“谁在说话”和“大概说什么”填好。
- 再填高层:看着表情变化,把“语气是高兴还是悲伤”填好。
- 最终成品: 经过几十步的精细修正,原本乱糟糟的纸变成了一段清晰、自然、充满感情的语音。
3. 特殊的“调音台”(双尺度自适应层)
为了让生成的语音既像本人,又有感情,HiCoDiT 发明了一个特殊的**“智能调音台”**(论文里叫双尺度 AdaLN)。
- 全局旋钮(Channel-wise): 用来控制整体风格。比如,这个人的声音是浑厚的还是尖细的?这个旋钮负责把这种“整体人设”定下来。
- 局部推子(Temporal-wise): 用来控制瞬间的情绪。比如,这一秒是惊讶,下一秒是疑惑?这个推子负责让语气随着时间流动而自然变化。
以前的方法往往只能调一个总开关,导致声音要么太死板,要么情绪乱跳。HiCoDiT 这个“双旋钮”设计,让声音既有稳定的个人特色,又有灵动的表情变化。
总结:它厉害在哪里?
- 以前: 像是一个只会读稿子的机器人,口型对得上,但声音没感情,或者声音不像本人。
- 现在 (HiCoDiT): 像是一个天才配音演员。
- 它知道嘴巴动代表说什么(内容对齐)。
- 它知道长相代表是谁(身份对齐)。
- 它知道表情代表心情(情感对齐)。
实际效果:
在测试中,HiCoDiT 生成的语音,无论是听起来有多自然(像真人说话),还是口型有多同步,都超过了目前市面上最好的其他方法。甚至在没有专门训练过的真实电影片段上,它也能表现得非常稳定,生成的声音清晰、有感情,几乎让人分不清是真人还是 AI 生成的。
简单来说,HiCoDiT 就是把“看视频配音”这件事,从“乱猜”变成了“精密的分层构建”,让机器真正学会了像人一样去“理解”和“表达”声音。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。