Expressive Prompting: Improving Emotion Intensity and Speaker Consistency in Zero-Shot TTS
该论文提出了一种专为情感化语音合成设计的两阶段提示选择策略,通过结合静态阶段的声学特征评估与动态阶段的文本相似度匹配,有效提升了零样本语音合成中的情感强度与说话人一致性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
这篇论文介绍了一种名为 ExpPro 的新方法,旨在解决人工智能(AI)“说话”时的一个核心痛点:如何让 AI 模仿声音时,不仅像本人,而且情感更丰富、更到位。
为了让你轻松理解,我们可以把 AI 语音合成想象成**“请一位演员(AI)来演一段戏”**。
1. 核心问题:演员选错了“剧本”和“参考”
现在的 AI 语音技术(特别是基于大语言模型的)非常厉害,只要给它一段几秒钟的录音(我们叫它**“提示音”或Prompt**),它就能模仿出那个人的声音,甚至还能模仿那种声音里的情绪(比如开心、悲伤、愤怒)。
但是,这里有个大麻烦:
- 随机选参考(Random): 就像导演随便从仓库里抓一个演员来演,可能他今天状态不好,或者他拿到的“参考录音”本身就很平淡,导致 AI 演出来的戏毫无感情,或者声音不像本人。
- 只看文字(Text-based): 就像导演只看剧本上的字,觉得“这段是哭戏”,就随便找个哭过的录音给 AI 参考。但有时候,文字里的“哭”和录音里的“哭”其实不搭调,AI 就会演得很尴尬。
结果就是: AI 要么声音不像,要么情感很假,要么情绪不够强烈。
2. 解决方案:ExpPro —— 一个聪明的“选角导演”
这篇论文提出的 ExpPro,就像是一个超级挑剔且聪明的选角导演。它不随便抓人,而是分两步走,精心挑选最合适的“参考录音”给 AI 用。
第一步:静态筛选(面试环节)—— 挑出“好苗子”
在正式开拍前,导演先对所有候选录音进行严格面试,看它们是不是“好演员”。这里主要看三个指标:
- 声音的“起伏感”(音高): 就像看演员说话时语调是否丰富。生气时声音通常又高又抖,悲伤时声音低沉平稳。导演会先筛选出那些语调特征最符合当前情绪(比如“愤怒”)的录音。
- 听感质量(DNSMOS): 就像检查录音设备是否清晰,演员发音是否自然,有没有杂音。
- 文字与情绪的匹配度(LLM 评估): 导演会问一个超级 AI(大语言模型):“这段录音里的文字,和它想表达的情绪(比如‘开心’)搭不搭?”如果录音里文字是“我很难过”,但情绪标签是“开心”,那直接淘汰。
经过这一轮,导演会淘汰掉那些“状态不好”或“不搭调”的录音,只留下最优质的几个。
第二步:动态筛选(现场对戏环节)—— 挑出“最合拍”的
静态筛选后,手里还剩下一批好苗子。现在,导演要面对具体的新剧本(用户想让 AI 说的新句子)。
- 这时候,导演会拿着新剧本,去和剩下的几个“好苗子”比对。
- 他会问:“哪一段参考录音,在语义上和现在的剧本最像?”
- 比如,如果新剧本是“太棒了,我们赢了!”,导演就会选那个参考录音里也是表达“极度兴奋”且语境最接近的那一段,而不是选一段虽然也是“开心”但语境是“收到礼物”的录音。
最终,AI 拿到这个“最合拍”的参考录音,就能完美地模仿出既像本人、又充满强烈情感的语音了。
3. 实验效果:真的有用吗?
研究人员在两个很火的 AI 语音模型(CosyVoice 和 GPT-SoVITS)上做了测试。
- 对比结果: 以前随便选参考(Random)或者只看文字(Text-based)的方法,AI 说话要么没感情,要么声音不像。
- ExpPro 的表现: 用了这个方法后,AI 说话的情感强度(比如愤怒时真的像愤怒)和声音相似度(真的像本人)都显著提升。
- 有趣发现: 即使是同一段参考录音,给不同的 AI 模型用,效果也不一样。ExpPro 的聪明之处在于,它不仅看录音本身好不好,还看这个录音在这个特定的 AI 模型里表现好不好。
总结
简单来说,ExpPro 就是给 AI 语音合成装了一个“智能选角系统”。
它不再盲目地让 AI 模仿,而是先像质检员一样把录音挑一遍(确保声音好、情绪对),再像导演一样根据具体的台词选最合适的参考(确保语境对)。这样,AI 说出来的话,不仅像那个人,而且演得真,情感饱满,不再像机器人一样冷冰冰。
这项技术不需要重新训练 AI 模型,只是优化了“选参考”这一步,就能让现有的 AI 说话水平更上一层楼。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。