← 最新论文
⚡ electrical engineering

TRACE-EVC: Text-Guided Relative Affective Control for Zero-Shot Emotional Voice Conversion

本文介绍了 TRACE-EVC,这是一个零样本情感语音转换框架,它利用自然语言指令通过以源音频为锚定的流匹配(rectified flow)来引导相对的情感转换,从而在保持说话人身份和语音质量的同时,实现灵活的情感调节。

原作者: Zihan Zhang, Shreeram Suresh Chandra, Zongyang Du, Xiutian Zhao, Aurosweta Mahapatra, Hao Zhang, Philipp Koehn, Berrak Sisman

发布于 2026-07-07
📖 1 分钟阅读☕ 轻松阅读

原作者: Zihan Zhang, Shreeram Suresh Chandra, Zongyang Du, Xiutian Zhao, Aurosweta Mahapatra, Hao Zhang, Philipp Koehn, Berrak Sisman

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你有一个朋友正在给你讲故事。现在,他正用一种中性、平静的声音在说话。

**传统的情感语音转换(Traditional Emotional Voice Conversion)*就像是给你的朋友一个特定的剧本,上面写着:“现在,像一个愤怒的人那样说话。”* 或者 “现在,像一个悲伤的人那样说话。” 在他们开始之前,你必须定义好确切的终点。

这篇论文(TRACE-EVC)介绍了一种与你的朋友交流的新方式。你不再是给出一个目的地,而是给出一个方向。你会说:“让你的声音听起来再开心一点点,” 或者 “说话更有自信一点,” 或者 “把兴奋感稍微调低一点点。”

该系统不需要知道“开心”或“自信”在真空状态下是什么样子的。它只需要知道如何根据你的自然语言指令,将你朋友现在的声音向新的情感移动

以下是他们是如何实现的,使用了简单的类比:

1. 问题所在:“目的地”陷阱

大多数语音系统的工作原理就像一个需要特定地址的 GPS(例如“去公园”)。如果你不知道地址,或者你只想“向北多开一段距离”,GPS 就会陷入混乱。

  • 问题: 现有的工具需要一个特定的目标情感(比如标签“愤怒”)或一个参考录音(一段别人愤怒的音频片段)才能工作。
  • 论文的解决方案: 他们意识到,在现实生活中,我们通常只是想把声音向某个方向推一下。“让它更温暖些”、“让它少一点惊讶”。他们想要一个能够理解这些“相对”指令的系统。

2. 数据集: “前后对比”教练 (TRACE-Instruct)

为了教会计算机这项新技能,研究人员不能仅仅使用现有的数据。他们需要一位能够解释声音是如何变化的,而不仅仅是变成了什么的老师。

  • 类比: 想象一位舞蹈教练,他有一段舞者从“慢速”变为“快速”的视频。教练不仅仅是将第二个片段标记为“快速”,而是写下一段笔记:“舞者的步伐加快了,手臂抬得更高了。”
  • 他们所做的: 他们获取了一对对情感演讲(源语音和目标语音)。他们使用了一个智能 AI(大语言模型)来观察这两者之间的差异,并写出一段描述这种变化的自然语言指令(例如:“将语调转向更开心、更温暖的表达方式”)。他们创建了一个庞大的“前后对比”指令库,称为 TRACE-Instruct

3. 引擎: “指南针” (TRACE-EVC & Emo-Compass)

这是核心技术。论文中将主模块称为 Emo-Compass

  • 旧的方法: 想象每次你想去某个地方时都要从头画一张地图。你从一张白纸(噪声)开始,试图根据文本提示猜出目的地。
  • TRACE-EVC 的方法: 想象你已经站在一个特定的位置(源语音)。你拥有一个指南针(指令)。系统并不猜测目的地;它计算的是你从当前位置出发需要进行的向量(方向和距离)。
  • 它是如何工作的:
    1. 它获取当前的语音(锚点)。
    2. 它读取你的指令(例如:“让它更冷静”)。
    3. 它计算出将声音从“当前状态”移动到“更冷静”所需的精确数学“推力”。
    4. 它应用这个推力来生成新的语音。
  • 优势: 因为它是从实际的语音出发,所以它能完美地保留说话者的身份(是谁在说话)和词句(在说什么),同时仅根据要求改变其情感感受

4. 结果:它奏效了吗?

研究人员通过两种方式测试了这个系统:

  • 改变情感: 将“悲伤”转变为“开心”(或“没那么悲伤了”)。
  • 改变强度: 让一个“开心”的声音变得“超级开心”或“略微开心”。

研究发现:

  • 遵循指令: 系统非常擅长听从自然语言。如果你要求“更有自信”,声音听起来就会更有自信。如果你要求“少一点兴奋”,它就会变得平静下来。
  • 保持身份: 声音听起来仍然像是原始说话者,而不是机器人或另一个人。
  • 质量: 语音清晰且自然,可以与那些需要特定目标标签的旧系统相媲美(有时甚至超越)。
  • 零样本(Zero-Shot): 这意味着它可以在从未听过的说话者身上奏效,而无需预先获取该特定说话者表演特定情感的样本。

总结

可以将 TRACE-EVC 想象成一个理解细微差别的语音编辑器。它不再强行将声音塞进贴有“愤怒”或“悲伤”标签的僵化框框里,而是倾听你如 “让这段听起来更有戏剧性一点” 这样的自然请求,并平滑地引导声音向那个方向移动,同时完美地保护说话者独特的个性以及故事的内容。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →