← 最新论文
💻 computer science

Context-Adaptive Emotional Speech Synthesis via Feature Control in Multi-Turn Dialogue (ChinaMM 2026)

本文提出了一种用于多轮情感语音合成的上下文自适应框架,该框架利用历史对话记忆以及语音信号与文本的双模态联合输入来动态预测并控制声学特征,从而克服传统基于转录的方法的局限性,以实现自然且情感连贯的响应。

原作者: Qinglan Wei, Ruiqi Xue, Long Ye, Yuan Zhang

发布于 2026-09-14
📖 1 分钟阅读☕ 轻松阅读

原作者: Qinglan Wei, Ruiqi Xue, Long Ye, Yuan Zhang

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下这样一场对话:电话另一端的声线听起来完美得如同真人,不仅在于其言语的内容,更在于它如何呼吸、停顿,以及如何根据当下的情绪调整语调。几十年来,将文本转化为语音的技术一直难以捕捉这种细微的差别。虽然机器现在可以清晰地朗读出一个句子,但它们往往会忽略真实对话中流淌的微妙情感脉络。它们无法听出平铺直叙的陈述与耳语秘密之间的区别,也无法理解前一句中的笑声应当如何影响下一句的语调。这种差距之所以存在,是因为大多数系统都依赖于一个“中间人”:它们首先将人的语音转换为书面文本以理解语境,然后再利用这些文本生成新的声音。在这个过程中,原始声音中那些丰富且无形的细节——音高的起伏、急促的吸气、特定的节奏——都被剥离了,导致计算机得到的只是对话的枯燥骨架。

中国传媒大学的研究团队开发了一种新方法来弥补这一差距,使机器能够倾听对话的实际声音,而非仅仅是其书面转录文本。他们的研究成果将在 ChinaMM 2026 会议上展示,该系统引入了一种能够观察多轮对话并生成在情感上具有连续性和自然连贯性的响应的方法。该方法并非将聊天历史转化为文字,而是将前一轮的原始音频与待朗读的新文本一起直接输入系统。这使得计算机能够感知嵌入在声波中的情感状态和副语言线索——例如笑声、叹息或压力感。通过这种方式,系统可以精确预测下一句话应该如何发声,确保过去的悲伤语调能引发同情的响应,或者将爆发的兴奋转化为匹配的能量。

研究人员基于一个旨在模仿人类处理对话方式的两部分引擎构建了他们的解决方案。第一部分充当一个高度专注的倾听者,旨在理解前一句的声音与下一句文本之间的关系。为了训练这个系统,团队采用了一种巧妙的“两阶段”学习策略。首先,他们教导模型识别短小、孤立的语音片段中的特定特征,例如识别长于零点几秒的停顿,或捕捉指示愤怒的突然音高变化。他们使用了一组精心标注的样本来建立知识基础。随后,他们将这种训练扩展到对话对中:即刚刚说过的话的声音与即将说的话的文本。这使得模型不仅能学习某种特征听起来是什么样的,还能学习这种特征如何在对话中演变。模型学会了根据刚刚听到的历史记录,来预测即将到来的响应的情感基调和特定的声学细节。

然而,预测这些特征仅是成功的一半;系统还必须将这些预测转化为语音合成器可以遵循的指令。该框架的第二部分充当一个精确的翻译器。第一部分生成一段关于目标声音的自然语言描述,但如果将原始描述直接输入语音生成器,可能会引起混乱,导致机器将指令本身朗读出来,而不是执行指令。为了防止这种情况,研究人员创建了一套严格的模板,将预测的特征转换为标准化格式。例如,如果系统预测会出现笑声,翻译器会确保其被格式化为在特定点插入笑声的特定命令,而非模糊的描述。这一步确保了像词间的呼吸或特定音节上的重音这类细微之处,都能被精准执行。

在与现有方法进行对比测试时,这一新框架展现出了在对话中保持情感一致性的明确能力。在利用两个不同的人类对话数据集进行的实验中,该系统生成的语音被听众评价为比以往技术显著更自然、情感更准确。研究人员通过让听众评价声音质量,并使用软件比较生成语音的情感类别与原始录音是否一致来衡量结果。结果显示,该方法在匹配预期情感方面的准确度更高,在一个数据集中达到 54.7%,在另一个数据集中达到 47.4%,超越了其他领先系统。此外,合成语音的音质失真更少,这意味着它比基准模型的输出更接近真实的真人声音。

这种成功的视觉证据体现在系统处理对话流的方式上。在一次测试案例中,当说话者说“这是您的账单”时,系统正确预测了句子末尾音高的下降,镜像了陈述自然的结束过程,而旧模型则会产生平淡、不变的语调。在另一个实例中,当语境暗示这是一个愉悦时刻时,系统成功地在句子末尾生成了一个笑声,而之前的模型由于缺乏上下文知识而无法生成这一特征。同样,系统学会了在合适的时刻插入自然的停顿和呼吸,创造出一种真实的、而非机器人式朗诵的节奏。这些能力的实现并未过度拖慢处理速度;从倾听前一轮到生成新声音,整个系统运行时间不足一秒,足以满足实时对话的需求。

研究还强调了该团队特定设计选择的重要性。当研究人员在没有翻译步骤的情况下测试系统时,语音质量显著下降,这证实了来自倾听模型的原始预测过于杂乱,无法直接使用。这证明了特征的结构化映射对于系统运作至关重要。研究人员指出,虽然该系统在单对单对话中表现出色,但目前是为相对安静的环境设计的。他们计划探索如何将这项技术扩展到更复杂的场景,如多人对话或嘈杂环境,并进一步优化学习过程以减少误差。目前,这项工作是让机器能够真正倾听并以人类伴侣般的情感深度做出响应的重要一步,它证明了自然声音的关键不仅在于言语,更在于言语间沉默的韵律。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →