An Artificial Glottal Spectrum-Based Excitation Model with LP-Based Spectral Modelling for Prosody Modification
本文提出了一种新颖的韵律修改方法,该方法利用人工声门频谱激励模型取代传统的时域基频标记,以消除基频标记的歧义与伪影,从而实现适用于文本转语音和语音转换应用的高质量、自然且高效的音高与时长操控。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
人类语言是一种复杂的物理事件,是承载着意义、情感与身份的、转瞬即逝的气流振动。从本质上讲,我们发出的声音依赖于两个协同工作的不同部分。第一部分是声源:即空气流经喉部声带时产生的原始、有节奏的脉冲。第二部分是系统:嘴部、舌头和喉咙的形状,它像一个滤波器一样,将那股原始的脉冲“染色”成特定的元音和辅音。当我们说话时,这两个元素是密不可分的,以至于改变其中一个往往会影响到另一个。这给试图制造能够自然说话或改变录音音色的机器的工程师们带来了巨大的挑战。如果计算机试图通过简单地拉伸或挤压录音来改变语速或音高,结果往往听起来带有机器人感或失真,失去了人类说话者的自然质感。
长期以来,研究人员一直试图解开这两个组成部分,以便能够独立地操纵它们。几十年来最常用的方法是将语音信号根据声带振动的时机切割成微小的碎片,然后重新排列这些碎片以改变速度或音高。虽然这种方法对于细微的调整非常有效,但在面对剧烈变化时却显得力不从心。它过度依赖于寻找声带闭合的精确时刻,而这很难做到完美。当计算机对这些时刻的判断出错时,重建的声音就会产生奇怪的伪影,听起来带有金属感或故障感,尤其是在音高显著升高或降低过多时。
在最近的一项研究中,来自印度的研究团队提出了一种处理该问题的不同方法。他们不再试图挽救并重新排列原始声波,而是决定彻底替换掉声源。他们的方法涉及从语音录音中剥离出原始的声带振动,并用计算机生成的完美、纯净的人造版本进行替换。他们保留了原始的“滤波器”——即说话者独特的口腔和喉咙形状——以确保声音听起来仍然是同一个人。通过根据所需的音高生成一个新的理想化脉冲,并将其与原始滤波器相结合,他们可以在不产生旧方法所带来的失真的情况下重塑声音。
研究人员使用泰米尔语说话者的录音,将这种新方法与传统方法进行了对比测试。他们要求人类听众在1到5分的量表上对修改后的语音质量进行评分。结果显示,他们的新方法始终能产生更高质量的声音,尤其是在音高发生大幅度变化时。当传统方法在音高改变超过一定限度后开始变得不自然且退化时,新方法仍能保持清晰度和自然度。团队发现,这种技术对于男性和女性声音都非常有效,即使在音高显著上升或下降时也能保留说话者的身份特征。
除了简单的音高变化外,研究还探讨了该方法在处理富有表现力的语音(即通过语调的升降来传达情感或强调)方面的表现。研究人员创建了特定的音高运动模式,例如用于疑问句的上升语调或用于陈述句的下降语调,并将这些模式应用于语音中。新方法比传统方法更平滑地处理了这些动态变化,而传统方法在音高轮廓快速变化时经常会引入明显的故障音。他们生成的人造声源足够灵活,能够跟随这些复杂的曲线,而不会破坏声音的流畅性。
从这些分离的部分重建声音的过程需要一个特定的步骤,以确保声音不仅仅是频率的集合,而是一个连贯的波形。由于研究人员处理的是声波的幅度而非其相位时间,因此他们使用了一种迭代数学过程来估算缺失的时间信息。这一被称为“相位重建”的步骤,使得他们能够合成出对人类耳朵来说听起来自然的最终波形。虽然研究人员指出这一重建步骤并不完美,仍留有改进空间,但整体语音质量优于现有技术。
研究结论指出,通过放弃对原始声带振动的完美追踪,转而生成一个纯净的人造声源,可以实现更稳健且富有表现力的语音修改。这种方法消除了与检测声带闭合精确时刻相关的歧义和误差,而这曾是该领域的一个瓶颈。研究结果表明,对于追求自然度和灵活性至关重要的应用场景,如文本转语音系统或语音转换,使用受控的人造模型来替换声源,比尝试拉伸原始信号提供了一条更可靠的路径。这项工作证明,有时为了让声音听起来更像人类,必须愿意用精确的数学理想来取代人类元素。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。