Multi Codec Discrete Diffusion Model for Text Guided Speech Inpainting and Editing
该论文介绍了 SIEDD,一种利用分层标记生成和文本引导调节的多编解码离散扩散模型,旨在实现语音修复与编辑方面的最先进性能,同时保留说话人身份与韵律。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在听一首最爱的歌,但突然间,旋律中缺失了几秒钟,或者有人在你耳边低语了一个你不愿听到的词。在音频科学的世界里,在不破坏音轨其余部分的情况下修复这些漏洞,就像是在尝试修复一件撕裂的织锦。你不能只是把一块新的布料粘上去;新的丝线必须与周围织物的颜色、纹理和张力完美匹配。几十年来,计算机一直难以应对这个问题。它们可以修复微小的划痕,但如果是一个完整的句子缺失了,它们听起来往往会显得机械化,或者与说话者的声音不同步。
最近,科学家们开始使用一种被称为“扩散”(diffusion)的聪明技巧来解决这个问题。把扩散想象成一场倒过来的“传声筒”游戏。想象一张清晰的照片被逐渐覆盖上一层静电噪声,直到它变成一片模糊的灰色。一个扩散模型是一个聪明的 AI,它学习如何将那团模糊的灰色混乱逐渐剥离噪声,一步步地剥离,直到原始图像重新显现。虽然这在图像处理上效果很好,但在语音处理上却很棘手,因为语音不仅仅是一条平滑的线;它是分层的,就像蛋糕一样,一层又一层不同的口味堆叠在一起。这篇论文深入探讨了如何利用这种“反向噪声”游戏来修复语音,但带有一个特殊的转折——即尊重这些层次。
这项研究背后的研究人员 Iftach Shoham 及其团队推出了一套名为 SIEDD(通过离散扩散进行语音修复与编辑)的新系统。他们的主要目标是创造一个工具,既能填补录音中缺失的部分(修复),也能用新词替换旧词(编辑),同时保持说话者的声音、节奏和情感完全不变。他们发现,以往的方法试图像轨道上的火车一样一个词接一个词地构建语音,这往往会导致错误不断累积。如果 AI 把第一个词弄错了一点点,剩下的整个句子听起来都会不对劲。
相反,SIEDD 使用了一种“离散扩散”的方法。想象语音不是一列火车,而是一件正在被雕刻的雕塑。AI 从一个粗糙的石块(声音的基本形状)开始,然后慢慢凿去多余的部分,以展现出细腻的细节。论文中的重大发现是,你必须尊重这些层次的顺序。AI 首先确定“粗糙”的结构——声音的大致轮廓——并将其锁定为一个坚实的基石。只有在那之后,它才会进入下一层,添加“精细”的细节,比如声音的具体质感。通过将较低层视为一个干净、已确定的上下文,并且仅对当前层进行“去噪”,该模型避免了在粗略形状尚未定型之前就试图猜测精细细节所带来的混乱。
团队在名为 RealEdit 的基准测试上对该系统进行了测试,该测试涉及现实场景,如修复受损的录音或更改某人的话语。结果表明,SIEDD 能够很好地胜任工作。在语音编辑测试中,它取得了对比方法中的最佳整体表现,拥有最低的词错率(WER)和最高的原始说话者相似度。对于填补缺失部分,它优于其他流行的方法,尤其是在需要同时填补多个缺口时。作者认为,这种成功源于它对声音进行“显式建模”——承认某些音频编码对于宏观轮廓更为重要,而另一些则仅用于微小的细节。
他们系统中一个聪明的技巧是“局部引导”。想象你在编辑一个句子,你想把单词“cat”(猫)改为“dog”(狗)。AI 需要准确知道在哪里改变声音,以及在哪里保持原样。研究人员构建了一个机制,使其注意力仅集中在被修改的特定词段上,确保新词能完美融入旧词,而不会干扰周围的对话。他们还加入了一种预测新词长度的方法,以确保编辑后的语音不会听起来太仓促或太拖沓。
简而言之,这篇论文表明,通过将语音视为一个多层蛋糕,并逐层修复——从底层开始向上工作——计算机可以比以前更自然地修复和编辑音频。虽然该系统并不完美(当缺口变大时仍会遇到困难),但它代表了迈向重要的一步,让 AI 听起来不再像机器人,而更像是一个能够无缝修复破碎句子或更换单词而不被察觉的人类。作者总结道,这种“感知层次结构”的方法是比旧有的逐步法更有前景的替代方案,它提供了一种在改变词汇的同时,依然保留说话者灵魂声音的方式。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。