← 最新论文
💻 computer science

EffiFusion-GAN: Efficient Fusion Generative Adversarial Network for Speech Enhancement

EffiFusion-GAN 是一种轻量级时频生成对抗网络,它利用深度可分离卷积、残差 Conformer 模块和非结构化剪枝,以显著少于现有模型的参数量,实现了接近最先进水平的语音增强质量。

原作者: BIN WEN, Tien-Ping Tan

发布于 2026-08-19
📖 1 分钟阅读☕ 轻松阅读

原作者: BIN WEN, Tien-Ping Tan

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

清晰的语音是人类的基本需求,然而世界很少是安静的。来自交通、人群或风声的背景噪声经常会淹没我们试图听到的声音。几十年来,工程师们一直致力于开发能够消除这种干扰的计算机程序,这一领域被称为语音增强。早期的程序版本足以让单词变得可理解,但由于它们难以重建被称为“相位”的声波微妙时序与节奏,听起来往往带有机器人感或金属感。现代方法通过教计算机同时预测声音的响度和时序解决了这个问题。然而,这种进步是有代价的:执行此任务所需的计算机模型正变得如此庞大且复杂,以至于难以在智能手机或助听器等日常设备上运行,因为这些设备的内存和处理能力有限。当今研究人员面临的核心挑战不仅是如何让语音听起来更好,而且是如何在不需要超级计算机协助的情况下,让声音听起来很棒。

在最近的一项研究中,来自马来西亚理科大学的研究员 Bin Wen 和 Tien-Ping Tan 针对这一问题设计了一种名为 EffiFusion-GAN 的新型、更精简的计算机模型。他们的目标是创建一个既能像目前最强大、最庞大的模型一样清理噪声语音,又能在资源消耗上显著降低的系统。为了实现这一目标,他们构建了一个系统,通过两种不同的方式同时观察声音:声波的强度及其时序,从而学习如何将人声从噪声中分离出来。他们结合了几种聪明的设计选择来保持模型的轻量化。首先,他们使用了一种专门的处理层,这种层处理信息比标准层更高效,就像一名工人使用专门的工具比使用通用铁锤干活更快一样。其次,他们添加了一种机制,允许模型在处理当前时刻时,记住来自声音流早前阶段的重要细节,从而确保语音的连贯性。最后,他们在模型开始学习之前,应用了一种技术去除了模型内部约百分之三十的不必要连接,有效地剔除了系统的脂肪,只留下核心肌肉。

研究人员使用一组混合了各种背景声音的标准噪声语音录音对他们的新模型进行了测试。结果显示,EffiFusion-GAN 的表现非常出色。它在语音质量得分方面仅略低于目前现存的最强模型,但其运行所需的调节参数数量却几乎减少了一半。具体而言,虽然领先的竞争对手模型需要超过两百万个参数才能达到巅峰性能,但这个新模型仅用一百万个左右的参数就达到了相似的清晰度。当研究人员测试如果将他们的精简设计方案换回旧有的、臃肿的方法会发生什么时,他们发现模型体积变大了一倍,而音质提升却微乎其微。相反,当他们移除记忆机制时,音质显著下降。这些测试证实,他们的特定设计选择是平衡规模与性能的关键。

该研究还观察了模型在学习过程中的行为。研究人员观察到,该系统能够快速稳定,不会出现剧烈波动,这表明其设计是稳健且可靠的。他们指出,尽管模型更小且更高效,但最终的考验将是它在实际硬件和现实环境下的表现,这仍需进一步调查。目前来看,这项工作证明了构建既高质量又紧凑的语音增强工具是可行的。通过证明较小的模型可以与庞大的模型相媲美,研究人员为将先进的语音清理技术放入人们每天随身携带的设备中开辟了一条道路,使在最嘈杂的环境中实现清晰沟通成为可能。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →