← 最新论文
🤖 AI

Finetuning Strategies for Querying Sounds by Vocal Imitation

本技术报告详细介绍了 AES AIMLA 2025 挑战赛的获胜方案,该方案通过研究两种互补的微调策略——使用冻结的 CED 编码器的对比学习,以及使用 MobileNetV3 编码器的联合对比三元组学习——成功实现了通过声音模仿来查询音效。

原作者: Aditya Bhattacharjee, Christos Plachouras, Sungkyun Chang, Emmanouil Benetos

发布于 2026-08-20
📖 1 分钟阅读☕ 轻松阅读

原作者: Aditya Bhattacharjee, Christos Plachouras, Sungkyun Chang, Emmanouil Benetos

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,试图在一座庞大的音频剪辑图书馆中寻找一种特定的声音,但你不能通过输入描述或哼唱旋律,而是必须用你自己的声音来模仿这种声音。这就是“通过声音模仿进行查询”(query by vocal imitation)的核心挑战——在这个领域,计算机必须学会理解:人类模仿狗吠声或吱吱作响的门声的尝试,与这些声音本身的实际录音是相同的。难点在于人类利用声带产生声音的方式与机器记录和分析这些声音的方式之间存在差距。人类是不一致的;一个人可能大声吠叫,而另一个人可能低声细语;同一个人每次吠叫的方式也可能不同。为了取得成功,计算机必须穿透这些变化,找到连接人类模仿行为与其所代表的真实声音之间的底层模式。

伦敦玛丽女王大学的一个研究小组通过参加一项旨在测试这项技能的竞赛,解决了这一问题。他们的目标是构建一个系统,该系统可以接收用户的声音模仿,并立即从数据库中检索出正确的音效。为此,他们探索了两种不同的教导计算机识别这些联系的方法。第一种方法依赖于一个已经学习过识别数千种声音的预训练“计算机大脑”,然后他们对其进行微调,使其专注于将模仿与真实声音进行匹配。第二种方法更为复杂,它不仅教导计算机匹配正确的配对,还让它通过将好的匹配与坏的匹配进行比较来从错误中学习,通过一种排除法和纠错的过程来精炼其判断力。

研究人员首先收集数据来训练他们的系统。他们使用了一组配对的录音,其中既有人类模仿特定声音的录音,也有原始声音。这些配对为计算机的学习提供了完美的范例。然而,他们还可以接触到第二组录音:这些是虽然没有匹配原始声音、但被标注了声音类型的“孤儿”模仿音频。团队意识到,他们可以将这些“孤ля”模仿作为教学工具。通过向计算机展示一段模仿,然后要求它在正确的音效与其他相似但不正确的选项之间做出区分,他们可以迫使系统变得更加精准。

为了使系统对人类声音的自然变化具有鲁棒性(稳健性),研究人员在训练期间对音频应用了一系列数字变换。他们会改变声音的时值、改变音量或稍微改变音高,以模拟现实中人们唱歌或说话时的差异。他们甚至加入了少量的静电噪声或删除了音频中的微小片段,以模拟真实录音中的缺陷。通过让计算机接触这些经过扭曲的同一声音版本,系统学会了专注于声音的核心特征,而不是被细微的细节所迷惑。

在第一次尝试中,团队使用了一个强大的、预先存在的音频模型,该模型是在大规模通用声音数据集上训练过的。他们保持了这个模型核心部分的“冻结”状态,这意味着他们没有改变其内部知识,而只是在其之上添加了一个轻量级的全新层,用于将其理解转化为适合匹配的格式。这种方法高效且有效,使得系统能够利用模型已有的庞大知识,而无需从头开始重新学习一切。该系统学会了将人类模仿和目标声音映射到一个共享空间中,在这个空间里,相似的声音会靠在一起。

他们的第二个、也是最终获胜的提交方案采取了不同的路径。他们没有冻结模型,而是微调了一个设计轻量且快速的灵活架构。他们结合了两种学习策略:一种奖励系统匹配正确的配对,另一种则惩罚它混淆相似但不正确的音效。这种被称为“三元组学习”(triplet learning)的第二种策略,是通过向计算机展示一个“锚点”声音、一个正确的匹配项以及一个“硬负样本”(即一个足够相似到容易引起混淆但实际上是错误的音效)来进行工作的。通过迫使系统去区分这些棘手的案例,研究人员帮助它培养了更敏锐的感知力,以辨别什么才是真正定义一种声音的特征。他们还引入了一种动态平衡机制,根据每个训练批次中可用困难样本的数量来调整惩罚错误的权重,从而确保系统在学习过程中保持稳定。

当研究人员使用官方竞赛基准测试他们的系统时,结果显而易见。两种方法都优于之前的最佳系统,但采用混合学习策略的第二种方法取得了最高分。该系统成功地比其他任何参赛方案都更频繁地将正确的声音排在列表首位,这证明了将预训练知识与结构化的困难案例学习方法相结合,可以创造出更可靠的工具。研究表明,虽然一个简单的冻结模型可以做得很好,但一个能够主动学习如何应对相似声音之间混乱情况的系统表现得更为出色。

这项工作强调了声音识别领域的一个关键洞察:计算机如何被教导处理错误,与它所学习的数据同样重要。通过仔细策划“不该选择什么”的范例,并教导系统如何适当地权衡这些困难案例,研究人员在人类声音的创造力与机器的精准度之间架起了一座桥梁。他们的成功表明,最有效的系统不仅是那些记忆声音的系统,更是那些学会理解使一种声音区别于另一种声音的微妙差异的系统,即使输入的信号像人类的声音一样多变且不可预测。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →