← 最新论文
💻 computer science

PS4: Proxy-Supervised Joint Training for Real Target Speaker Extraction

本文介绍了 PS4,这是一个代理监督联合训练框架,它利用大规模双语语料库和多目标微调策略,在不需要干净目标语音监督的情况下,实现了真实目标说话人提取领域的先进性能。

原作者: Wanyi Ning, Wei Zhou, Yingpeng Li, Yinshang Guo, Haitao Qian, Yiming Cheng

发布于 2026-07-10
📖 1 分钟阅读☕ 轻松阅读

原作者: Wanyi Ning, Wei Zhou, Yingpeng Li, Yinshang Guo, Haitao Qian, Yiming Cheng

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正身处一场混乱的晚宴,每个人都在大声说话,互相盖过对方的声音。你想听清一位特定朋友的故事,但你使用的录音设备只捕捉到了整个房间嘈杂、重叠的噪音。通常情况下,要教会计算机识别出那一个人的声音,你需要一段该朋友单独说话的“干净”录音来作为老师。但在现实生活中,你很难拥有那段干净的录音,你手里只有这一团乱麻。

这正是这篇论文的作者们所解决的问题。他们问道:在没有干净版本作为目标说话人声音参考的情况下,我们如何训练计算机从一段真实的、混乱的对话中分离出单个说话者?

“虚假”练习的问题

大多数执行这项任务的计算机程序都是在实验室里训练的。研究人员将人们单独说话的干净录音进行人工混合,从而制造出“虚假”的噪声。这就像是通过在一个空旷、完美的球场上踢球来练习足球比赛。论文指出,这种方法在当你踏入真正的赛场时会失效,因为那里充满了风、不平整的草坪和难以预测的球员。真实的对话包含背景噪音、回声以及人们在奇怪的时间点说话,这使得“虚假”的训练变得毫无用处。

PS4 的解决方案:从线索中学习

由来自亿嘉合人工智能(Yijiahe AI)及中国多所大学的研究人员领导的团队,构建了一个名为 PS4 的新系统。PS4 并不需要目标说话人的干净录音(因为他们并没有),而是教会计算机从混乱录音中隐藏的线索中学习。他们称之为“代理监督”(proxy supervision)。

想象一下,你要在一张模糊拥挤的照片中寻找一个特定的人,而你并没有一张清晰的照片。你看不清他们的脸,但你可以通过其他线索来判断:

  1. 他们说了什么: 你拥有他们话语的文本转录。
  2. 他们是谁: 你拥有他们在对话早期的一段简短、清晰的声音片段(即“注册/采集”音频)。
  3. 他们在何时说话: 你拥有关于谁在什么时候说话的大致图谱。
  4. 声音听起来如何: 你对音频质量应该达到什么样的水平有一个概念。

构建训练场

为了训练他们的系统,团队并没有靠直觉,而是建立了一个庞大的训练健身房——REAL-PS4。他们从四个不同的公开数据集中提取了 71,771 个真实的对话样本(涵盖了中文和英文的会议及晚宴场景)。

他们并没有直接将这些数据丢进搅拌机,而是进行了精细的处理:

  • 他们找到了单人说话的短促、清晰的片段,用作“注册”参考。
  • 他们找到了两人或多人同时说话的嘈杂部分,用作需要解决的“混合”部分。
  • 他们过滤掉了糟糕的样本,仅保留那些目标说话人说话时间超过 20% 且转录文本中至少包含 2 个有效字符的样本。
  • 他们确保嘈杂片段不会过长(上限为 30 秒),以便计算机能够处理。

四部分训练策略

他们方法的核心是一种“联合训练”策略。他们不仅仅是告诉计算机“提取这个声音”,而是给了它四个同时达成的目标,就像四位不同的教练:

  1. 语言教练 (ASR): 计算机必须确保提取出的声音与书面转录内容相匹配。他们使用了一个强大的语言模型(Whisper)来检查单词是否合理。
  2. 身份教练 (Speaker Similarity): 计算机必须确保提取出的声音听起来像是在“注册”片段中的特定人物,而不是房间里的其他人。他们使用了一种“排序”规则:提取出的声音必须比原始的嘈杂混合音更像目标人物。
  3. 时序教练 (VAD): 计算机必须掌握准确的时机。如果目标说话人处于沉默状态,计算机就不应该输出噪音。他们使用帧级标签来检查这一点。
  4. 质量教练 (Perceptual): 计算机必须确保结果听起来自然且清晰,而不是机械或失真的。他们使用了一个名为 DNSMOS 的指标来评判“感知质量”。

结果:它奏效了吗?

团队在 REAL-T 挑战赛上测试了他们的系统,这是测试真实对话数据的金标准。

  • 在开发集(Development Set)上: 他们在来自五个不同数据集(AISHELL-4, AliMeeting, AMI, CHiME-6, 和 DipCo)的 1,991 个样本上进行了测试。

    • 他们的系统在每一个指标上都击败了之前的最佳“官方”基准模型(那些基于虚假数据训练的模型)。
    • 例如,在 AMI 数据集上,他们实现了 0.388 的词错误率(TER)和 0.714 的说话人相似度(SIM)。
    • 在最难的 AISHELL-4 数据集上,他们的 SIM 仍达到了 0.575,而旧的基准模型得分却在 0.45 以下挣扎。
    • 最令人印象深刻的是,他们的音频质量(DNSMOS OVRL)始终保持在 3.1 以上,而旧系统得分通常低于 2.0
  • 在官方排行榜上: 当他们参加最终竞赛时,PS4 排名总分第二

    • 它取得了所有提交系统中最高的说话人相似度(Speaker Similarity)得分(0.565)。
    • 它取得了所有提交系统中最高的时序 F1 分数(0.871)。
    • 虽然在音频质量(DNSMOS-P808)或最低错误率(TER)方面没有拿到绝对的第一(被 MERL 的系统超越),但它在保持说话人身份和把握时序方面,明显优于其他所有人。

核心结论

论文得出结论:训练用于现实生活的说话人提取系统,并不一定需要干净、隔离的录音。通过使用“代理”线索——如转录文本、声音身份、时序和质量评分——你可以直接在混乱的真实数据上训练系统。作者提出,这种方法是传统做法的一种实用且有效的替代方案,证明了即使你手头只有人群的嘈杂声,也能教会计算机从人群中分辨出一个人的声音。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →