← 最新论文
⚡ electrical engineering

Rehearsal with Auxiliary-Informed Sampling for Audio Deepfake Detection

本文提出了一种带有辅助信息采样回放的持续学习方法(RAIS),该方法利用标签生成网络来引导多样化的样本选择,从而在缓解偏差和遗忘的同时,在不断演变的攻击场景中实现卓越的性能。

原作者: Falih Gozi Febrinanto, Kristen Moore, Chandra Thapa, Jiangang Ma, Vidya Saikrishna, Feng Xia

发布于 2026-01-22
📖 1 分钟阅读☕ 轻松阅读

原作者: Falih Gozi Febrinanto, Kristen Moore, Chandra Thapa, Jiangang Ma, Vidya Saikrishna, Feng Xia

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你是一名在夜店工作的保安,正试图识破假证件。起初,你只见过来自特定国家的假证件(经历 1)。你变得非常擅长识别那些假证件。但随后,犯罪分子开始使用来自不同国家的假证件,接着是一个又一个(经历 2、3、4 和 5)。

如果你只是不断学习新的假证件,你可能会忘记如何识别旧的那些。这被称为**“灾难性遗忘” (catastrophic forgetting)**。如果你每次出现新的假证件时都要从头开始重新学习,这既耗时又昂贵。

这篇论文介绍了一个名为 RAIS(带有辅助信息采样的回放,Rehearsal with Auxiliary-Informed Sampling)的智能系统,旨在帮助这位保安(AI 模型)在学习新招式的同时,不会忘记旧的招式。

以下是该系统的运作方式,通过简单的概念进行拆解:

1. 问题所在:“单调”的记忆

大多数现有系统试图通过保留一个小的“记忆缓冲器”(一个小笔记本)来记住过去。它们选择保留哪些旧样本使用的是一个简单的规则:“保留真假混合”。

该论文认为,这就像是试图通过只看书的封面颜色(红色代表假,蓝色代表真)来记住整个图书馆的书籍。你最终可能会得到一个装满了“红色”书籍的笔记本,而这些书看起来都一模一样,忽略了它们之间的细微差别。当一种新的假证件出现,且看起来有点像那些特定的“红色”书籍时,你的系统会感到困惑,因为你从未学习过“假”这一类别内部的多样性。

2. 解决方案:“秘密翻译官” (AAGM)

为了解决这个问题,作者创建了一个特殊的辅助模块,称为音频辅助标签生成模块 (AAGM)

你可以把主 AI 想象成一名只关心大问题——“这个人是真的还是假的?”——的保安。
而 AAGM 就像是站在保安身边的秘密翻译官。它不仅仅关注“真与假”,它还会倾听声音并创造出自己的秘密类别,比如“声音听起来像机器人”、“声音听起来像耳语”或“声音听起来像歌手”。

  • 它是如何学习的: 它不需要人类来教它这些类别。它通过玩一个“填空游戏”(遮盖音频的部分内容并猜测它们是什么)来自己摸索出这些类别。
  • 安全规则: 至关重要的是,这个翻译官的工作方式不会干扰保安。它在学习自己的秘密类别时,不会破坏保安识别真伪的主要任务。

3. 策略:“智能选择” (AIS)

既然系统有了这些秘密类别,它就会使用一种新的策略——辅助信息采样 (AIS) 来填充它的记忆笔记本。

系统不再只是随机抓取“假”的样本,而是观察这些秘密类别。它会询问:

  • “我的笔记本里有‘机器人声音’的假证件吗?”
  • “我有‘耳语式假证件’吗?”
  • “我有‘歌唱式假证件’吗?”

如果笔记本里缺少一个“机器人声音”的假证件,系统就会优先保存一个。这确保了记忆缓冲器是多样化的。这就像是确保你的应急包里有手电筒、创可贴和绳子,而不是只有 10 个手电筒。

4. 结果:“全明星团队”

作者使用五轮不同的新音频伪造攻击(来自不同语言和来源)测试了这个系统,并将其与其他方法进行了对比。

  • 旧方法: 其他方法要么忘记了旧的假证件,要么被新的假证件搞混了。
  • RAIS 的方式: 通过保持对过去多样且全面的记忆,RAIS 保持了敏锐。它实现了 1.953% 的平均错误率,这非常低,几乎接近于如果系统是在所有数据上同时进行训练时的水平(这在现实生活中通常是不可能的)。

总结

简而言之,这篇论文的核心观点是:不要仅仅记住过去;要记住过去的“多样性”。

通过让 AI 发明自己的音频特征详细标签(就像一个秘密翻译官),并利用这些标签来挑选最有意义的样本进行记忆,该系统在识别不断演变的深度伪造(deepfakes)方面表现得更加出色,同时也不会忘记已经学到的知识。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →