Traceback Translators Against Forgetting in Continual Fake Speech Detection
本文提出了一种用于伪造语音检测的抗遗忘持续学习框架,该框架利用回溯翻译网络将新特征空间重新映射到冻结检测器中的原始空间,从而在实现新数据高检测率的同时,保持对先前见过的样本的准确性并最小化计算成本。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
技术摘要:针对遗忘问题的回溯转换器在持续性伪造语音检测中的应用
问题陈述
生成式合成语音模型的快速发展,使得深度伪造检测器的持续更新变得至关重要。然而,标准的持续学习策略面临着一个关键挑战:灾难性遗忘(catastrophic forgetting)。当模型在不接触原始训练数据的情况下,针对新数据集(例如新的深度伪造生成器或语言)进行微调时,它们往往会失去检测先前已见攻击类型的能力。现有的解决方案,如全量重训练或简单的领域自适应(例如微调批归一化层),难以在对新数据保持高性能与保留对旧数据准确性之间取得平衡。此外,许多方法需要重训练模型的大部分参数,导致了极高的计算成本。
方法论
作者提出了一种利用回溯转换器(Traceback Translator)在冻结的检测器架构内实现的抗遗忘持续学习框架。该核心方法包含以下组成部分:
1. 主干网络与预处理
- 架构: 采用定制的 ResNet18 作为主干检测器。其第一层卷积层被冻结,分类头由带有批归一化(BN)和 Dropout 的两个全连接层组成。
- 输入: 模型处理梅尔频率倒谱系数(MFCC)谱图(128 个频率系数,42 个时间帧),重点关注信号从静音到发声区间过渡的关键瞬时时刻。
- 损失函数: 分类器使用带有标签平滑的加权交叉熵损失,以减少过度自信。此外,还引入了一个额外的惩罚项,专门用于缓解将真实样本误判为合成样本(特别是第 6 类)的情况,这是在初步实验中观察到的倾向。
2. 持续学习策略
本文评估了三种不同的适应新数据集的方法:
- 全量重训练(Full Retraining): 在新数据上对整个网络进行重训练。虽然对新任务有效,但会导致源域性能严重下降。
- 领域自适应(Domain Adaptation): 仅选择性地重训练批归一化(BN)层,同时保持模型的其余部分冻结。这降低了计算负载,但仍会导致对源域知识的显著遗忘。
- 领域转换(Domain Translation,本文提出): 该方法引入了一个轻量级的转换器网络,该网络被插入在嵌入层(128 维潜空间)之后、分类器之前。
- 机制: 转换器通过重新映射特征分布,使目标域与原始(源)域对齐。
- 训练目标: 转换器使用复合损失函数进行训练:
- 分类器损失(Classifier Loss): 标准分类损失。
- CORAL 损失: 最小化源特征分布与目标特征分布之间的均值和协方差差异。
- 原型一致性(PC)损失: 最小化源类原型与目标类原型(即真实特征与伪造特征的均值)之间的类内距离。
- 约束: 在此过程中,主干 ResNet18 保持冻结状态,以确保先前学习到的表示不会被改变。
3. 数据增强
为了解决某些深度伪造类别的类别不平衡和样本量有限的问题,作者采用了基于扩散的生成过程(使用 2D U-Net)来生成合成谱图样本,并结合了经典的图像增强技术。
核心贡献
- 新颖的持续学习方法: 提出了一种在冻结分类器内使用轻量级领域转换器的方法,旨在适应新的深度伪造生成器和采样设置,而无需重训练主干网络。
- 效率与准确性的权衡: 通过对比分析证明,基于转换器的方法在最大限度减少重训练参数量的同时,实现了对新旧数据集准确性的最大化,优于传统的微调和部分重训练方法。
- 跨语言验证: 在多语言设置(英语和中文)下验证了该方法的有效性,展示了其跨语言适应的能力。
- 生成式增强: 集成了扩散模型,以提高模型在存在类别不平衡情况下的泛化能力和性能。
实验结果
研究使用了多个基准数据集:ASVspoof 2019(英语,源域)、FakeOrReal (FoR)、In-The-Wild (ITW) 以及 ADD 2022(中文)。
- 主干网络选择: 选择了定制的 ResNet18 作为最优主干,与 AST 或 ConvNeXT 等大型模型相比,它在准确率(0.994 Dev. 准确率)和计算效率之间提供了最佳平衡。
- 性能对比:
- 全量重训练: 在新数据集上表现出色(例如 ITW 的 EER 为 0.28%),但导致源数据集(ASV19)发生灾难性遗忘,平均 AUC 下降了 52%,EER 上升了 52.9%。
- 领域自适应(BN 层): 比全量重训练更具鲁棒性,但仍面临源域准确率大幅下降的问题(AUC 下降 38%)。
- 领域转换: 实现了卓越的权衡。它在保持源域准确率(95.4% AUC, 9.74% EER)的同时,在新领域也取得了强劲表现(例如 ADD22 的 AUC 为 98.1%)。
- 参数效率: 所提方法仅需训练 21K 个参数,与 11M 参数的全量模型或其它持续学习基准(如 [11] 中的 CL ALL,需 500K+ 参数)相比,比例极小。
- 消融实验:
- 基于扩散的数据增强将 AUC 从 91.5% 提升至 95.0%。
- 结合使用 CORAL 和原型一致性损失的效果明显优于单独使用其中之一。
重要性与主张
本文主张,所提出的**回溯转换器(Traceback Translator)**策略有效地缓解了深度伪造检测中的灾难性遗忘问题。通过将适应过程与特征提取主干解耦,该方法允许检测器在不牺牲检测历史攻击能力的前提下,随新的生成威胁而进化。作者强调,在无法获取原始训练数据且计算资源受限的场景下,这种方法具有特别重要的意义。实验结果表明,这种轻量级的、冻结主干的架构是全量重训练或复杂持续学习框架的一种可行且高效的替代方案,为动态变化的合成语音检测领域提供了鲁棒的解决方案。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。