Deepfake Audio Detection Using Self-supervised Fusion Representations
本文提出了一种面向 ESDD2026 挑战赛的双分支深度伪造检测框架,该框架将 XLS-R 和 BEATs 预训练模型与匹配头及交叉注意力机制相融合,以联合分析语音与环境声,并在 CompSpoofV2 数据集上实现了卓越性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象你是一名侦探,试图判断一段录音是真实的还是高明的伪造品。过去,侦探可能只是聆听声音。但在现代,不良行为者可以分别伪造声音和背景噪音(如交通声或鸟鸣)。如果你只听声音,可能会忽略背景声听起来可疑地虚假这一事实。
本文描述了一支新的“侦探团队”,旨在通过同时检查声音和背景来捕捉这些高明的伪造品。
以下是该系统的运作方式,分解为简单概念:
1. 两位专业侦探(双分支)
作者没有聘请一位通才侦探,而是聘请了两位专家,他们阅读了数百万本书籍,但尚未被教授特定规则(这被称为“自监督学习”)。
- 侦探 XLS-R:这位专家是语音理解的大师。它了解人声的自然听感。
- 侦探 BEATs:这位专家是环境声音理解的大师。它了解真实的交通声、风声或房间回声听起来是怎样的。
它们同时聆听同一个音频文件。
2. “交叉质询”(交叉注意力)
通常,这两位专家会在不同的房间工作。但这个系统将它们放在同一个房间里互相交流。
- 它们使用一种“交叉注意力”机制,就像一个翻译,帮助它们分享各自的发现。
- 如果语音专家说“这个人听起来很真实”,但背景专家说“但这风声听起来像是计算机生成的”,系统就会标记出问题。
- 这种互动帮助系统发现不一致之处。真实的录音通常具有声音与背景之间的自然和谐。而伪造品往往存在不匹配,例如将录音室录制的人声叠加在伪造的街道噪音之上。
3. “差异检查器”(匹配头)
系统拥有一个名为匹配头的特殊工具。将其想象为一个天平,用于衡量两位专家笔记之间的差异。
- 它提取“语音笔记”和“背景笔记”,进行清理,并并排比较它们。
- 它计算统计差异(例如检查语音的“氛围”是否与房间的“氛围”相匹配)。
- 如果两者不匹配,系统就会发出信号,表明该音频可能是“欺骗”(伪造品)。
4. 最终裁决(三个输出)
该系统不仅仅说“伪造”或“真实”,而是提供三份具体的报告:
- 语音是伪造的吗?
- 背景是伪造的吗?
- 整个录音是原始的真实录音吗?
这很重要,因为录音可能是“真实语音 + 伪造背景”或“伪造语音 + 真实背景”。该系统能捕捉所有这些组合。
效果如何?
团队在名为CompSpoofV2的大型数据集上测试了他们的系统,该数据集包含超过 250,000 个专门设计用来欺骗检测器的音频片段。这些片段包含真实和伪造语音及背景的不同组合。
- 结果:他们的新系统显著优于之前的“基线”(标准)系统。
- 得分:它将准确率(F1 分数)提高了约7–8%。
- 背景专家:它在检测背景噪音中的伪造品方面表现尤为出色,与旧方法相比,大幅降低了环境声音的错误率。
秘诀:通过“混合搭配”进行训练
为了让侦探们保持敏锐,作者不仅向他们提供真实和伪造的文件。他们创建了一个训练游戏,在其中混合搭配音频片段:
- 他们将真实语音与伪造的背景噪音结合。
- 他们将伪造语音与真实背景噪音结合。
- 他们甚至添加了随机静电噪音(如糟糕的电话连接),以增加训练难度。
这迫使系统学会即使在音频混乱或以奇怪方式混合时也能识别伪造品,使其在现实世界应用中更加稳健。
总结
简而言之,这篇论文提出了一种更聪明的方法来检测音频深度伪造。它不再仅仅聆听语音,而是利用两位 AI 专家分别检查语音和背景,然后迫使它们交换意见。如果语音和背景“合不来”,系统就知道这是伪造品。这种方法比以前的方法捕捉到了更多的伪造品,并减少了错误,特别是在背景噪音被操纵的情况下。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。