MADBench: A Benchmark for Modality-Aware Audio Deepfake Detection
本文介绍了 MADBench,这是首个通过区分语音和环境音频来评估深度伪造检测的基准测试,揭示了现有模型在两个组成部分上均表现不佳,并且不对称地操纵背景音频会降低语音检测性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在观看一段著名政治家发表演讲的视频。视频看起来完美无瑕:光线恰到好处,镜头稳定,政治家的面部表情自然。但有些地方感觉“不对劲”。声音听起来略显机械,而背景噪音——树叶的沙沙声、远处的车流声、空调的嗡嗡声——听起来像是录制于另一个房间。这就是深度伪造(deepfakes)的世界。长期以来,科学家们一直专注于捕捉“换脸”骗局,即把一个人的脸数字合成到另一个人的身体上。但现在,游戏规则已经改变了。新的套路不再是更换面孔,而是更换声音。
在这个新时代,不法分子可以保留真实的视频,但用计算机生成的音频替换掉原有的声音和背景噪音。这创造了一个看起来100%真实,但表达的内容却完全不同的“假货”。科学家面临的一个重大问题是:我们如何识破这些音频骗局?过去寻找伪造品的方法通常将所有声音视为一个整体,假设如果声音是假的,那么整个音频就是假的。但本文认为,声音实际上是由两种截然不同的成分组成的:言语(正在说的话)和环境(背景噪音)。就像蛋糕既需要面粉也需要鸡蛋一样,一段视频也需要言语和背景噪音才能听起来真实。如果你动了其中一个,它留下的“碎屑”可能与动了另一个留下的不同。
这正是 MADBench 发挥作用的地方。把 MADBench 想象成一个巨大的、高度组织化的、专门为计算机准备的“找茬”训练场。研究人员构建了一个庞大的视频数据集,在保持原始视频画面完全不变的情况下,通过四种不同的方式替换了音频:他们保留了全部真实音频,或者只伪造语音,或者只伪造背景噪音,亦或是两者都伪造。他们甚至制作了一些与场景相匹配的伪造背景音(如公园里的鸟鸣声),以及一些不匹配的背景音(如安静图书馆里的交通噪音),以测试是否会干扰计算机。
当他们用这个新的“训练场”来测试现有的伪造检测“冠军”时,结果令人惊讶。那些此前经过训练用于识别伪造品的计算机大多失败了;它们根本无法分辨出真实与伪造音频之间的区别。然而,另一种类型的计算机模型——一种通过海量数据学习了图像和声音协同理解的模型——表现得要好得多。但转折点在于:这些智能模型在捕捉伪造背景噪音方面比捕捉伪造语音要出色得多。事实证明,伪造语音留下的“碎屑”比伪造背景留下的“碎屑”更难被发现。
论文还发现了一个棘手的现象:如果你伪造了背景噪音,实际上会让计算机更难识破伪造的语音。这就像如果有人在背景中加入了巨大的假警笛声,它会分散侦探的注意力,导致侦探忽略了前景中的伪造语音。研究人员发现,虽然这些智能模型可以分辨出真实场景与伪造场景的区别(比如知道图书馆里不该有警笛声),但它们仍然难以精准定位究竟是音频的哪一部分在撒谎。
简而言之,这篇论文表明,我们目前的工具还无法应对这种新型的音频欺骗手段。我们不能再仅仅将声音视为一个整体,而是必须将语音和背景分开来看。这项研究表明,虽然我们拥有一些能够识别背景与视频是否匹配的智能模型,但在可靠地捕捉伪造语音(尤其是当它隐藏在伪造背景之后时)方面,我们仍有很长的路要走。作者总结道,为了构建更好的检测工具,我们需要停止将音频视为单一的流,而应将其视为语音和环境这两个需要分别调查的嫌疑人。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。