UniSkip-Mamba: A Frequency-Aware State Space Model for Audio-Visual Temporal Forgery Localization
本文提出了 UniSkip-Mamba,一种频率感知的状态空间模型,通过选择性地聚焦具有判别性的中低频模式并过滤高频噪声,增强了音视频时序伪造检测能力,从而实现了最先进的准确率和显著更快的推理速度。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你是一名试图在一个嘈杂拥挤的房间里破解谜团的侦探。房间里充满了人们的交谈声、音乐声和闪烁的灯光。在数字媒体的世界里,这个“房间”就是一段视频,而那些“人”则是构成故事的像素和声波。长期以来,计算机在识别视频是否为伪造(即“深度伪造”,Deepfake)方面已经做得非常出色,但它们往往在处理一项特定的、棘手的任务时感到吃力:准确找出伪造部分从何时开始以及何时结束。这就像是知道一首歌是翻唱版本,却无法指出歌手是在哪一秒钟改变了声音。这个领域被称为“音视频时序伪造定位”(Audio-Visual Temporal Forgery Localization),它在现实生活中至关重要——例如在法庭或社交媒体安全领域,我们需要知道谎言的精确边界,而不只是知道存在一个谎言。
为了理解计算机是如何完成这项工作的,请把一段视频想象成一首复杂的歌曲。就像音乐一样,视频也有不同的“频率”。有些部分是缓慢、深沉且稳定的(低频),就像贝斯鼓或平静的对话。而另一些部分则是快速、尖锐且跳动的(高频),就像黑胶唱片的碎裂声或突然的、剧烈的相机抖动。传统的计算机模型试图倾听歌曲中的“每一个”声音,从最深的低音到最高的尖叫。但问题在于,在数字世界中,那些快速、高频的声音通常只是压缩产生的静态噪声或故障,而不是揭示伪造真相的真正线索。如果一名侦探试图通过关注背景中的静电噪声来破案,他们可能会被分散注意力,从而错过真正的证据。
就在这时,一项新的研究带着一个巧妙的转折出现了。研究人员 Cangjin Yu、Quan Zhang、Dan Jiang 和 Ke Zhang 构建了一种新型的数字侦探——UniSkip-Mamba。他们发现,伪造视频的“冒烟枪”(即关键证据)大多隐藏在缓慢、稳定、中低频的频率中。至于那些快速、跳动的高频部分?它们大多只是会让计算机感到困惑的噪声。因此,他们设计了这个系统来“跳过”这些嘈效的部分,就像一位知道忽略唱片上的静电噪声而专注于节奏的 DJ 一样。
该论文的核心发现是,通过刻意忽略高频噪声,计算机的工作效率反而变得更高了。他们在两个巨大的伪造视频数据集 LAV-DF 和 AV-Deepfake1M 上进行了测试。结果令人印象深刻:他们的新方法 UniSkip-Mamba 不仅找到了伪造内容,而且在定位精确的起始和结束时间方面,比之前的顶尖方法具有更高的准确度。在一个数据集上,它将准确率提升了近 10%,而在另一个数据集上则提升了超过 14%。更令人惊讶的是,通过跳过噪声,该系统的决策速度提高了 6 倍。
研究人员反对传统的方法,即让计算机尝试处理每一个帧和每一个声波的细节。他们表明,这种“密集型”方法实际上是一种弱点,因为它会让计算机对微小的、毫无意义的故障过于敏感。他们展示了他们的“跳跃扫描”(Skip-Scanning)方法如何像一个智能过滤器一样工作。它将视频帧进行分组,并以一种能够自然地滤除高频静电噪声、同时保留揭示伪造信息的关键低频模式的方式进行扫描。他们还发现,以一种特定的、灵活的方式将音频和视频结合起来——而不是仅仅僵硬地将它们并排堆叠——有助于计算机捕捉到那些唇音与声音哪怕只有极其微小不同步的伪造情况。
简而言之,这篇论文表明,有时为了看清真相,你必须停止观察一切。通过构建一个懂得哪些频率重要、哪些仅仅是噪声的系统,研究人员创造了一个不仅更快、更准确,而且在面对模糊或压缩视频等现实世界问题时更加强韧的工具。这提醒我们,在人工智能时代,有时寻找谎言的最佳方式是屏蔽噪声,去聆听其中的节奏。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。