Detecting AI-Generated Videos with Spiking Neural Networks
本文介绍了 MAST,一种基于脉冲神经网络的检测器,它利用时间残差和语义轨迹的独特事件驱动处理能力,在检测 AI 生成视频方面实现了卓越的跨生成器泛化能力,在 GenVidBench 基准测试上优于现有方法。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在看一部电影,其中的演员演技精湛,灯光完美无瑕,每一帧画面看起来都像是一张高分辨率的照片。长期以来,如果你想判断一段视频是真实的还是由计算机生成的,你只需要看一张静止的图片。如果耳朵看起来有点奇怪,或者手有太多根手指,你就知道它是假的。但计算机已经变得如此出色,以至于它们现在可以在单帧画面中画出一个完美的脸庞。所以,游戏规则已经改变了。现在,“假”不在于图片本身,而是在于图片之间的“运动”。
这就是AI生成视频检测的世界。其核心理念很简单:现实生活是混乱的。当你转头时,风会吹动你的头发,光影也会随之变化,这些变化是以一种特定的、混沌的、自然节奏发生的。然而,AI往往试图表现得过于完美。它会将事物过度平滑化,使得帧与帧之间的运动感觉更像是慢动作的梦境,而不是真实的生活。科学家们一直试图构建能够识别这些“平滑度”瑕疵的检测器。但棘手之处在于:不同的AI程序会产生不同类型的瑕疵。有的可能让头发移动得过于平滑,有的可能让背景闪烁。一个旨在捕捉某种类型瑕疵的检测器,在面对另一种新类型的瑕疵时往往会失效。这就是为什么研究人员正在寻找一种更聪明的方法,去观察整部电影,而不仅仅是看静止的画面。
这时,来自KAIST(韩国科学技术院)的一个团队决定尝试一种非常不同的方法。他们没有使用标准的、沉重的计算机大脑(称为人工神经网络,即Artificial Neural Networks),这类大脑试图记住每一个像素,而是转向了受人类大脑启发的技术:脉冲神经网络(Spiking Neural Networks,简称SNN)。把SNN想象成一个神经系统,它只在有“变化”发生时才会发出信号。它会忽略视频中那些枯燥、静态的部分,只关注行动的瞬间。
由Jang Minsuk及其同事领导的研究小组发现,当他们将AI视频输入到这个“对变化敏感”的大脑时,发现了一些迷人的现象。他们发现,真实视频会在整个屏幕上产生分散且自然的“脉冲”(信号)模式,而AI生成的视频则倾向于将它们的“脉冲”集中在物体的边缘,比如一个人的轮廓或一辆行驶的汽车。这就像是AI太忙于让物体内部看起来完美,以至于忘记了让边缘自然地运动。
为了捕捉这一点,他们构建了一个名为MAST的新型检测器。想象一下,MAST是一个由两部分组成的侦探。一部分是“冻结”的专家,负责观察视频的整体叙事(语义含义)以理解正在发生什么。另一部分是SNN,它充当高速运动传感器。它将视频分解为微小的“伪事件”——基本上,它在问:“这个像素改变了吗?”如果答案是肯定的,它就会发送一个微小的电脉冲。由于AI视频具有那些怪异、平滑的边缘,SNN看到了一个非常特定的模式:大量的脉冲聚集在边界处,但在中间却很少。
该团队在名为GenVideo的严苛挑战上测试了MAST,他们用一种AI制作的视频进行训练,然后要求它识别由十种不同的、它从未见过的AI程序制作的视频。这就像是教一名保安识别一种特定类型的假身份证,然后看他是否能识别出来自不同国家的任何假证件。结果如何?MAST的正确率达到了93.14%。这比大多数使用标准重型计算机大脑的其他顶尖检测器都要出色。
更酷的一点是,MAST也更快且更节能。因为它只在发生变化时(就像神经系统对突发噪音做出反应一样)才发射信号,所以它不会浪费能量去处理视频中那些枯燥、静止的部分。论文指出,这种“事件驱动”的风格是捕捉AI伪造内容的完美匹配,因为AI视频中的瑕疵通常隐藏在那些细微、快速的变化瞬间中。
作者谨慎地指出,这并不是解决所有问题的万灵药。如果视频非常短,或者AI在模拟运动方面变得更加出色,检测器可能会遇到困难。但目前为止,他们已经证明了使用一个以“脉冲”和“事件”进行思考的大脑,是识别AI生成视频那种平滑、不自然运动的一种强大的新方法。这提醒我们,有时,为了寻找动态图像中的真相,你不需要同时观察一切;你只需要知道何时该寻找变化。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。