Generated Images Are Easier to Forget: A Machine Unlearning Perspective for Synthetic Image Detection
本文提出了一种基于机器遗忘(machine unlearning)的新型合成图像检测范式,利用大型视觉模型遗忘生成图像特征的速度快于自然图像这一见解,开发出了数据免除(data-free)和数据驱动(data-driven)两种检测方法,其性能优于传统方法。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象这样一个世界:你无法分辨一张你最喜欢的名人的照片是被相机拍摄的,还是由机器人凭空创造出来的。这不仅仅是科幻电影里的情节,而是我们数字时代的现实。我们正处于“生成式模型”爆发的中心,这些模型是精妙的计算机程序,它们学习如何绘画、绘图并创造出如此逼真的图像,以至于能欺骗人类的眼睛。虽然这对于艺术和电影制作来说非常神奇,但它也是一把双刃剑。如果心怀叵测的人利用这些工具制造假新闻、深度伪造(deepfakes)或欺诈照片,我们需要一种能够快速且可靠地识别伪造品的方法。
长期以来,解决方案似乎很简单:教计算机识别差异,就像老师批改试卷一样。你向计算机展示成千上万张真实的图片和成千上万张虚假的图片,它就会学会如何在两者之间划清界限。但问题在于,这些“老师”只知道被教导过的内容。如果出现了一种计算机从未见过的全新类型的机器人艺术家,老师就会感到困惑并失败。这就像试图通过一本关于麻雀的书来识别一种新的鸟类。科学家们一直试图利用大规模的预训练模型——即那些已经“读过”整个互联网的超级聪明计算机——来构建更好的“老师”。但即使是这些巨头也显得力不从心,因为它们对真实和虚假图像的理解都太好了,以至于无法区分它们。它们看到了两者之美,并给出了同样的高分,导致我们无法将真相与虚构区分开来。
这就是一篇名为《生成的图像更容易被遗忘》(Generated Images Are Easier to Forget)的新论文所切入的巧妙转折点。作者并没有问:“我们如何教计算机识别伪造品?”而是问:“如果我们让计算机‘遗忘’会发生什么?”
研究人员发现了这些超级聪明计算机的一个迷人特性。他们发现,虽然这些模型擅长记住一切,但在面对“虚假”内容时却相当脆弱。为了证明这一点,他们并没有尝试教模型学习新知识。相反,他们对计算机的大脑进行了一场小小的“手术”。他们提取了一个大规模的预训练模型,并开始修剪它的“突触”——即移除微小的、不重要的连接(在数学上这被称为“权重剪枝”)。
把模型的记忆想象成一个巨大的图书馆。关于现实世界照片(自然图像)的书籍是最受欢迎、磨损最严重且稳固地摆放在书架上的。而关于人工智能生成图像的书籍则是那些稀有的、古怪的、略显格格不入的卷册,被塞在后排。当研究人员开始随机移除图书馆里的书籍时,他们注意到一个模式:那些稀有的、古怪的卷册(AI图像)消失或变得混乱的速度,比那些受欢迎的、磨损严重的书籍要快得多。计算机“记住”虚假图像的能力,比记住真实图像的能力退化得要显著得多。
这由此衍生出了两种新的抓捕伪造品的方法:
“无数据”侦探: 这种方法甚至不需要看到一张伪造图像就能发挥作用。它只需获取一个预训练模型,剪掉其内部的一些连接,然后询问:“这张图片与原始模型相比,以及与‘健忘型’模型相比,相似度如何?”如果图片是真实的,两个模型对它的判断仍会保持一致。如果图片是AI生成的,“健忘型”模型会感到困惑并失去对该图像的掌控,导致相似度大幅下降。这就像要求一名学生回忆一个事实;如果他在受到一点点干扰后就立刻踉跄并忘记了,那么这个事实很可能原本就不是他真正掌握的。
“数据驱动”侦探: 如果研究人员确实拥有一些伪造图像,他们可以使用更具针对性的方法。他们教模型主动“忘掉”那些特定伪造图像的特征,同时保留其对真实图像的认知。这就像告诉模型:“请忘掉这种特定的绘画风格,但不要忘记一只真实的猫长什么样。”
结果令人印象深刻。在包括对研究人员从未见过的模型(如神秘的“Sora”视频生成器)所创建的图像进行的各种基准测试中,这种“遗忘”方法始终优于旧方法。旧方法依赖于学习真实与虚假之间的边界,在面对新型伪造品时往往会失败。而这种新方法通过依赖模型忘记虚假内容的速度,证明了其具有更强的鲁棒性。
简而言之,这篇论文表明,寻找谎言最好的方法可能不是去仔细研究谎言本身,而是看说真话的人如何遗忘它。通过将检测问题转化为“机器遗忘”问题,作者为识别AI生成内容开启了一扇新的大门,表明有时,知道该忘记什么比知道该记住什么更有力量。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。