PE-Mamba: Bidirectional Selective Layer Aggregation for AI-Generated Image Detection
PE-Mamba 是一个轻量级的、经过 LoRA 改编的框架,它通过引入双向选择聚合器和 Softmax 加权聚合器,有效地融合了从浅层纹理到深层语义的分层特征,从而在以极少的参数更新下,实现了在多种生成模型上的最先进泛化性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正走在一座宏大且高科技的图书馆里,这里的每一本书都是一张图片。多年来,图书管理员可以轻松识别出那些假书,因为它们印在廉价的纸张上,带有明显的污迹。但最近,一种新型打印机来到了这里,它制造的假书看起来如此完美,纸张如此平滑,墨迹如此清晰,以至于即使是专家也无法将它们与真书区分开来。这就是 AI 生成图像的世界。科学家们正在竞相构建“数字测谎仪”,以便在这些伪造品传播误导信息或导致欺诈之前识别出它们。棘手之处在于,这些检测器过去依赖于寻找旧式打印机留下的微小、特定的污迹。但当新一代打印机改变了其方法时,旧的检测器就变得困惑了。为了解决这个问题,研究人员现在正试图理解计算机的“大脑”是如何看待一张图片的——从最初对纹理的第一眼观察,到最终对物体实际内容的理解,逐层深入地剖析。
你即将阅读的论文介绍了一位新的侦探:PE-Mamba。PE-Mamba 不仅仅是在寻找污迹,它被设计用来理解一张图片是如何构建其“故事”的。你可以把视觉 Transformer(论文中使用的计算机大脑)想象成一个排成一列的侦探团队。第一位侦探只看到粗糙的边缘和颜色;最后一位侦探则理解整个场景。以往的方法将这个团队视为一群朋友同时大声喊出自己的意见,然后取一个简单的平均值。但 PE-Mamba 意识到顺序至关重要:来自开端的粗糙线索有助于解释结尾的大局,而大局也有助于理解开端的粗糙线索。
PE-Mamba 使用了一种聪明的技巧,叫做“双向选择性扫描”。想象一下,一名侦探沿着团队的队列向前行走,一边走一边收集线索(前向扫描);然后,他们转身从终点折返回起点,带着最终结论的智慧重新审视那些早期的线索(后向扫描)。这种双向行走的模式让模型能够将微小的细节与宏大的意义联系起来,而这种连接是简单的平均法永远无法实现的。论文指出,通过将计算机大脑的各层视为一个有序的序列而非杂乱的一堆,PE-Mamba 即使面对它从未见过的全新 AI 工具生成的伪造品,也能更好地识别它们。
侦探的新策略
研发 PE-Mamba 的研究人员将他们的系统构建在一个名为 PE-Core 的庞大预训练计算机大脑之上。这个大脑已经非常擅长识别物体、人脸和场景,但它最初并不是为了抓捕伪造品而设计的。为了在不破坏其现有知识的情况下对其进行教学,团队使用了一种轻量化技术,称为 LoRA。你可以把 LoRA 想象为给大脑添加了一套小巧、可拆卸的“辅助轮”。与其重新改装整个庞大的引擎(这既昂贵又缓慢),他们只微调了极小比例的连接——仅占总参数量的 1.3%,如果只计算 LoRA 部分,则仅为 0.13%。这使得模型能够在保持其通用知识完整性的同时,学习特定伪造图像的“指纹”。
其核心创新在于 PE-Mamba 如何结合大脑不同层级的线索。论文认为,以往的方法犯了一个错误,即将各层视为一个无序的集合,就像一桶混杂在一起的拼图碎片。然而,PE-Mamba 尊重信息的自然流动:从浅层(纹理和边缘)到深层(语义和意义)。
为此,PE-Mamba 使用了三个主要组件:
- 双向选择聚合器 (BSA): 这是那位双向行走的侦探。它向前扫描线索(从浅层到深层)以积累证据,然后向后扫描(从深层到浅层),利用整个图像的上下文来完善那些早期的线索。这就像读一本推理小说,先从头读到尾,然后再倒着读一遍,看看结局是如何解释开头的。
- Softmax 加权聚合器 (SWA): 它扮演着“全局总结”侦探的角色。它同时观察所有的线索,并根据学习到的评分挑选出最重要的线索,从而提供一种与双向行走不同的视角。
- Sigmoid 门控混合器 (SGA): 这是团队队长。它决定了要多大程度上信任“双向行走”与“全局总结”。它使用一个“门控”来学习如何平衡两者,确保最终的决策能兼顾两者的优势。
数据说明了什么
团队在两个主要的挑战集上测试了 PE-Mamba:UniversalFakeDetect 基准测试和 AIGCDetect 基准测试。在这些测试中,模型仅针对一种特定的 AI(ProGAN)生成的图像进行训练,然后被要求识别由 19 种其他 AI 模型生成的伪造品,其中包括像 DALL-E 和 Midjourney 这样的现代扩散模型。
结果令人印象深刻。在 UniversalFakeDetect 基准测试中,PE-Mamba 达到了 96.6% 的准确率 (mACC) 和 99.5% 的精确率 (mAP)。这意味着它比与之对比的其他 18 种检测器更频繁地正确识别出伪造品。更令人瞩目的是,在拥有极高质量生成器的 AIGCDetect 基准测试中,PE-Mamba 取得了 95.3% 的准确率和 98.1% 的精确率。
论文指出,这种成功源于模型发现“可迁移结构不一致性”的能力。虽然其他检测器在伪造图像生成器改变风格时可能会失效,但 PE-Mamba 的双向扫描似乎能找到在不同类型的伪造品中保持一致的深层模式。例如,当某些旧检测器在面对某些新生成器时准确率降至 50-60% 左右时,PE-Mamba 依然表现强劲,得分通常在 95% 以上。
鲁棒性与视觉证明
研究人员还检查了 PE-Mamba 处理现实世界复杂情况的能力。他们在经过压缩(如 JPEG)、模糊处理或添加噪声处理的图像上进行了测试。即使在这些严苛条件下,该模型依然表现出色,在三种失真同时存在时仍保持了 88.4% 的准确率。这表明该模型不仅仅是在记忆特定的像素模式,而是在学习一种更具鲁棒性的、关于“什么是伪造图像”的理解。
为了观察模型是如何“思考”的,团队使用了一种名为 Grad-CAM 的可视化工具。当他们观察模型注意力的“热力图”时,发现了有趣的现象。原始的、未经训练的大脑无论照片是真是假,都会关注照片中的主体(如人脸或汽车)。但 PE-Mamba 学会了忽略真实照片中的显而易见的部分,转而强烈关注伪造照片中那些不自然、怪异的地方——比如 GAN 生成物体的边缘、深度伪造中的皮肤纹理,或是扩散模型图像中的全局模式。这证实了模型已成功学会识别机器中的“幽灵”。
总结
论文得出结论,将视觉 Transformer 的各层视为一个有序的序列,而非随机的特征包,是检测 AI 生成图像的一种强大方法。通过使用双向扫描来连接微观细节与宏观图景,PE-Mamba 为取证检测开辟了一条新路径。它在实现顶尖性能的同时,仅使用了极少的额外计算资源,使其成为未来极具前景的工具。然而,作者也指出,像 Midjourney 这样的生成器仍然具有挑战性,未来的工作需要探索更广泛的训练方法,以捕捉各种类型的数字伪造。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。