TAP into the Patch Tokens: Leveraging Vision Foundation Model Features for AI-Generated Image Detection
本文介绍了一个综合性基准测试,证明现代视觉基础模型在检测人工智能生成图像方面显著优于 CLIP,并提出了一种可调节注意力池化(TAP)分类器头,利用这些模型在具有挑战性的真实世界检测基准测试中确立了新的最先进性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
以下是论文《TAP into the Patch Tokens》的通俗解释,辅以生动的类比。
核心难题:“假新闻”泛滥
想象互联网是一座巨大的艺术画廊。最近,人工智能在绘画方面变得如此出色,以至于它能创作出 100% 逼真的图像。问题在于,不法分子正利用这些 AI 工具散布谎言、伪造的名人照片或伪造文件。
检测这些赝品,就像试图在一大堆真币中找出唯一一枚假币。“坏人”不断升级他们的工具(新的 AI 生成器),因此“好人”(侦探们)需要更强大的放大镜。
旧放大镜:CLIP
很长一段时间以来,大家使用的最佳放大镜是一个名为CLIP的模型。把 CLIP 想象成一位极其聪明的图书管理员,他读过数百万本书,看过数百万张图片。当你给他看一张照片时,他会快速总结图片的内容(例如:“这是一只猫”)。
然而,论文指出了侦探们在使用这位图书管理员时的一个缺陷:
- “头部”与“细节”之别:当 AI 观察图像时,它会将图像分解成许多小的拼图块(称为patch tokens),同时还有一个特殊的拼图块,称为CLS token(即“摘要”块)。
- 错误所在:以往的方法只向图书管理员询问摘要(CLS token),而忽略了所有拼图块。
- 问题所在:AI 生成的赝品往往只在图像的某一个角落存在微小、奇怪的瑕疵(比如六根手指的手,或墙上奇怪的纹理)。如果只看摘要,就会错过这些微小线索。这就像试图仅通过看画框上的标题来辨别一幅画是否为赝品,而忽略了画布上的笔触。
新方案:TAP(可调注意力池化)
作者提出了一种简单但强大的升级方案,称为TAP(Tunable Attention Pooling,可调注意力池化)。
类比:
想象你是一名正在勘察犯罪现场的侦探。
- 旧方法:你问证人“发生了什么?”,他们给你一个 30 秒的总结。你错过了细节。
- 新方法(TAP):你问证人“把你看到的一切都告诉我”,但同时你给他们一支荧光笔。你说:“如果你看到任何可疑之处,比如破碎的窗户或泥泞的脚印,就把它标记出来。”
TAP 就是那支荧光笔。它审视所有的拼图块(patch tokens),而不仅仅是摘要。它学会特别关注 AI 赝品通常隐藏错误的特定位置,同时仍保持对整体画面的把握。
新放大镜:视觉基础模型(VFMs)
作者们还意识到,他们使用的“图书管理员”(AI 模型,即 CLIP)有点过时了。自 CLIP 发布以来,许多更新、更聪明的“图书管理员”已经接受了训练。这些被称为视觉基础模型(VFMs)。
团队测试了整个系列的新模型,以找出谁是最佳侦探。他们发现,名为PE-Core(感知编码器)的模型比旧的 CLIP 模型显著更好。这就像将普通放大镜换成了高倍显微镜。
他们的发现(结果)
论文进行了一系列测试(基准测试),以评估新系统的表现。以下是他们的发现:
- 优于旧标准:通过使用更新的"PE-Core"模型,他们获得了比使用旧 CLIP 模型好得多的结果。
- TAP 的力量:当他们将“荧光笔”(TAP)添加到新模型中时,准确率进一步跃升。
- 在一项困难测试中,他们的新方法比之前的最佳方法准确率高出12%。
- 在另一项涉及“图像修复”(即 AI 仅编辑真实照片的一小部分)的测试中,他们将准确率提高了**29%**以上。
- 泛化能力:最棒的是,他们仅在一种类型的 AI 生成器上训练了该系统,但它变得如此擅长识别赝品,以至于能够检测出由它从未见过的、完全不同的 AI 生成器制作的图像。
总结
论文指出:“别再忽视小细节了!”
通过结合更新、更聪明的 AI 模型与一种审视所有图像细节(而不仅仅是摘要)的新方法,作者们构建了一个更强大的 AI 生成赝品检测器。他们不需要构建复杂的新型机器;他们只需要使用正确的工具,并审视整幅画面,而不仅仅是标题。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。