← 最新论文
💻 computer science

FiSeR: Fine-Grained Source Representations for Cross-Domain AI Image Detection

FiSeR 通过引入一种层次对比学习框架,通过对自然-合成可分离性与生成器身份保持的联合优化,学习细粒度且可迁移的源表示,从而解决了跨域 AI 图像检测器泛化能力差的问题,在零样本和少样本自适应场景中均显著优于现有基准模型。

原作者: Shan Zhang, Yongxin He, Mingming Zhang, Huiwen Tian, Lei Ma

发布于 2026-08-20
📖 1 分钟阅读☕ 轻松阅读

原作者: Shan Zhang, Yongxin He, Mingming Zhang, Huiwen Tian, Lei Ma

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在现代数字景观中,真实与计算机制造之间的界限变得越来越难以划分。强大的人工智能系统现在可以生成与相机拍摄的照片无异的照片,以惊人的真实感捕捉面孔、风景和物体。这种能力创造了对能够识别这些合成图像工具的迫切需求,以帮助抵御虚假信息并确保我们在网上看到的内容是值得信赖的。多年来,研究人员一直致力于构建训练好的检测器,以识别这些 AI 生成器留下的细微且不可见的“指纹”。然而,一个持久的问题一直困扰着这些努力:一个在某一组图像上表现完美的检测器,在面对来自不同来源的新类型图像时往往会完全失效。这就像是一个学会了识别特定品牌假钞的保安,当罪犯换了一种不同的品牌时,尽管假钞的本质没有改变,他却完全被骗过去了。

一个研究小组致力于理解为什么会发生这种情况以及如何解决它。他们发现,问题并不一定在于检测器的“眼睛”——即系统观察图像并提取其基本特征的部分。当他们深入观察这些系统时,发现真实图像和伪造图像的特征仍然是截然不同且可区分的,即使检测器无法正确分类它们。失败之处在于检测器的“大脑”,即最后的决策层,它被调校得过于僵化,仅针对训练数据的特定特征。为了解决这个问题,研究人员开发了一种名为 FiSeR 的新训练方法。他们不再仅仅教系统如何分辨“真实”与“假冒”,而是教它去识别每一个特定 AI 生成器所发出的独特“声音”。通过理解来自一个生成器的假图像与来自另一个生成器的假图像在内部结构上有所不同,该系统学会了一种更灵活、更稳健的辨别真相的方式。

研究人员在广泛且具有挑战性的数据集上测试了这种新方法,其中包括由最新且最先进的模型生成的图像。在一种标准测试中,系统在一组图像上进行训练,然后立即被要求识别一组它从未见过的完全不同的图像中的假图像;在这种情况下,新方法以显著的优势超越了现有的最佳工具。以往的检测器在这些新场景中准确率大幅下降,而新系统则保持了高性能,几乎在所有情况下都能正确识别合成图像。团队发现,通过在训练过程中保留生成器的特定身份,系统学习到了一种稳定且可迁移的图像表示。这意味着,即使特定的生成器发生了变化,系统对“什么是合成图像”的核心理解依然保持稳固。

为了证明系统的内部理解确实是健全的,研究人员进行了一个简单的实验。他们提取了系统强大的图像读取部分,将其冻结使其无法改变,然后仅仅用一个极其简单、轻量级的分类器替换了最后的决策层,而这个分类器仅由极少数的新样本训练而成。当他们这样做时,旧的、表现挣扎的检测器的性能大幅提升,通常能提高二十个百分点以上。这证实了旧的检测器并非因为看不出真实与伪造的区别而失败,而是因为它们的决策规则过于局限于旧数据。相比之下,新方法学习到了一种天生具有鲁棒性的决策规则,只需极少的样本即可适应未见的生成器。

这项研究还引入了一种衡量这些系统学习效果的方法,使用了一个类似于人类如何按相似性对事物进行分组的概念。他们发现,在新的系统中,来自同一生成器的图像自然地聚集在一起,而来自不同生成器的图像则保持分离,且所有假图像都与真实图像清晰地分开。即使在测试来自未曾遇到的生成器的图像时,这种结构依然成立。结果表明,在快速变化的世界中检测 AI 生成图像的关键,不在于死记硬背特定的缺陷,而在于学习关于不同机器如何创作图像的更深层、更通用的理解。通过专注于来源的细粒度细节,而非仅仅关注“假冒”这一宽泛类别,研究人员创造出了一个对人工智能不断演进更具韧性的工具。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →