← 最新论文
💻 computer science

UC-VLM: Consistency-Driven Learning for AI-Generated Image Detection with Vision-Language Large Models

该论文介绍了 UC-VLM,这是一个统一的多阶段框架,它利用二元监督来同时增强视觉取证敏感性并生成用于 AI 生成图像检测的标签条件文本解释,在不依赖人工设计提示或人工标注理由的情况下,实现了最先进的性能。

原作者: Lei Tan, Shuwei Li, Mohan Kankanhalli, Robby T. Tan

发布于 2026-08-18
📖 1 分钟阅读☕ 轻松阅读

原作者: Lei Tan, Shuwei Li, Mohan Kankanhalli, Robby T. Tan

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在过去的几年里,计算机已经学会了绘制出与真实相机拍摄的照片无异的图像。这些由人工智能生成的图像可以捕捉到皮肤的纹理、水面的光影以及拥挤街道的混乱感,具有惊人的真实感。这种能力改变了我们创作艺术和媒体的方式,但也引入了一个新问题:我们如何知道什么是真实的,什么是机器制造的?长期以来,科学家们试图通过训练计算机去识别由生成软件留下的微小且肉眼不可见的错误(例如像素中的奇怪模式或光线行为的不一致性)来解决这个问题。然而,随着软件性能的提升,这些错误变得越来越难以发现,而旧的方法在面对新型图像时往往会失效。

一种较新的方法使用的是既能看图又能理解语言的大型模型,类似于人类观察照片并描述所见内容的过程。这些模型可以被问到:“这张图像是真的吗?”它们可以回答简单的“是”或“否”,甚至能写一段话来解释其推理过程。但问题在于,为了教导这些模型胜任这项任务,研究人员通常需要花费大量时间编写特定的问题供计算机回答,并提供由人类撰写的关于图像为何造假的解释。这个过程缓慢、昂贵且难以规模化。此外,这些模型往往过于关注它们生成的文字,而忽略了隐藏在图片本身中的微妙视觉线索。

新加坡国立大学的一个研究小组开发了一种训练这类语言与视觉模型的新方法,该方法无需人工编写的解释和复杂的指令。他们将该系统称为 UC-VLM。研究人员并没有要求人类去写下长篇大论的造假理由,而是让计算机仅通过一个表示“真实”或“生成”的简单标签进行学习。他们发现,通过在训练过程中以三种不同的方式重复使用这个简单的标签,他们可以教导模型变得比以往任何方法都更擅长识破伪造图像。

研究人员首先注意到,计算机的视觉系统(通常用于识别猫或汽车等物体)并不擅长发现 AI 图像中常含有的细微、不自然的瑕疵。为了解决这个问题,他们首先教导模型忽略物体的宏观轮廓,转而关注微小的局部细节。他们通过向模型展示图像的细碎、打乱的部分来实现这一点,迫使它去关注墙壁的纹理或阴影的模式,而不是整体场景。这一步骤使模型对揭示图像是合成产物的物理缺陷变得更加敏感。

接下来,团队解决了如何向模型提出正确问题的问题。他们发现,问题的措辞方式会改变计算机给出的答案。询问图像是“真实还是虚假”得到的结果,可能与询问图像是“原真还是生成”得到的结果不同。与其猜测哪种措辞效果最好,研究人员构建了一个能够自动测试成千上万种提问方式的系统。该系统保留了效果最好的版本并丢弃了失败的版本,最终确定了一套能让模型的回答更加稳定可靠的特定指令集。

最后,研究人员利用简单的“真实”或“生成”标签来教导模型撰写自己的解释。在过去,模型需要人类编写的范例来展示什么是好的解释。在这里,研究人员只需告诉模型:“如果图像是生成的,请解释为什么它是生成的”或者“如果图像是真实的,请解释为什么它是真实的”。随后,模型会根据这些指令撰写自己的推理过程。通过这样做,模型学会了将其视觉观察与文字输出联系起来,同时受到使用于训练其视觉部分的相同简单标签的引导。这创造了一个统一的系统,其中视觉部分、提问部分和写作部分都在相同的监督下协同工作。

当研究人员测试这个新系统时,结果令人瞩目。在一个包含数百万张由各种 AI 工具制作的图像的大型数据集 GenImage 上,新模型的平均准确率达到了 96.1%。这显著高于此前表现最好的方法(约为 91.5%)。该模型在名为 Chameleon 的更难测试中也表现出色,该测试的特点是具有极高真实感的高分辨率图像。在此项测试中,当针对某些特定类型的 AI 生成器进行训练时,新系统的准确率比现有最佳方法提高了 11% 以上,在其他类型上则提高了 15% 以上。

研究还表明,该模型具有更高的连贯性。如果以略微不同的方式询问同一个问题,旧模型可能会给出不同的答案,但这个新系统却能保持稳定。它学会了寻找特定的视觉线索,例如皮肤的不自然平滑感、不一致的阴影或背景中奇怪的模式,并且能够以结构化的方式描述这些发现。研究人员指出,该模型并非完美;它仍可能被高质量的图像或不具摄影感的艺术风格所迷惑。然而,通过依赖一种利用简单标签来同时训练计算机之“眼”与“言”的统一方法,他们创造了一个比以往任何工具都更强大、更具鲁棒性且更易规模化的工具。这项工作表明,我们不需要昂贵的人工标注来构建强大的检测器;我们只需要找到一种方法,让计算机通过不断地从真相本身中学习,并以多种方式反复实践。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →