← 最新论文
💻 computer science

Boosting Robust AIGI Detection with LoRA-based Pairwise Training

本文提出了一种基于 LoRA 的成对训练策略,通过微调视觉基础模型并引入失真与尺寸模拟来解耦泛化与鲁棒性优化,从而显著提升了 AI 生成图像在复杂真实场景下的检测性能,并在 NTIRE 挑战赛中荣获季军。

原作者: Ruiyang Xia, Qi Zhang, Yaowen Xu, Zhaofan Zou, Hao Sun, Zhongjiang He, Xuelong Li

发布于 2026-04-15
📖 1 分钟阅读☕ 轻松阅读

原作者: Ruiyang Xia, Qi Zhang, Yaowen Xu, Zhaofan Zou, Hao Sun, Zhongjiang He, Xuelong Li

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文讲述了一个关于**“如何识破 AI 生成的假照片”**的故事,特别是当这些照片经过各种“折磨”(比如压缩、模糊、裁剪)后,我们该如何依然保持火眼金睛。

想象一下,现在的 AI 画师(比如 Midjourney 或 Stable Diffusion)画出的照片已经逼真到连肉眼都分不清真假了。这就像是一个高明的魔术师,变出的假币(AI 图片)和真钱(真实照片)几乎一模一样。

但是,这个魔术师有个弱点:他的假币在刚变出来的时候很完美,可一旦经过**“流通”**(比如传到微信、微博,被压缩、被裁剪、被加滤镜),就会露出马脚。

这篇论文提出的方法(LPT),就是专门训练一群**“超级验钞员”,让他们不仅能在实验室里认出假币,还能在“菜市场”**(充满各种干扰的真实网络环境)里也能一眼识破。

以下是这篇论文的三大核心“绝招”:

1. 绝招一:给验钞员穿上“特制马甲” (LoRA 微调)

  • 背景: 以前,为了训练一个验钞员,我们需要从头教他,这既费钱(算力)又容易让他把以前学过的常识(比如“猫有胡子”)给忘了(这叫“灾难性遗忘”)。
  • 比喻: 这篇论文没有让验钞员“从头学起”,而是找了一位已经见过世面、知识渊博的“老专家”(视觉基础模型,EVA-CLIP)。
  • 做法: 我们不需要让老专家重新读遍所有书,只需要给他穿上一件**“特制马甲”**(LoRA 技术)。这件马甲很轻,只修改几个关键口袋,让他专门学会“找 AI 破绽”。
  • 效果: 这样既保留了老专家的博学(通用能力),又让他瞬间变成了识破 AI 假图的专家,而且学习成本极低。

2. 绝招二:在“模拟考场”里疯狂刷题 (数据分布模拟)

  • 背景: 以前的训练就像是在**“无菌实验室”里练枪法,照片都是完美的。但现实世界是“战场”**,照片会被压缩、模糊、裁剪。结果就是:在实验室考满分,一上战场就挂科。
  • 比喻: 作者发现,验证集和测试集里的照片,就像是被**“粗暴对待”**过的(有的被切掉一半,有的被加了噪点,有的被压扁了)。
  • 做法: 他们在训练时,故意**“虐待”**训练数据。
    • 加料: 给照片加上各种奇怪的滤镜、模糊、噪点(就像给照片吃各种“泻药”)。
    • 改形: 随机把照片切掉一块,或者强行拉伸、压缩(模拟手机截图或不同屏幕显示)。
    • 加难度: 他们发现普通的“虐待”不够,于是把“虐待”的强度调高,让模型在**“地狱难度”**下训练。
  • 效果: 这样训练出来的验钞员,哪怕拿到一张被揉得皱皱巴巴、模糊不清的假币,也能淡定地说:“这是假的!”

3. 绝招三:搞“结对子”训练 (Pairwise Training)

  • 背景: 这是一个很微妙的平衡问题。如果你只让验钞员看“被虐待过”的照片,他可能会变得**“疑神疑鬼”**,连真钱被揉皱了也说是假的(误报率高)。
  • 比喻: 想象你在训练一个侦探。
    • 错误做法: 只给侦探看一堆被涂改过的假文件,他可能会觉得所有文件都有问题。
    • 正确做法(论文的方法): 每次训练,都**“成对”**给他看。
      • 一张是**“ pristine(完美)”**的真照片。
      • 一张是**“被虐待过”**的同一张照片(或者是同类型的假照片)。
    • 核心逻辑: 强迫侦探去对比:“看,这张虽然模糊了,但它的**‘灵魂’**(核心特征)和那张完美的照片是一样的,所以它还是真的/假的。”
  • 做法: 通过一种特殊的数学公式(损失函数),强行让模型把“被虐待过的特征”拉回到“完美特征”的轨道上。
  • 效果: 这样既保证了模型在**“恶劣环境”下能识别,又保证了它在“干净环境”**下不会乱报警。

总结与成绩

这套组合拳(老专家 + 特制马甲 + 地狱模拟训练 + 结对子对比)非常有效。

  • 战绩: 在 NTIRE 2026 年的“野外 AI 图片检测”挑战赛中,这个方法拿到了全球第三名
  • 意义: 它证明了,要对抗 AI 造假,不能只盯着像素级的微小瑕疵(因为那些容易被抹去),而要抓住更深层的**“语义逻辑”**(比如照片里的人脸结构是否合理,光影是否自然),并且要模拟真实世界的混乱环境来训练模型。

一句话总结:
这就好比训练一个**“老练的鉴宝专家”,给他穿上“轻便的防弹衣”(LoRA),让他先在“满是灰尘和碎屑的垃圾堆”(模拟真实网络环境)里练眼力,并且每次都要拿着“真品”和“被弄脏的赝品”做对比,最终练就了一身“火眼金睛”**,无论照片被怎么折腾,都能一眼识破真假。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →