← 最新论文
💻 computer science

Semantic-aware Adversarial Fine-tuning for CLIP

本文针对现有基于余弦相似度的对抗样本在微调 CLIP 模型时的局限性,提出了一种语义感知对抗微调(SAFT)方法,通过利用基础模型生成并优化语义丰富的文本描述集合来构建更具鲁棒性的对抗样本,从而显著提升了 CLIP 在零-shot 分类任务中的对抗鲁棒性。

原作者: Jiacheng Zhang, Jinhao Li, Hanxun Huang, Sarah M. Erfani, Benjamin I. P. Rubinstein, Feng Liu

发布于 2026-02-16
📖 1 分钟阅读☕ 轻松阅读

原作者: Jiacheng Zhang, Jinhao Li, Hanxun Huang, Sarah M. Erfani, Benjamin I. P. Rubinstein, Feng Liu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文提出了一种让 AI 变得更“聪明”且更“抗揍”的新方法。为了让你轻松理解,我们可以把这篇论文的核心内容想象成训练一个超级侦探(AI 模型)去识别各种物体

1. 背景:侦探的“死穴”

想象一下,你训练了一个叫 CLIP 的超级侦探。它的任务是看图说话,比如看到一张狗的照片,它就能认出这是“狗”。

  • 以前的训练方式(旧方法): 训练员(攻击者)会故意给侦探看一些经过微调的“假照片”(对抗样本)。比如,给一只狗的照片加一点点人眼看不见的噪点,让侦探误以为这是“猫”。
  • 旧方法的漏洞: 训练员在制造这些假照片时,只问了一个非常简单的问题:“这是一张照片吗?”(就像论文里说的 "A photo of a {label}")。
    • 比喻: 这就像侦探只背了“这是一张狗的照片”这一句话。如果训练员制造假照片时,专门针对这句话做手脚,侦探就中招了。
    • 问题: 一旦遇到更复杂的描述,比如“一只毛茸茸的、会叫的宠物”或者“一只被画在纸上的狗”,这个侦探就晕了,因为它只认死理,不懂变通。

2. 核心发现:假照片“骗”不了真正的侦探

作者发现,如果用更丰富、更生动的语言来描述(比如“一只毛茸茸的、会叫的宠物”),那些专门针对“照片”这个词制造的假照片,就骗不了侦探了。

  • 比喻: 就像你给侦探看一张被涂改过的狗的照片,如果只问“这是照片吗?”,他可能被骗。但如果你问“这是不是那种毛茸茸、会叫的宠物?”,他立刻就能认出:“不对,这看起来太奇怪了,肯定不是真的宠物!”

3. 新方案:SAFT(语义感知对抗微调)

为了解决这个问题,作者提出了一个新框架,叫 SAFT。我们可以把它想象成给侦探进行了一场**“全方位特训”**。

这个特训分为两步:

第一步:请“作家”写故事(语义描述生成)

不再只用“这是一张狗的照片”这种干巴巴的话。

  • 做法: 作者请了一个超级 AI 作家(基础模型,如 LLM),让它为“狗”这个概念写很多不同的描述。
    • “一只毛茸茸的哺乳动物。”
    • “人类最好的朋友。”
    • “一种会汪汪叫的宠物。”
  • 比喻: 这就像给侦探准备了一本厚厚的《动物百科全书》,里面不仅有照片,还有各种各样生动的描述。

第二步:防止“作家”胡说八道(幻觉感知过滤)

AI 作家有时候会犯迷糊(产生幻觉),比如它可能说“狗是一种长着翅膀的神话生物”。

  • 做法: 作者设计了一个“编辑”机制。它会检查作家写的每一句话,如果这句话跟“狗”的核心特征(比如四条腿、会叫)不符,或者太离谱,就直接删掉,只留下最靠谱的那几句。
  • 比喻: 就像主编在出版前审核稿件,把那些“狗会飞”的胡话删掉,只保留“狗会叫”、“狗有毛”这些真理。

第三步:魔鬼训练(语义集成攻击)

现在,训练员(攻击者)要制造假照片了。

  • 旧方法: 只要骗过“这是一张照片”这句话就行。
  • 新方法(SAFT): 训练员必须同时骗过所有留下的靠谱描述(“毛茸茸的”、“会叫的”、“宠物”等)。
  • 结果: 训练员发现太难了!因为要同时让一张假照片既不像“毛茸茸的”,又不像“会叫的”,还要不像“宠物”,这几乎是不可能的任务。
  • 比喻: 以前只要骗过侦探的一个朋友,现在要同时骗过侦探的整个朋友圈(而且都是懂行的专家)。

4. 最终效果:更强大的侦探

经过这种特训后,CLIP 侦探变得非常强大:

  1. 更抗揍(鲁棒性): 无论攻击者怎么改图,只要稍微有点不对劲,侦探都能识破,因为它学会了理解事物的本质,而不是死记硬背某句话。
  2. 更聪明(泛化性): 即使遇到它没见过的描述方式(比如“一只卡通狗”),它也能认出这是狗,因为它理解了“狗”的核心概念。
  3. 实验证明: 作者在 16 个不同的数据集上测试,发现这种方法比以前的所有方法都强,不仅防住了攻击,还没怎么降低它识别正常图片的能力。

总结

这篇论文的核心思想就是:不要只教 AI 认死理(单一模板),要教它理解事物的丰富内涵(多种语义描述)。

通过让 AI 在训练时面对各种各样、经过筛选的生动描述,并强迫它抵抗针对这些描述的干扰,我们最终得到了一个既聪明又皮实的 AI 模型,无论别人怎么变着花样骗它,它都能一眼看穿真相。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →