Finetune Like You Pretrain: Boosting Zero-shot Adversarial Robustness in Vision-language Models
该论文提出了一种名为 AdvFLYP 的新范式,通过模仿 CLIP 预训练过程(利用网络图像 - 文本对进行对比学习)并引入正则化项来微调模型,从而在显著提升视觉语言模型对抗鲁棒性的同时,有效保留了其零-shot 泛化能力。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
这篇论文讲的是一个关于如何让“超级 AI 助手”变得更聪明、更抗揍的故事。
想象一下,现在的CLIP(一种著名的视觉 - 语言模型)就像是一个博览群书、见多识广的“超级图书管理员”。
- 它的训练方式(预训练)是:在网络上看了4 亿张图片和对应的文字描述,学会了把“图片”和“文字”配对。比如,看到一张猫的照片,它能立刻联想到“猫”这个词。
- 它的特长是:你给它一张没见过的照片,它能猜出这是什么(零样本能力),而且猜得很准。
但是,这个管理员有个大弱点:它太容易被“恶作剧”骗了。
如果你给猫的照片上加一点点人眼看不见的噪点(就像在照片上撒了一把看不见的灰尘),这个管理员就会突然“发疯”,指着猫说:“这是一辆坦克!”这就是对抗攻击。
以前的做法:死记硬背(主流方法)
为了解决这个问题,以前的研究人员想了一个办法:
他们找了一个标准的分类题库(比如 ImageNet,里面有 1000 类东西,每类都有标准答案),然后给管理员做“特训”。
- 怎么特训? 他们故意制造那些能骗过管理员的“坏照片”(对抗样本),然后强行告诉管理员:“这张坏照片其实是猫,你要记住!”
- 结果: 管理员确实变聪明了,能认出这些坏照片。但是,因为它为了适应这个“死记硬背”的题库,忘了自己原本那种“见多识广、灵活配对”的本领。它变得像个只会做题的机器,遇到题库以外的新场景(比如艺术画、素描、或者不同领域的图片),就傻眼了。
这就好比: 你为了应付考试,把课本背得滚瓜烂熟,但一旦题目稍微变个花样,或者让你去解决实际问题,你就不会了。
这篇论文的新招:像当初学艺一样去特训(AdvFLYP)
这篇论文的作者提出了一个全新的思路,叫AdvFLYP。它的核心理念只有一句话:“像当初学艺一样去特训”(Finetune Like You Pretrain)。
作者认为,既然管理员当初是靠“看图说话”(图片和文字配对)学会的本领,那我们在特训它抗揍的时候,也应该用同样的方式,而不是把它逼去背题库。
具体做法是这样的:
- 换个教材: 不再用那个死板的分类题库,而是从网上抓了100 万张真实的、有点杂乱的图片和文字(就像它当初学艺时看的那些网络数据)。
- 换个练法: 制造“坏照片”后,不是告诉它“这是猫”,而是让它重新把这张坏照片和原本的文字描述配对起来。
- 比喻: 就像你教一个学生,不要只让他背“猫=猫”,而是让他看着一张被涂改过的猫图,依然能写出“这是一只猫”的短文。
- 加个“防走火”护盾(正则化):
- 因为网上的数据太杂,生成的“坏照片”可能会把管理员的脑子搞乱(特征扭曲)。
- 所以作者加了两个“护盾”:
- 逻辑护盾(Logit-level): 防止它被攻击后完全胡说八道,保持逻辑连贯。
- 特征护盾(Feature-level): 防止它把“猫”的特征彻底搞成“坦克”的特征,确保它心里还是清楚的。
结果怎么样?
实验结果显示,这个新方法(AdvFLYP)简直是个天才:
- 更抗揍: 面对各种恶意的攻击,它的防御能力比以前的方法强很多。
- 更灵活: 它没有因为特训而变傻,依然保留了“见多识广”的本领,在 14 个不同的新领域(从识别花朵到识别汽车,甚至识别素描)都表现优异。
- 更通用: 它不需要针对每个领域重新训练,直接就能用。
总结
这篇论文告诉我们一个深刻的道理:想要让一个 AI 变得既强壮又聪明,不要强行把它塞进死板的题库里训练,而要尊重它原本的学习方式。
就像教一个武术高手,不要只教他怎么在特定的擂台上打赢特定的对手,而要让他回到大自然中,在复杂多变的环境里,用他原本最擅长的招式去应对各种攻击。这样练出来的高手,才是真正的大师。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。