Dual Adversarial Fine-tuning for Enhancing Robustness of Large Vision Language Model
本文提出了一种双重对抗微调框架,该框架通过共同优化视觉与语义监督信号,在无需修改架构或进行特定任务重训练的情况下,显著增强了大型视觉语言模型抵御对抗攻击的鲁棒性与跨任务泛化能力。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一个这样的世界:计算机不仅能看到图片,还能真正“理解”它们,就像朋友看着相册聊天一样。这就是大型视觉语言模型(LVLMs)的领域——这些是支撑着能够描述日落、回答图表问题或根据单张图片讲述故事的工具背后的超智能 AI 大脑。为了让这些庞然大物发挥作用,科学家们教会它们将图像与文字联系起来,就像把拼图块精准地匹配到它完美的位置一样。然而,这里隐藏着一个棘手的问题:这些 AI 大脑异常脆弱。正如魔术师会被轻微的干扰所迷惑一样,这些模型也会被“对抗性攻击”所欺骗——这些攻击是图像中看似微小的、肉眼看不见的扰动,在人类看来只是些静电噪声,却能让 AI 完全丧失理智,把狗看成烤面包机,或者把巴士看成长颈鹿。随着我们开始在重要工作中信任这些模型,确保它们不会被数字噪声所戏弄就变得至关重要。
迎来了一支新的研究团队,他们决定阻止 AI 如此轻易地被愚弄。他们意识到,以往试图“增强”这些模型的尝试就像是在训练一名拳击手只去打某一个特定的对手;模型在面对那一场战斗时表现出色,却无法应对其他任何情况。研究人员提出了一种聪明的全新训练营计划,名为双重对抗微调(DAF T)。他们不仅仅是教 AI 去忽略噪声,而是同时教它两门课程。首先,他们向它展示图像的“洁净”版本(真相),以保持其记忆清晰;其次,他们使用关于图像的丰富、具有描述性的故事(标题),而不是像“猫”或“狗”这样简单的标签。这就像不是仅仅教学生记住“苹果”这个词,而是让学生理解苹果的整个概念——它的红色、它的清脆感,以及它是如何摆放在果盘里的——这样即使有人在图片上涂鸦,学生依然知道它是什么。
论文发现,这种双管齐下的方法效果显著。当他们用他们的新方法测试旧方法时,经过 DAFT 训练的模型即使在图像受到不可见噪声攻击时,依然保持冷静和镇定。无论是识别图片的任务(分类)、编写关于图片的句子(描述生成),还是回答棘手的问题(视觉问答),新方法都表现得游刃有余。研究人员展示了,通过用他们新训练的版本替换掉 AI 的“眼睛”,整个系统变得更难被欺骗,而且无需从头重建整个大脑。这有点像给超级英雄一副新的护目镜,在过滤掉坏东西的同时,让好的东西保持清晰可见。
论文的故事
问题: “单项冠军型” AI
大型视觉语言模型(LVLMs)非常神奇。它们可以看着摩天轮的照片并告诉你它是“摩天轮”,或者回答诸如“中间是什么游乐设施?”之类的问题。但这些模型有一个秘密弱点:它们很容易被欺骗。如果你在图片中加入一点点不可见的静电(即“对抗性攻击”),AI 可能会突然认为摩天轮是一辆“巴士”或一只“长颈鹿”。
科学家们以前也尝试过修复这个问题。有些人尝试在向 AI 展示这些带有干扰、噪声的图片时,使用简单的标签(如“猫”或“巴士”)进行训练。但论文指出,这就像是训练一只狗,只有当你说“坐下”且环境安静时它才会坐下;如果你在嘈杂的公园里说,狗就会感到困惑。这些方法在处理简单任务时效果尚可,但在 AI 需要做更难的事情(如写故事或回答复杂问题)时就会失败。其他方法尝试在没有任何标签的情况下教 AI,但它们并没有足够强大到能应对那些极其复杂的攻击。
解决方案: 一个两部分的训练营
该论文的作者 Sibo Wang 及其团队提出了一种训练 AI 的新方法,称为 DAFT(双重对抗微调)。他们意识到,要让 AI 真正具备鲁棒性,它需要同时接受两种引导,就像一个学生有两个不同的老师在辅导一样。
- “视觉”老师(锚点): 这部分训练使用 AI 原生“眼睛”(视觉编码器)的一个冻结的原始版本。它充当一个参考指南。当 AI 观察一张带有噪声、具有干扰性的图片时,这位老师会说:“嘿,记得原本的图片是什么样子的吗?不要忘记原始的特征。”这防止了 AI 产生困惑和过拟合(即记住了噪声而非真相)。
- “语义”老师(讲述者): 这是核心创新。这个老师不再使用像“巴士”或“猫”这样简单的标签,而是使用详细描述图像的完整句子或标题。例如,它不再只说“巴士”,而是说“一辆蓝色的巴士行驶在多雨的街道上”。AI 随后被训练去将噪声图片与这种丰富的描述相匹配。这有助于 AI 理解图像的意义和语境,而不仅仅是类别。
神奇之处在于这两位老师是如何协同工作的。“视觉”老师让 AI 扎根于现实,而“语义”老师则教它理解图像的深层含义,即使图片被破坏了也是如此。
结果:更强壮,更聪明
团队在许多不同的任务上测试了他们的方法。他们采用了流行的 AI 模型 LLaVA,并将其原有的“眼睛”替换成了他们经过强化训练的新版本。然后,他们用不可见的噪声对它进行了攻击,以观察会发生什么。
- 零样本分类(Zero-Shot Classification): 当被要求识别从未见过的图片中的物体时,DAFT 模型在忽略噪声方面表现得更好。与使用简单标签的旧方法相比,其准确率平均提高了约 12%。
- 描述生成与问答(Captioning and Q&A): 这是新方法真正闪耀的地方。当被要求描述一张带噪声的图像或回答问题时,旧模型经常给出荒谬的答案(比如把起重机称为“长颈雀”)。然而,DAFT 模型却能始终正确回答。例如,在一项测试中,当其他模型在受到攻击时无法正确识别“摩天轮”时,DAFT 模型却准确命中了。
- 权衡(The Trade-off): 论文指出,有时让模型对攻击变得如此强悍可能会使其在看“洁净”图片时表现略微下降。然而,DAFT 成功地使其在洁净图片上的表现几乎与现有的最佳方法一样好,同时在对抗攻击时却强大得多。
论文排除了哪些可能
作者非常明确地指出了哪些方法是不起作用的。他们认为,仅仅使用类别标签(如“猫”或“巴士”)作为唯一的引导是不够的,因为这会导致过拟合。他们还表明,仅仅使用无监督方法(在没有文本帮助的情况下学习)在面对最先进的攻击时并不够强。他们的实验表明,你确实需要结合视觉接地(visual grounding)和丰富的语义理解才能获得最好的结果。
他们有多确定?
作者在许多不同的数据集(如 Caltech101、COCO 和 VQAv2)以及不同的噪声水平(具体为扰动预算 和 )下进行了广泛的实验。他们将自己的方法与当前最优秀的方法(如 TeCoA 和 FARE)进行了对比,发现 DAFT 始终优于它们。他们不仅仅是在模拟,他们实际上训练了模型并在真实的各项任务上进行了测试。结果是以实验测量的客观事实呈现的,显示出明显的提升。
底线
这篇论文表明,要让 AI 视觉模型真正安全可靠,我们不能仅仅教它们如何忽略噪声;我们必须教它们理解图像背后的“故事”,同时牢牢抓住视觉事实。通过使用结合了视觉锚点与丰富描述性标题的“双重”方法,研究人员构建了一个更难被欺骗的模型,这为这些强大的 AI 工具的安全性迈出了重要一步。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。