Unifying Adversarially Robust Model Experts in Vision-Language Models
本文提出了 CARE,一种协作式对抗微调框架,该框架通过嵌入空间和谐化技术,将多个专门的鲁棒模型专家统一起来,从而构建出一个在多种评估设置下都具有卓越且互补对抗鲁棒性的单一视觉-语言模型。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你有一个超级聪明的机器人朋友,它能看一眼图片就立刻告诉你那是什么,甚至还能为它写一首诗。这个被称为“视觉-语言模型”(VLM)的机器人非常厉害,因为它能同时理解图片和文字。但就像任何聪明的小孩一样,它也有弱点:它很容易被欺骗。如果有人在图片中加入一些微小的、肉眼看不见的“噪声”——比如让几个像素仅仅移动了极小的距离——机器人可能会突然把熊猫误认为是一个烤面包机,或者把猫误认为是一辆汽车。这被称为“对抗性攻击”(adversarial attack),这是一个大问题,因为我们希望这些机器人在现实世界中是安全且可靠的。
为了解决这个问题,科学家们一直在教机器人通过练习这些带有陷阱的图片来提高自己,这个过程叫做“对抗训练”(adversarial training)。这就像是在教一个武术学生通过与搭档对练来学习如何格挡出拳。你即将阅读的这篇论文探讨了一个迷人的发现:教机器人格挡的方法并不只有一种。有些老师侧重于记忆精确的招式(学习识别特定的词汇),而另一些老师则侧重于无论发生什么都能保持平衡(保持图片的特征稳定)。问题在于,一个擅长记忆招式的学生可能会在战斗变化时摔倒;而一个擅长保持平衡的学生可能会忘记招式的具体名称。这篇论文提出了一个简单但充满力量的问题:如果我们能兼得这两者的优点呢?
两个专家与神奇胶水的传说
在人工智能安全领域,研究人员一直在训练“专家”来增强视觉-语言模型的抗攻击能力。但问题在于:这些专家有点像特长突出的运动员。其中一类专家,我们称之为**“文字达人”**,他们非常擅长将图片与特定的文本描述进行匹配。如果你给他们看一张熊猫的照片并问:“这是熊猫吗?”,他们会表现得非常稳健。但如果你给他们看一种他们从未见过的动物,他们可能会踉跄,因为他们过度依赖于记忆中的文本。
另一类专家,被称为**“稳手专家”**,他们专注于保持图片本身看起来不变,即使有人试图破坏它。他们非常擅长处理未见过的动物,因为他们不太在意具体的词汇,他们只知道什么是“类似猫的形状”。然而,在利用文本线索识别熟悉动物时,他们的表现并不够敏锐。
长期以来,科学家们尝试通过先训练一个专家,再训练另一个,最后尝试将它们融合在一起的方法来解决这个问题。但这就像是在粘土还是湿的时候试图把两种不同类型的粘土粘在一起;它们要么会互相拉开,要么最终的结果是一个什么都不擅长的混乱团块。
迎来 CARE:协作教练
这篇论文的作者 Nguyen Duc Thai 及其团队决定尝试一种不同的方法。他们没有先训练一个专家再训练另一个,而是构建了一个名为 CARE 的框架(基于嵌入对齐的协作对抗鲁棒性微调)。你可以把 CARE 想象成一位出色的教练,他把“文字达人”和“稳手专家”放在同一个健身房里,让他们并肩作战、共同训练。
以下是神奇之处是如何发生的:
- 共同热身: 在专家开始各自的专项训练之前,他们会共享一个“通用扰动”。想象一下,他们都看着同一张略微扭曲的图片来感受麻烦所在。这有助于他们在同一个起跑线上开始。
- 专项训练: “文字达人”练习将扭曲的图片与正确的文本进行匹配。“稳手专家”则练习确保图片的形状不会发生太大变化。
- 秘密握手(协调化): 这是最重要的部分。在训练过程中,教练强迫他们互相交流。“文字达人”会对“稳手专家”说:“嘿,看看我是如何匹配文本的!”而“稳手专家”会对“文字达人”说:“嘿,看看我是如何保持图片稳定的!”他们实时交换这些知识。这防止了他们偏离得太远,并确保他们能从彼此的优势中学习。
- 最终融合: 在一天结束时,教练将他们的思维融合在一起,变成一个超级专家。这个新模型不仅仅是简单的混合;它是一个统一的大脑,既懂得如何匹配单词,又懂得如何保持图片稳定。
他们的发现
团队在著名的 ImageNet 数据集和许多其他复杂的图片集上测试了这种新方法。结果非常酷:
- 击败专家: 新的 CARE 模型比单独的“文字达人”更好,也比单独的“稳手专家”更好。事实上,当攻击强度较大(扰动大小为 )时,CARE 比“文字达人”(TeCoA)高出约 2%,比“稳手专家”(FARE)高出近 8%。
- 应对未知: CARE 模型不仅在已知动物上表现更好,在猜测新动物方面也表现出色。“稳手专家”通常在处理新事物时胜出,而“文字达人”通常在处理熟悉事物时胜出。CARE 成功做到了两者兼顾。
- 现实任务: 他们还在诸如图片描述生成和回答相关问题等任务上测试了该模型。即使图片受到攻击,CARE 也能比其他方法更频繁地给出正确答案。例如,在一个需要识别图片中“热狗”的任务中,即使在受到攻击时,CARE 也能正确识别出“热狗”,而其他方法有时会产生混淆。
卓越的代价
当然,这种团队合作也是有代价的。同时训练两个专家需要更多的计算能力。论文指出,训练 CARE 的时间大约是训练单个专家的 1.5 倍(83 小时对比 48-50 小时),并且使用了更多的内存(52.6 GB 对比 25-29 GB)。然而,作者建议,通过一些巧妙的工程手段,例如在数据使用后立即删除临时数据,可以使内存使用量保持在可控范围内。
底线
这篇论文表明,旧的思维方式——选择一种策略并坚持下去——可能过于局限。通过让不同类型的 AI 专家进行协作并学习彼此的优势,我们可以构建出更难被欺骗的模型。作者并没有声称这是解决所有 AI 安全问题的最终方案,但他们展示了这种“协作式”方法是一个非常具有前景的方向。这提醒我们,有时为了实现真正的鲁棒性,你不仅需要强大,还需要能够与他人协作。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。