← 最新论文
💻 computer science

Improving Adversarial Robustness of Zero-Shot CLIP with Confidence-Aware Weighting

本文提出了一种置信度感知加权(Confidence-Aware Weighting, CAW)方法,这是一种通过置信度感知损失优先处理不确定样本,并利用特征对齐保持语义一致性,从而在鲁棒性和内存效率方面均优于现有最先进方法的、旨在增强零样本 CLIP 模型对抗鲁棒性的新颖方法。

原作者: Nikoo Naghavian, Mostafa Tavassolipour

发布于 2026-07-28
📖 1 分钟阅读☕ 轻松阅读

原作者: Nikoo Naghavian, Mostafa Tavassolipour

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一个计算机能同时“看见”并“阅读”的世界,它们从整个互联网中学习,从而理解一张金毛寻回犬的照片与“一只快乐的狗”这些文字相匹配。这就是视觉-语言模型(如著名的 CLIP)的魔力。它们就像超级聪明的学生,读过网上所有的书,看过所有的照片,这使得它们即使从未见过某种特定类型的动物,也能猜出图片中的内容。然而,就像人类可能会被巧妙的错觉所欺骗一样,这些 AI 模型也有一个隐秘的弱点。如果你在图像中添加微量且肉眼不可见的“噪声”——就像撒入几粒数字沙子,人类眼睛无法察觉——计算机可能会突然完全陷入混乱,把一只猫误认为是一个烤面包机。这被称为“对抗性攻击”(adversarial attack),这是一个重大问题,因为这意味着这些强大的工具在现实世界中很容易被愚弄。

科学家们正在提出的核心问题是:我们如何在让模型变得更强大的同时,又不让它忘记已经掌握的所有知识?通常,为了教计算机具备鲁棒性(稳健性),你必须在训练期间向它展示成千上j个这种棘手的、带有噪声的图像。但问题在于:如果你对每一张图像都一视同仁,计算机就会浪费时间去研究那些它已经掌握的简单题目,而可能仍然错过那些真正需要帮助的难题。这就像一位老师在整堂课中都在复习学生已经完美解决过的数学题,却忽略了那个真正导致学生考试不及格的问题。

本论文介绍了一种名为**置信度感知加权(Confidence-Aware Weighting, CAW)**的聪明策略来解决这个问题。研究人员意识到,并非所有的棘手图像都是平等的。有些图像非常令人困惑,以至于模型几乎无法正确判断;而有些图像则只是略显摇摆不定。CAW 不再给每张困惑的图像分配相同的关注度,而是像一位聪明的导师,会对那些挣扎得最厉害的学生给予额外的关注。

以下是该方法的工作原理,我们使用一个简单的类比:想象 AI 模型是一个正在参加考试的学生。

  1. “置信度感知”部分: 当学生答错题或感到不确定时,老师(CAW 系统)会说:“好吧,这道题很难!让我们重点关注一下这个。”它会对模型最不确定的图像给予额外的权重。如果模型对某张图像已经很有把握,老师就会说:“你已经掌握了,我们继续下一个。”这确保了模型将精力花在修复其最大的弱点上,而不是重新学习已知的内容。
  2. “特征对齐”部分: 这一部分的技巧是确保学生不会忘记之前学过的知识。当模型观察一张棘手的、带有噪声的图像时,CAW 会检查它看到的“内部图像”是否与它之前看到的“清晰图像”相匹配。这就像是在告诉学生:“即使这张照片很模糊,也要记住它仍然是一只狗,而不是一个烤面包机。”这防止了模型产生混乱并丢失其原始知识。

研究人员在包括 TinyImageNet 在内的庞大图像数据集集合上测试了这个想法,这些数据集涵盖了从宠物、花卉到医学扫描图像的 14 个不同领域。他们让这种新方法与现有的顶尖技术进行对决,使用了最强大的“攻击”手段,包括一种被称为 AutoAttack 的强大自动化测试。结果令人振奋:CAW 方法不仅在攻击中幸存了下来,而且表现得比之前的最佳方法更好。例如,在 15 个不同数据集的平均表现上,它在受到攻击时保持正确的能力比排名第二的方法提高了约 2%,同时还使用了更少的计算内存。

真正酷的一点是,该模型不仅变得更擅长抵御攻击,还变得更擅长观察正常的、清晰的图片。研究人员发现,通过专注于这些“困难”的样本,模型学会了一种更稳定的观察世界的方式。当他们观察模型如何“关注”图像的不同部分时,他们看到在训练之前,模型很容易被噪声分散注意力,去关注背景或随机像素。在使用 CAW 之后,即使图像受到攻击,模型也学会了专注于实际的物体。

简而言之,这篇论文表明,通过对哪些困惑的样本进行更有选择性的学习,我们可以构建出既更聪明又更强韧的 AI。这是朝着让视觉-语言模型在现实世界中足够可靠迈出的重要一步,因为在现实世界中,情况并不总是完美的,有时甚至会试图欺骗我们。虽然该方法目前主要集中在图像部分,并且主要针对白盒攻击(即攻击者了解模型的秘密)进行了测试,但它为在不牺牲学习新知识能力的前提下,增强 AI 的韧性开启了一扇新的大门。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →