← 最新论文
🤖 AI

Calibrating Uncertainty for Zero-Shot Adversarial CLIP

本文提出了一种针对 CLIP 的新型对抗性微调方法,该方法将输出重新参数化为狄利克雷浓度参数,旨在同时恢复校准后的不确定性并保持鲁棒的零样本准确率,从而解决对抗性扰动通常会抑制不确定性并导致过度自信这一关键问题。

原作者: Wenjing Lu, Zerui Tao, Yuning Qiu, Dongping Zhang, Yang Yang, Qibin Zhao

发布于 2026-06-02
📖 1 分钟阅读☕ 轻松阅读

原作者: Wenjing Lu, Zerui Tao, Yuning Qiu, Dongping Zhang, Yang Yang, Qibin Zhao

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是关于论文《Calibrating Uncertainty for Zero-Shot Adversarial CLIP》的解释,使用了简单的语言和日常类比。

问题所在:过度自信的骗子

想象你有一位非常聪明、博学多才的图书管理员(这就是 CLIP,即 AI 模型)。这位管理员读过数百万本书,即使从未被明确教导过这些特定的图片,也能通过看图猜出图片的内容。这被称为“零样本”(zero-shot)学习。

然而,这位管理员有一个弱点:对抗性攻击(Adversarial Attacks)
把对抗性攻击想象成图片上一个微小的、几乎看不见的污点。对于人类来说,图片看起来完全一样。但对于这位管理员来说,那个微小的污点会彻底改变图片的含义。

研究发现了一个可怕的模式:

  1. 错误: 当管理员看到一张有污点的图片时,他们经常会猜错。
  2. 危险: 更糟糕的是,他们甚至会以 100% 的信心去猜错。他们不会说:“嗯,我不确定。” 他们会说:“我百分之百确定这是一只熊猫,”而实际上它是一只狗。

在现实世界中,这就像是一个 GPS 在镜头被鸟飞过的瞬间,就自信地告诉你开车冲下悬崖。模型不仅猜错了,它还失准了(miscalibrated)。它认为自己知道的比实际知道的要多。

旧的解决方案:“单锚点”方法

之前的研究人员试图通过教导管理员看到有污点的图片后说“这是一只狗”来修复这个问题。他们通过将管理员的注意力严格地拉向“狗”这个标签来实现这一点。

该论文认为,这就像是在教学生背诵答案解析,而不是理解问题之间的关系。

  • 缺陷: 它强迫模型对特定答案保持正确,但忽略了语境(context)。它没有教会模型意识到:“等等,这张有污点的图片看起来有点像狼,也有点像狐狸,所以我应该表现出不确定性。”
  • 结果: 模型虽然能抵御污点带来的影响,但也失去了表达怀疑的能力。即使在感到困惑时,它依然过度自信。

新的解决方案:UCAT(“证据量表”方法)

作者提出了一种名为 UCAT(不确定性校准对抗微调)的新方法。以下是它的工作原理,使用了一个比喻:

1. 狄利克雷分布(Dirichlet Distribution,即“信心量表”)
新方法不再仅仅选择一个答案,而是要求管理员同时为每一个可能的答案分配一个“信心得分”。

  • 想象管理员有一个沙桶(证据)。
  • 对于一张清晰的狗的照片,他们会将 90% 的沙子倒入“狗”的桶中,并将极少量的沙子倒入“狼”和“猫”的桶中。
  • 对于一张模糊、令人困惑的图片,一个聪明的管理员应该将沙子更均匀地分散开,或者承认:“我没有足够的沙子来确定。”

2. 修复方法:对齐沙桶
该论文的秘诀在于一个数学技巧。他们将模型的输出不仅视为一个猜测,还视为一个 狄利克雷分布(一种描述这些沙子如何在桶中分布的高级方式)。

当模型看到一张有污点的图片(对抗样本)时,旧的方法只是试图把沙子强行塞进“狗”的桶里。
UCAT 做了不同的事情: 它观察清晰图片和有污点图片的沙子分布,并试图让它们匹配。

  • 如果清晰的图片有一个明确的“狗”桶,那么有污点的图片也应该有一个“狗”桶,但由于图片很乱,它的沙子会更少(信心更低)。
  • 它强迫模型说:“我觉得它是狗,但因为这张图片很奇怪,所以我只有 60% 的把握,而不是 99%。”

为什么这很重要

论文表明,通过教导模型去对齐这些“沙桶”(分布)而不是仅仅强迫一个单一答案,可以实现以下效果:

  1. 保持聪明: 它仍然在大多数情况下能猜对。
  2. 保持谦逊: 当受到攻击或感到困惑时,它会承认不确定性。它不再是一个“过度自信的骗子”。
  3. 处理歧义: 如果一张图片可能代表两件事(例如多标签图像),模型能够理解这种细微差别,而不是强行做出单一、僵化的选择。

总结

作者发现,目前的 AI 模型就像是在遇到难题时会胡乱猜测的过度自信的学生。他们的新方法 UCAT 教会了模型如何衡量自己的“证据”。如果证据是摇摆不定的(由于攻击),模型就会降低其信心得分。这使得 AI 更安全、更可靠,不仅是因为它能猜对,更是因为它知道自己什么时候“不知道”。

他们在 16 个不同的图像数据集上进行了测试,发现该方法在保持高准确率的同时,显著提升了 AI 处理这些棘手的“有污点”图片的能力。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →