← 最新论文
💻 computer science

Closed-Loop Bidirectional Prompting for Adversarial Robustness of Vision Language Models

本文提出了一种闭环双向提示机制,这是一种新颖的防御方法,通过在视觉和文本模态之间建立动态反馈回路以恢复跨模态语义对齐,同时利用语义锚点来约束更新并减轻特征污染,从而增强视觉语言模型的对抗鲁棒性。

原作者: Xiao Liu, Jiaxiang Liu, Boci Peng, Boren Hu, Yusong Wang, Xiwen Chen, Prayag Tiwari, Liming Zhang, Mingkun Xu

发布于 2026-05-26
📖 1 分钟阅读☕ 轻松阅读

原作者: Xiao Liu, Jiaxiang Liu, Boci Peng, Boren Hu, Yusong Wang, Xiwen Chen, Prayag Tiwari, Liming Zhang, Mingkun Xu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,将视觉 - 语言模型(VLM)视为一个由两位搭档组成的高超侦探团队:一位是视觉侦探(负责查看图像),另一位是文本侦探(负责阅读描述)。他们经过训练,能够完美协作,将图片与文字精准匹配。

然而,这些侦探容易受到对抗性攻击的侵害。想象一下,攻击者就像一位伪造大师,在照片上添加不可见的“噪声”或微小的、令人困惑的污迹。这种噪声细微到人类无法察觉,但却会欺骗视觉侦探,使其看到完全不同的东西。由于两位侦探紧密相连,如果视觉侦探陷入困惑,文本侦探也会随之困惑,导致整个团队失败。

当前防御措施的缺陷

以往保护这些侦探的尝试存在两个主要缺陷:

  1. 单向交通:大多数防御措施仅试图修复视觉侦探(通过重新训练他们)或仅修复文本侦探(通过修改他们的笔记)。他们将另一位搭档视为固定且不可改变的背景。但如果攻击者试图破坏他们之间的连接,仅修复一方是不够的。
  2. 静态笔记:某些防御措施为文本侦探提供了一份单一的、预先写好的脚本,用于每一张图像。但由于每张图像和每次攻击都不同,这种“一刀切”的脚本往往失效。

解决方案:闭环双向提示(CLBP)

作者提出了一种名为CLBP的新策略,它在两位侦探之间充当动态反馈回路。他们不再孤立工作,而是不断相互交谈,以实时纠正错误,而无需重新训练整个大脑。

以下是该过程的逐步说明,使用了一个富有创意的类比:

1. 语义锚点(“北极星”)

在侦探们开始处理一张棘手的图像之前,他们商定一个**“语义锚点”**。想象这就像是一个固定的、可靠的指南针或“北极星”。它是一个通用的、安全的描述(例如“一张 [猫] 的照片”),代表了该类真实且未被破坏的含义。

  • 为何重要:这个锚点防止侦探们迷失在混乱中。它使他们扎根于训练期间学到的原始、安全的知识。

2. 步骤 1:文本到视觉去噪(“清洁工”)

视觉侦探看着被噪声污染、受到攻击的图像并感到困惑。他们向文本侦探提问:“基于我们的北极星,这实际上应该看起来像什么?”

  • 文本侦探利用稳定的“北极星”生成一个清洁提示
  • 该提示被发送回视觉侦探,后者利用它来“过滤”噪声。这就像文本侦探递给视觉侦探一副特殊的眼镜,能够去除伪造者的污迹,使他们能够再次看到真实的图像。

3. 步骤 2:视觉到文本精炼(“编辑”)

现在,视觉侦探拥有了更清晰的画面,他们转向文本侦探说:“好的,我现在看清图像了。我当前的描述与我看到的相符吗?”

  • 视觉侦探向文本侦探发送信号。
  • 文本侦探专门针对这张图像更新他们的笔记,调整描述以匹配清理后的视觉证据。

4. 闭环完成

这两个步骤在一个快速循环中发生。文本净化视觉,视觉精炼文本。

  • 神奇之处:作者从数学上证明,这个回路是收缩的。想象一根橡皮筋:每次侦探们交谈时,他们都会将彼此拉向真相。即使他们因强烈的攻击而相距甚远,一两次这样的对话也足以让他们迅速回到正确答案。他们不会失控螺旋,而是迅速收敛。

5. 安全网:多视图聚合

为了格外保险,系统不会只查看一次图像。它会创建32 个略有不同的图像版本(就像从略微不同的角度或在不同的光照条件下拍摄 32 张照片)。

  • 它在所有 32 个版本上运行“清洁和精炼”循环。
  • 然后,它进行投票。如果 30 个版本对答案达成一致,而 2 个是异常值,系统就会忽略异常值并遵循共识。这使得攻击者很难愚弄整个团队。

为何这很重要

该论文声称这种方法更优越,因为:

  • 它是双向的:与以往仅修复一方的方法不同,CLBP 让图像和文本互相修复。
  • 它高效:它不需要重新训练庞大的 AI 模型(这既慢又昂贵)。它只是在现有模型之上添加了一个小型的、智能的对话层。
  • 它无处不在:作者在 11 个不同的数据集上测试了该方法(从识别猫和汽车,到分析卫星图像和纹理)。在几乎所有情况下,CLBP 在抵御攻击方面都比以往的方法更出色,同时在正常、干净的图像上仍保持准确。

总结

CLBP想象成摄影师和标题撰写者之间的自我纠正对话。当伪造者试图用假照片欺骗摄影师时,标题撰写者利用其对真相的了解,帮助摄影师识破假象。然后,摄影师帮助标题撰写者写出完美的描述。他们不断交谈,直到双方都就真相达成一致,忽略噪声。这一过程发生得如此迅速且有效,以至于伪造者的诡计根本无法奏效。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →