← 最新论文
🤖 AI

SS-TPT: Stability and Suitability-Guided Test-Time Prompt Tuning for Adversarially Robust Vision-Language Models

该论文提出了 SS-TPT,一种用于视觉语言模型的测试时提示微调方法,该方法通过利用稳定性与适用性评分来评估增强视图,从而引导自适应与推理过程,以此提升对抗鲁棒性与效率,并实现优于现有最先进方法的鲁棒性与吞吐量权衡。

原作者: Sunoh Kim, Daeho Um

发布于 2026-06-08
📖 1 分钟阅读☕ 轻松阅读

原作者: Sunoh Kim, Daeho Um

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你有一位非常聪明、博学多才的图书管理员(AI 模型),即使没有事先接受过特定示例的训练,也能仅凭观察照片就识别出其中的物体。这位管理员工作出色,但如果有人在照片上偷偷涂抹上一块极小的、几乎看不见的污迹(“对抗性攻击”),或者照片看起来与图书馆里的书大不相同(“分布偏移”),他就会感到困惑。

为了帮助图书管理员做出更好的决策,之前的方法尝试向他展示许多个同一照片的略微不同的版本(比如向他展示一张原图、一个模糊的版本、一个变亮的版本以及一个旋转的版本)。其核心思想是:如果图书管理员对所有这些版本都达成一致的答案,那么他一定是正确的。

问题所在:
展示过多的版本速度太慢了。这就像是仅仅为了判断一本书是否是推理小说,就要让图书管理员读 63 个不同的副本一样。这太耗时了,会导致图书馆积压大量工作。而且,如果其中一个副本是“坏”副本(被攻击者扭曲了),即使管理员正在看另外 62 个好的副本,也可能会被这个坏副本搞糊涂。

解决方案:SS-TPT
作者们创造了一种名为 SS-TPT(稳定性与适用性引导的测试时提示微调)的新方法。他们不再只是向图书管理员展示更多个副本,而是教会图书管理员如何判断每个他看到的副本的质量

他们为每一个版本的照片准备了两份简单的“成绩单”:

  1. 稳定性(“摇晃测试”):
    想象一下,你递给图书管理员一张照片并问:“这是什么?”然后,你轻轻摇晃这张照片或稍微改变一下光照(弱增强),再问一次。
  • 高稳定性: 图书管理员两次都说:“这是一只猫。”他表现得既自信又一致。
  • 低稳定性: 他先说:“这是一只猫,”接着说“这是一只狗,”然后又说“这是一个烤面包机。”他感到很困惑。
  • 教训: 如果一个视角随着微小的推动就轻易改变主意,那它可能是一个糟糕的视角。
  1. 适用性(“人群测试”):
    想象一下,图书管理员将所有的照片版本一起放在一个心理“特征空间”中(即事物看起来相似程度的地图)进行观察。
  • 高适用性: 这个照片版本正站在一群朋友中间。大家看起来都很相似。
  • 低适用性: 这个照片版本独自站在一片空旷的田野里,远离其他人。它是一个离群值。
  • 教训: 如果一个视角是个格格不入的异类,且不符合大众,那么它很可能已被损坏或造假。

实际运作方式:
SS-TPT 系统利用这两个分数来充当智能过滤器:

  • 在学习阶段(适配): 当图书管理员试图根据新照片调整自己的思维时,系统会告诉他:“忽略那些不稳定或孤独的视角。只听从那些稳定且融入人群的视角。”这能防止图书管理员从“坏”副本中学习。
  • 在最终猜测阶段(推理): 当需要给出最终答案时,系统并不只是简单地对所有猜测取平均值。相反,它会给值得信赖的视角更大的声音,而给不可靠的视角细微的耳语

结果:
该论文声称这种方法是一个游戏规则的改变者,因为:

  • 它很快: 你不需要向图书管理员展示 63 个版本。只需 15 个版本,你就能获得极佳的结果,且系统的运行速度比之前的方法快了约两倍。
  • 它更强: 即使使用较少的视角,图书管理员也更难被攻击者欺骗。在处理棘手的受攻击照片时,他们实现了比以往任何方法都更高的准确率。
  • 它很聪明: 它不仅仅是在计票,它还在评判投票者的质量

简而言之,SS-TPT 阻止了 AI 在照片的坏副本上浪费时间,转而专注于那些可靠的副本,从而使其更快、更聪明,且更难被愚弄。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →