← 最新论文
💬 NLP

Towards Robustness against Typographic Attack with Training-free Concept Localization

本文提出了一种新颖的、无需训练的机械可解释性方法,该方法能够识别并干预负责编码词汇信息的特定视觉 Transformer 电路,从而在无需额外训练的情况下,显著增强基于 CLIP 的大规模视觉语言模型针对排版攻击的鲁棒性。

原作者: Bohan Liu, Wenqian Ye, Guangzhi Xiong, Zhenghao He, Sanchit Sinha, Aidong Zhang

发布于 2026-07-03
📖 1 分钟阅读☕ 轻松阅读

原作者: Bohan Liu, Wenqian Ye, Guangzhi Xiong, Zhenghao He, Sanchit Sinha, Aidong Zhang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

问题所在:猫身上的“鹅”

想象一下,你有一个非常聪明的保安(一个被称为 CLIP 的计算机模型),他的工作是观察图片并告诉你它们是什么。如果你给他看一张猫的照片,它会说“猫”。

然而,这个保安有一个奇怪的盲点。如果有人用记号笔在猫的脸上写下大大的 “GOOSE”(鹅)这个词,保安就会感到困惑。他不再看到猫,而是突然认为:“噢,那是一只鹅!”

这被称为**“排版攻击”(Typographic Attack)**。这个保安太擅长阅读文字了,以至于他忽略了实际的图像。这在现实生活中是非常危险的(例如对于自动驾驶汽车),如果一个“停止”标志被涂在了“限速30”标志之上,可能会让汽车误以为可以加速行驶,从而导致车祸。

解决方案:一位“无需训练”的侦探

本文作者的目标是修复这个问题,而无需重新教导这个保安(那需要耗费大量的时间和数据)。相反,他们扮演了机械侦探的角色。他们并没有试图改变保安的性格;他们只是窥视其大脑内部,观察混乱究竟发生在何处,然后调低了那个特定部分的音量。

他们称之为**“无需训练的概念定位”(Training-free Concept Localization)**。

他们是如何做到的:“随机彩票”

为了找到问题所在,作者利用了模型大脑构建方式的一个巧妙技巧。

  1. 大脑结构: 该模型使用一种称为**多头自注意力机制(Multi-Head Self-Attention)**的系统。你可以把它想象成一个由 12 个不同侦探(称为“头”)组成的团队,他们在处理同一个案件。每个侦探都从略微不同的角度观察图片。
  2. 问题所在: 其中一些侦探对文字非常痴迷。当他们看到“GOOSE”这个词时,他们会大喊:“这是一只鹅!”声音大到让其他正在观察毛发和胡须的侦探无法被听到。
  3. 彩票券: 通常,要找出哪个侦探对文字痴迷,你需要训练他们数周。作者意识到他们可以跳过训练。他们把搜索过程看作一场彩票抽奖
    • 他们向模型的脑部投掷了数千个随机的“概念飞镖”(随机向量)。
    • 大多数飞镖都落空了。但偶尔,一个飞镖会击中大脑中一个特定的“插槽”,而当模型看到文本时,这个插槽就会亮起。
    • 由于模型的脑部结构是特定的,他们不需要投掷数百万个飞镖。他们只需要在正确的“房间”(大脑的一个较小部分)里投掷足够的飞镖,就能找到那张中奖的彩票。

修复方法:让嘈杂的侦探闭嘴

一旦找到了那些对文字痴迷的特定“侦探”(注意力头),他们并没有解雇他们,而只是将他们静音

  • 对于简单的图像分类: 他们调节了那些特定侦探的音量旋钮,让他们无法叫得那么大声。这样,其他观察实际情况(看到真正的猫)的侦探终于能被听到了。
  • 对于复杂的 AI(LVLMs): 他们直接完全关闭了这些特定的侦探(零消融/zero ablation),使他们无法干扰答案。

结果:一位更聪明的保安

作者在许多不同的模型上测试了这种方法,从小型模型到庞大的模型。

  • 修复前: 如果你给它看一张上面写着“GOOSE”的猫的照片,模型经常会被迷惑。
  • 修复后: 模型忽略了“GOOSE”这个词,并正确识别出了猫。
  • 速度与成本: 最棒的部分是,这种修复是瞬间完成的。他们不需要重新训练模型,也不需要额外的训练数据。这就像是在机器中发现了一根松动的电线并用胶带把它粘好,而不是重建整台机器。

为什么这很重要

作者证明了这种方法不仅适用于简单的图像识别,也适用于大型视觉语言模型(LVLMs)——即那些能够观察图片并回答问题的精巧 AI 聊天机器人。

当他们将这种“静音侦探”的修复方法应用于这些聊天机器人时,这些机器人回答有关图像的问题变得更加出色,即使图像中有干扰性的文字。它们终于可以观察图片并说:“那是一只猫”,而不是被上面写的“鹅”字所分心。

简而言之: 这篇论文找到了一种方法,可以窥视 AI 模型内部,识别出那些会被文字欺骗的部分,并让它们保持沉默,从而在无需重新训练的情况下,让 AI 变得更加安全和可靠。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →