Steal the Patch Size: Adversarially Manipulate Vision-Language Models
本文介绍了“窃取补丁大小”(Steal the Patch Size),这是一种利用视觉语言模型中任务级侧信道准确率下降来恢复私有分词器配置(如补丁大小和预处理流水线)的黑盒攻击,从而实现针对性的对抗性操纵。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图猜出一位名厨的秘密食谱,但你不能看到厨房、食材,也看不到厨师的笔记。你只能点这道汤,品尝它,然后问:“这味道如何?”
这篇论文描述了一个聪明的技巧,研究人员通过“品尝”现代 AI 图像解析器(称为视觉语言模型)的“汤”,来弄清楚它们的秘密配方。具体来说,他们成功窃取了两个隐藏细节:
- “分块大小”(Patch Size): AI 在观察图像之前,是如何将图像切分成微小的正方形小块(tiles)的。
- “预处理”(Preprocessing): AI 是将每张图像都挤压成一个特定尺寸,还是根据它们原始形状的不同进行差异化处理。
以下是他们是如何做到的,使用了简单的类比。
“草莓”问题
你知道为什么有些人很难数出单词“strawberry”中有多少个字母“r”吗?因为大脑看到的是整个单词,而不是单个字母。
这篇论文发现,AI 模型在图像处理上也存在类似的问题。大多数 AI 模型并不会将图片视为连续的图像;它们会将图像切成一个网格状的小方块(patches),就像马赛克一样。如果 AI 将图像切成 16x16 像素的正方形,它就会把每个方块视为一个单一的“词”(或 token)。
陷阱:网格游戏
研究人员创建了一个简单的游戏来戏弄 AI。他们向 AI 展示一张彩色网格(类似于棋盘格)的图像,并问道:“这个网格中有多少个方块?”
人类可以瞬间回答这个问题。但 AI 开始表现出一种非常奇怪且可预测的失败模式:
- 当网格方块的大小为特定数值时,AI 能答对。
- 当网格方块稍微变大或变小时,AI 会出错。
- 当网格方块的大小与 AI 隐藏的“切割块”大小完全一致时,AI 会彻底“失明”并表现得极其糟糕。
为什么? 想象一下,如果 AI 的切割块与网格线完美对齐。AI 看向其中一个方块时,只会看到一种纯色。它永远看不到颜色变化的“线”,因为那条线恰好落在两个方块之间。这就像试图通过只看砖块而不看灰浆,来观察砖墙的边缘一样。AI 失去了计数的能力。
劫案:窃取秘密
通过测试成千上万种不同的网格尺寸,研究人员观察到了这些“盲点”。
- 寻找分块大小: 他们注意到,每当网格大小是某个特定数字(例如 14, 28, 42)的倍数时,AI 就会失败。这告诉他们,AI 隐藏的“切割块”宽度正好是 14 像素。
- 寻找缩放规则: 一些 AI 模型会在切块之前,将每张图像挤压成一个固定尺寸(如 512x512)。而另一些模型则会根据不同情况进行处理。
- 如果 AI 会进行挤压,那么当你仅仅改变网格大小时,“盲点”就会消失。
- 但研究人员加入了一个技巧:他们在更大的空白画布(填充/padding)中放置网格。通过改变这个空白画布的大小,他们可以迫使 AI 以可预测的方式挤压图像。这揭示了 AI 挤压图像的具体尺寸(例如 512 像素)。
结果:他们知道了秘密
利用这种方法,研究人员成功猜出了 GPT-4o、Claude 和 Qwen 等主流 AI 模型的隐藏设置。他们不需要破解代码;他们只是提出了正确的问题,并观察 AI 在哪里跌倒。
为什么这很重要?(“针对性”攻击)
论文表明,了解这些秘密可以实现一种“外科手术式”的攻击。
想象一下,你想诱骗某个特定的 AI 将停止标志看成限速标志,但你不想误伤其他的 AI。
- 没有秘密时: 你只能做一个通用的诡计,这可能对两个 AI 都有效,也可能对两个都不起作用。
- 有了秘密后: 你确切知道第一个 AI 是如何切割图像的。你可以创造一个专门针对该特定切割风格的诡计,而这个诡计对于第二个(采用不同切割方式的)AI 来说看起来完全正常。
这就像你知道某个特定锁芯的弹片宽度是 14mm。你可以打造一把只能打开那把锁的钥匙,同时让所有其他锁都保持原样。
总结
论文证明了 AI 模型处理图像的“不可见”方式留下了指纹。通过询问关于网格的简单问题,研究人员可以逆向工程出模型的内部设置。这揭示了 AI 如何看待世界的“实现细节”实际上是秘密钥匙——如果被窃取,攻击者可以针对这些模型制造出极具针对性且危险的诡计。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。