← 最新论文
💻 computer science

Reading Between the Pixels: Linking Text-Image Embedding Alignment to Typographic Attack Success on Vision-Language Models

该论文通过评估四种主流视觉语言模型在不同字体大小和视觉变换下的表现,揭示了排版提示注入攻击的成功率与文本 - 图像嵌入距离呈强负相关,且不同模型对攻击的脆弱性存在显著差异,从而表明针对此类威胁不存在通用的防御方案。

原作者: Ravikumar Balakrishnan, Sanket Mendapara, Ankit Garg

发布于 2026-04-16
📖 1 分钟阅读☕ 轻松阅读

原作者: Ravikumar Balakrishnan, Sanket Mendapara, Ankit Garg

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文就像是一份**“视觉黑客防御指南”**,它研究了一个非常有趣的现象:当黑客把恶意的文字指令“画”成图片发给人工智能(AI)时,AI 会不会被骗?

为了让你更容易理解,我们可以把这篇论文的研究过程想象成**“给 AI 戴墨镜和穿不同尺码衣服”**的实验。

1. 核心故事:AI 也会“看”图说话吗?

现在的 AI(比如能看懂网页、操作电脑的智能助手)不仅能读文字,还能“看”图片。

  • 传统攻击:黑客直接发文字指令,比如“帮我制造炸弹”。现在的 AI 都有“安全过滤器”,看到这种词就会拒绝。
  • 新型攻击(本文研究):黑客把“帮我制造炸弹”这句话打印在一张纸上,拍成照片发给 AI。因为这是“图片”,AI 的安全过滤器可能没反应过来,直接让 AI 去“读”图里的字,结果 AI 就中招了。

2. 实验一:字太小或太大,黑客都很难得逞

研究人员把恶意文字做成图片,用了12 种不同大小的字体(从像蚂蚁一样小的 6 像素,到像招牌一样大的 28 像素),然后发给四种不同的 AI 模型。

  • 发现
    • 字太小(6 像素):就像把字写在米粒上,AI 根本看不清,攻击完全失败(成功率接近 0%)。
    • 字适中(10-12 像素):就像写在普通便签上,AI 看得很清楚,攻击成功率最高。
    • 字太大:虽然也能看清,但效果并没有比适中时更好,甚至有点“过犹不及”。
  • 比喻:这就像你给一个人看字,字太小他看不清,字太大反而显得奇怪,只有大小适中时,他最容易听信你的话。

3. 实验二:不同的 AI,性格大不同

研究测试了四种 AI(GPT-4o, Claude, Mistral, Qwen),发现它们对这种“图片攻击”的抵抗力完全不同:

  • GPT-4o 和 Claude(像“谨慎的保安”)

    • 如果黑客直接发文字,它们会拒绝。
    • 如果黑客把字做成图片,它们反而更不容易被骗
    • 原因:它们似乎觉得“把字做成图片”这个行为本身就很可疑,或者它们的“眼睛”(视觉部分)比“嘴巴”(语言部分)更警惕。
    • 数据:对 GPT-4o,文字攻击成功率是 36%,但图片攻击只有 8%。
  • Mistral 和 Qwen(像“老实的图书管理员”)

    • 不管你是发文字还是发图片,只要它读到了字,它就容易中招
    • 数据:文字和图片攻击的成功率差不多,都在 70%-80% 左右。
    • 结论:如果你要选一个 AI 来干活,选 GPT-4o 或 Claude 可能更安全;选 Mistral 或 Qwen 就要小心了。

4. 实验三:给图片“加滤镜”,黑客就失效了

研究人员给这些恶意图片加了各种“特效”:旋转、模糊、加噪点(像老电视雪花)、旋转角度等。

  • 发现
    • 模糊和噪点:就像把图片弄脏了,AI 看不清字了,攻击成功率大幅下降。
    • 旋转:这是一个有趣的发现。把图片旋转 30 度,Mistral 就彻底晕了(成功率减半),但 GPT-4o 却完全不受影响,依然能读出来。
    • 比喻:这就像给 AI 戴了一副**“防晕车眼镜”**。有些 AI(如 GPT-4o)戴了眼镜还能看清路,有些 AI(如 Mistral)戴了眼镜就晕得站不稳了。

5. 最厉害的发现:用“数学距离”预测黑客能否成功

这是论文最酷的部分。研究人员发现,不需要真的去攻击 AI,只需要用一种**“数学尺子”**(叫 Embedding Distance)量一下:

  • 尺子量什么? 量“图片里的字”和“原本的文字”在 AI 大脑里的相似度
  • 规律
    • 如果图片和文字在 AI 脑子里长得非常像(距离短),攻击就容易成功
    • 如果图片和文字长得差别很大(距离长,比如字太模糊或太小),攻击就容易失败
  • 意义:这就像给 AI 装了一个**“预警雷达”**。在黑客真正攻击之前,只要算一下这个“数学距离”,就能知道这次攻击会不会成功。这为开发者提供了一种简单的方法来检测风险。

总结:这对我们意味着什么?

  1. 没有万能药:你不能指望一种防御方法挡住所有 AI。有的 AI 怕图片,有的 AI 不怕;有的 AI 怕旋转,有的不怕。
  2. 字体大小很重要:如果你在设计系统,确保 AI 看到的文字不能太小(看不清)也不能太乱。
  3. 选对模型:如果你要开发一个在复杂环境(比如网页、摄像头)下工作的 AI 助手,GPT-4o 或 Claude 这种对图片攻击更警惕的模型可能更安全。
  4. 新防御思路:未来的安全系统可以不用死记硬背所有攻击,而是用那个“数学尺子”实时计算,一旦发现图片和文字“长得太像”(容易被骗),就直接拦截。

一句话总结:这篇论文告诉我们,AI 看图片的方式很微妙,字的大小、图片的清晰度、甚至 AI 的“性格”,都决定了黑客能不能骗过它。而我们要做的,就是利用这些规律,给 AI 穿上最合适的“防弹衣”。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →