Resolution Thresholds in VLM Detection of Harmful ASCII Art Across Construction Modes and Languages
本文研究了图像分辨率如何影响大型视觉语言模型在不同构建模式和语言下检测有害 ASCII 艺术的能力,揭示了检测率在超过特定分辨率阈值后会急剧下降,且基于单词的设计被证明最难被审核。
原始论文根据 CC0 1.0(http://creativecommons.org/publicdomain/zero/1.0/)发布到公有领域。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你有一位非常聪明的保安(一个视觉语言模型,简称 VLM),他的工作是观察图片,如果看到任何坏事就大喊“停!”通常情况下,这位保安在识别坏词或暴力图像方面表现出色。
诡计:“美好词汇的马赛克”
想象一下,有一个像“HATE”(恨)这样的大写粗体词。保安一眼就能看到它并将其拦截。
现在,想象黑客用马赛克的方式构建了这个词“HATE”。他们不是使用黑色墨水,而是使用成千上万个微小的、无害的词汇,比如“LOVE”(爱)、“PEACE”(和平)和“SMILE”(微笑)来组成“HATE”这个形状。
- 如果保安看得仔细: 他们会看到无数个微小的“LOVE”和“PEACE”单词。他们会想:“哦,这是一张很温馨的美丽图片!”然后放行。
- 如果保安退后一步: 这些微小的单词会模糊在一起,保安突然看到了巨大的、可怕的“HATE”形状。
这篇论文研究了究竟保安需要退后多少步(我们需要将图像缩小多少)才能看到隐藏的危险,以及是否有些保安比其他的更擅长这一点。
实验:“缩放测试”
研究人员创建了一个大规模测试,包含 8 种不同类型的“马赛克”(从简单的色块到复杂的正面词汇)和 8 个不同的安全保安(AI 模型)。他们使用两种语言进行了测试:英语和中文。
他们制作了“坏”图片,并以 10 种不同的尺寸展示给保安看,范围从巨大的、清晰无比的广告牌(高分辨率)到微小的、模糊的邮票(低分辨率)。
他们的发现
1. “模糊”是关键
最重大的发现是,高分辨率图像实际上对安全性最不利。
- 当图像巨大且清晰时,保安会被微小的、美好的词汇(如“LOVE”、“PEACE”)分散注意力,从而忽略了巨大的坏形状。
- 当图像被缩小(模糊)后,那些微小的美好词汇会融合在一起。保安无法再阅读单个单词,于是他们的思维转向观察整体形状。突然间,“HATE”的形状显现了出来,保安抓住了它。
2. 有些马赛克更难被发现
并非所有的诡计都一样。
- 容易被抓获: 如果坏词是由简单的色块或表情符号组成的,保安很容易抓住它们,即使在图像很大时也是如此。
- 难以被抓获: 如果坏词是由积极的英文单词(如“LOVE”和“PEACE”)组成的,这极其难以被抓获。即使图像很大,保安也会因为被这些美好的词汇分散注意力,几乎从未发现那个坏的形状。这是“终极越狱”。
3. 并非所有保安都一样
研究人员测试了 8 个不同的 AI 模型。
- 目光敏锐的保安: 一些模型(如 Gemini 和 Kimi)非常擅长通过“退后一步”来看大局。即使在图像尺寸还比较大时,它们也能捕捉到坏的形状。
- 容易分心的保安: 其他模型(如 Mistral 和 Llama)很容易被迷惑。它们会沉溺于阅读微小的美好词汇,无论你如何缩小图像,它们几乎永远无法发现坏的形状。
- 奇特的家伙: 一个模型(Grok)很奇怪;它并不在意图像的大小。它的表现始终处于中等水平,既没有随着图像变化而变好,也没有变差。
4. 语言的惊喜
研究人员想知道,由中文词汇组成的坏形状,中国制造的保安是否会更擅长发现;以及西方制造的保安是否会更擅长处理英文单词。
- 在低分辨率(模糊)下: 中国制造的保安在发现由中文词汇组成的坏形状方面表现得更好。当细节变得模糊时,它们似乎能更好地理解“大局”。
- 在高分辨率(清晰)下: 情况反转了!中国制造的保安会被单个中文字符分散注意力(阅读那些美好的词汇),从而无法看到坏的形状。而那些不太关注阅读单个中文字符的西方保安则保持稳定,继续发现坏的形状。
核心结论
这篇论文并没有发明一种新的阻止黑客的方法。相反,它扮演了一个诊断工具的角色。它告诉我们:
- 分辨率很重要: 如果你想让你的 AI 保安捕捉到这些特定的诡计,你可能需要先缩小图像,这样保安就会停止阅读微小的单词,转而开始观察大形状。
- 有些诡计是无法战胜的: 目前,将坏词隐藏在积极的英文单词之中是一个非常强大的手段,大多数 AI 保安都看不出来。
- 并非一种方案适用于所有情况: 使用不同模型的系统,其“盲点”也各不相同。使用一种模型的系统可能会错过另一种模型能捕捉到的东西。
简而言之,论文表明模糊图像是帮助 AI “见森林而非迷失在树木中”的一种简单方法,但有些“森林”(例如由积极词汇组成的森林)仍然非常难以识别。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。