Reading Between the Pixels: An Inscriptive Jailbreak Attack on Text-to-Image Models
该论文提出了一种名为 Etch 的黑盒攻击框架,通过语义伪装、视觉空间锚定和排版编码三个正交层,成功利用文生图模型的文字渲染能力实施“刻写式越狱”攻击,在多个模型上实现了显著高于现有基线的攻击成功率,揭示了当前安全对齐中缺乏排版感知防御的严重盲区。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
这篇论文讲述了一个关于人工智能(AI)绘画的新“漏洞”发现,以及研究人员如何利用这个漏洞“黑”进 AI 系统,让它画出带有危险文字的图片。
为了让你轻松理解,我们可以把这篇论文的内容想象成一场**“高智商的伪装游戏”**。
1. 背景:AI 画家学会了“写字”
以前的 AI 绘画工具(比如 Midjourney 或 DALL-E),只能画风景、人物或物体。如果你让它画“一张写满字的黑板”,它画出来的字通常是乱码或像外星符号。
但现在的 AI 进化了,它们不仅能画得逼真,还能在图片里写出清晰、可读的长句子。这本来是好事(比如自动做海报),但坏人(攻击者)发现了一个新玩法:利用这个“写字”的能力来干坏事。
2. 核心概念:什么是“刻写越狱”(Inscriptive Jailbreak)?
以前,人们攻击 AI 绘画,通常是让 AI 画出**“看起来很坏”**的东西(比如血腥、暴力、色情画面)。这叫“描绘式越狱”(Depictive Jailbreak)。就像你让 AI 画一个拿着刀的坏人,AI 的安全系统会直接拒绝:“不行,这太暴力了!”
这篇论文提出的新攻击叫**“刻写越狱”**。
- 旧玩法:直接让 AI 画暴力画面(容易被拦下)。
- 新玩法:让 AI 画一张看起来非常正常、甚至很温馨的图片(比如一个老师在黑板上写字),但黑板上写的字却是危险的(比如“如何制造炸弹”或“诈骗指南”)。
比喻:
想象你要寄一个违禁品(炸弹说明书)给警察。
- 旧方法:直接把炸弹说明书塞在信封里寄过去(一眼就被安检发现了)。
- 新方法(刻写越狱):你把说明书写在一张**“幼儿园手工课作业”**的背面。这张作业看起来非常可爱、无害(视觉上是安全的),但里面的字(信息内容)却是危险的。安检员只检查了“作业”本身,没发现背面的字,于是你就成功寄出了违禁品。
3. 攻击工具:Etch(“蚀刻”框架)
研究人员开发了一个叫 Etch 的工具,专门用来生成这种“伪装”的提示词。它不像以前那样胡乱尝试,而是像装修房子一样,把攻击指令拆分成三个独立的步骤(三层):
- 第一层:语义伪装(Semantic Camouflage)——“穿件马甲”
- 作用:骗过 AI 的“文字安检员”。
- 比喻:你想让 AI 画“如何制造毒药”,直接说会被骂。于是 Etch 把指令伪装成“写一个关于化学实验的科幻小说情节”。它把危险的意图藏在无害的故事背景里。
- 第二层:视觉锚定(Visual-Spatial Anchoring)——“找个好地方”
- 作用:骗过 AI 的“图片安检员”。
- 比喻:如果让 AI 在一张白纸上凭空写字,看起来很假。Etch 会指定一个场景,比如“一个昏暗的办公室,墙上挂着一块白板”或者“一张旧报纸”。这样,文字出现在那里就非常自然,不像是在搞破坏,而像是场景的一部分。
- 第三层:文字编码(Typographic Payload)——“把字写清楚”
- 作用:确保 AI 真的把危险文字写出来,而且写得清晰可读。
- 比喻:告诉 AI:“在那个白板上,请用清晰、工整的字体,详细写出步骤 1、2、3……"。这一步利用了 AI 现在强大的写字能力,确保生成的文字能被 OCR(文字识别软件)或人眼看懂。
4. 怎么优化?——“智能纠错循环”
光有这三层还不够,AI 可能会画错字或者写得不像。Etch 还有一个**“智能纠错员”(VLM Critic)**。
- 过程:Etch 先让 AI 画一张图 -> 纠错员看图,发现“字写歪了”或者“场景太假了” -> 告诉 Etch 哪一层出了问题 -> Etch 修改那一部分 -> 再试一次。
- 比喻:就像你写文章,写完让一个挑剔的编辑(纠错员)看。编辑说:“你的开头太露骨了(第一层问题),把背景改得再自然点(第二层问题),还有那个错别字要改(第三层问题)”。经过几轮修改,文章就完美了。
5. 实验结果:效果惊人
研究人员用这个 Etch 工具攻击了 7 种最流行的 AI 绘画模型(包括 Google、OpenAI 等公司的产品)。
- 结果:现有的防御手段几乎完全失效。
- 传统的防暴力图片系统,看到“老师写字”的图片,觉得没问题,就放行了。
- 传统的防危险文字系统,看到“写科幻小说”的提示词,也觉得没问题,就放行了。
- 数据:Etch 的平均攻击成功率高达 65.57%,在某些模型上甚至达到了 91%!这意味着,如果你用这个工具,十次里有九次能成功让 AI 画出带有危险文字的图片。
6. 结论与警示
这篇论文揭示了一个巨大的安全盲点:
目前的 AI 安全系统,要么只盯着图片里有什么(有没有暴力画面),要么只盯着提示词里说了什么(有没有违禁词)。
但是,**“刻写越狱”把危险信息藏在了“无害图片里的文字”**中。就像把毒药装在了糖果盒里,现在的安检系统只检查了糖果盒,没检查里面的毒药。
未来的方向:
我们需要开发一种新的防御机制,不仅要检查图片“看起来”是否安全,还要能读懂图片里写的字,并判断这些字是否危险。就像安检员不仅要检查包裹外观,还要能透视并阅读包裹里的信件内容一样。
一句话总结:
这篇论文发现,现在的 AI 绘画太会“写字”了,坏人可以利用这一点,让 AI 画出看起来人畜无害的图片,但图片里却藏着危险的文字教程;现有的安全系统对此束手无策,急需升级“读图识字”的防御能力。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。