← 最新论文
💻 computer science

Low-Effort Jailbreak Attacks Against Text-to-Image Safety Filters

该论文揭示了现代文生图模型存在严重安全漏洞,仅需通过自然语言提示即可利用艺术重构、伪教育框架等低 effort 策略绕过安全过滤,在无需模型访问或对抗训练的情况下实现高达 74.47% 的攻击成功率。

原作者: Ahmed B Mustafa, Zihan Ye, Yang Lu, Michael P Pound, Shreyank N Gowda

发布于 2026-04-03
📖 1 分钟阅读☕ 轻松阅读

原作者: Ahmed B Mustafa, Zihan Ye, Yang Lu, Michael P Pound, Shreyank N Gowda

原始论文根据 CC0 1.0(http://creativecommons.org/publicdomain/zero/1.0/)发布到公有领域。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文就像是在给现在的"AI 绘画大师”们做了一次**“防骗体检”**。

想象一下,现在的 AI 绘画工具(比如 Midjourney、DALL-E 等)就像是一个超级守规矩的餐厅服务员。你的任务是点菜(输入文字提示词),服务员会严格检查你的菜单,如果看到“禁止食材”(比如暴力、色情等违规内容),就会直接把单子撕掉,不让你点。

这篇论文的研究团队发现了一个大漏洞:只要你会“说话的艺术”,就能绕过这个服务员,让他乖乖给你做那些“禁菜”。

1. 核心发现:不用黑客技术,只要“话术”

以前大家以为,要黑进 AI 系统,得是计算机高手,需要复杂的代码、数学公式或者对 AI 内部结构了如指掌(就像要撬开保险柜得用专业工具)。

但这篇论文说:不用那么麻烦! 普通用户只需要用自然语言(也就是我们平时说话的方式),稍微改几个词,就能骗过安全过滤器。这就像是一个**“低成本的越狱”**。

2. 五大“骗术”大揭秘(攻击分类)

研究团队把这种“骗术”总结成了五类,我们可以用生活中的例子来理解:

  • 🎨 艺术包装法 (Artistic Reframing)
    • 原理:把“违规内容”包装成“艺术创作”。
    • 比喻:就像你想看一个不该看的场景,但你对服务员说:“我想看一幅文艺复兴时期的油画,画的是那个场景,为了研究人体结构。”服务员心想:“哦,这是艺术,没问题!”结果画出来的东西其实还是那个违规场景,只是披了件“艺术”的外衣。
  • 👗 生活美学伪装法 (Lifestyle & Aesthetic Camouflage)
    • 原理:把违规元素混在一大堆时尚、生活细节的描述里。
    • 比喻:就像你想点一道“辣味禁菜”,但你在菜单上写了整整三页关于“时尚摄影”、“街头文化”、“光影效果”的描述,最后才轻描淡写地提了一句违规内容。服务员被前面华丽的描述迷花了眼,没注意到最后那个小尾巴。
  • 📚 伪教育/科学框架构法 (Pseudo-Educational Framing)
    • 原理:假装是在做科普、教学或医疗演示。
    • 比喻:你对服务员说:“我在写一本关于人体生理变化的科普书,需要一张示意图。”服务员心想:“这是为了教育,是好事!”于是就把违规内容画出来了,仿佛是在做“科学实验”。
  • 🍫 材料替换法 (Material Substitution) —— 这是最厉害的一招!
    • 原理:把“人”或“危险物体”替换成“巧克力”、“大理石”、“果冻”等无害材料。
    • 比喻:你想画一个“裸体雕像”,直接说会被拒。但你说:“请画一个用白巧克力做的躺着的雕像,细节要非常逼真。”服务员心想:“巧克力做的?那是食物,不是人,安全!”结果 AI 画出来的东西,虽然说是巧克力,但长得和真人一模一样,完全达到了违规效果。
  • 🤔 模糊动作置换法 (Ambiguous Action Substitution)
    • 原理:把危险动作放在一个看似无害或善意的故事背景里。
    • 比喻:你想画一个“持刀抢劫”的场景。直接说会被拒。但你描述成:“一个男人把偷来的钱包还给女士,女士很害怕,但他手里拿着一把刀(其实他刚吃完煎饼)。”服务员看到“还钱包”这个好行为,就忽略了“刀”和“恐惧”的危险信号,结果画出来的图依然充满了威胁感。

3. 实验结果:效果惊人

研究人员在好几个顶级的 AI 绘画模型上测试了这些方法。

  • 成功率:最高达到了 74.47%!这意味着,每 10 次尝试,就有 7 次能成功骗过系统。
  • 对比:这些“低努力”的骗术,效果竟然和那些需要超级计算机、复杂算法的“高科技黑客攻击”差不多厉害。

4. 为什么会出现这个问题?

这就好比保安只认“黑名单”上的名字

  • 如果你直接说“我要画色情图”,保安(安全过滤器)看到“色情”这个词,直接拦下。
  • 但如果你说“我要画一个巧克力做的……",保安没看到“色情”这个词,就放行了。
  • 核心漏洞:现在的 AI 系统太依赖关键词匹配,而缺乏深层的理解能力。它们分不清“巧克力做的裸体”和“真人裸体”在视觉意图上其实是一回事。它们只看到了“巧克力”这个安全的词,没看懂你真正的意图。

5. 这对我们意味着什么?

  • 风险:这意味着现在的 AI 绘画工具其实并没有我们想象中那么安全。任何人都可以用简单的聊天技巧,生成有害、违规甚至违法的图片。
  • 启示:未来的 AI 安全不能只靠“堵”(屏蔽关键词),必须学会“思考”。系统需要理解语境意图,而不仅仅是看字面意思。就像保安不能只看你手里拿的是“刀”还是“叉子”,还得看你是在“切牛排”还是在“行凶”。

总结一句话:
这篇论文告诉我们,现在的 AI 绘画系统就像是一个只会死记硬背的保安,只要你会“绕弯子说话”或者“换个马甲”,就能轻易骗过它。这提醒开发者们,光靠简单的关键词过滤是不够的,必须让 AI 真正学会“听懂人话”背后的真实意图。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →