← 最新论文
💻 computer science

Safeguarding Text-to-Image Generation via Inference-Time Prompt-Noise Optimization

本文介绍了提示词-噪声优化(Prompt-Noise Optimization, PNO),这是一种新颖的免训练框架,通过联合优化提示词嵌入和噪声轨迹,在不损害生成质量或速度的前提下,增强文本生成图像扩散模型的安全性,以抑制毒性内容并抵御对抗性攻击。

原作者: Jiangweizhi Peng, Zhiwei Tang, Gaowen Liu, Charles Fleming, Mingyi Hong

发布于 2026-06-01
📖 1 分钟阅读☕ 轻松阅读

原作者: Jiangweizhi Peng, Zhiwei Tang, Gaowen Liu, Charles Fleming, Mingyi Hong

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你拥有一台神奇的艺术机器(文本生成图像 AI),它可以根据你的描述画出任何东西。你输入“一只猫”,它就画出一只猫。但有时,如果你输入一些棘手或危险的短语,这台机器可能会不小心画出不当、暴力或冒犯性的内容。这是因为这台机器是从一个庞大的互联网图像库中学习的,其中包含一些混乱或不安全的内容。

目前,人们尝试通过以下方式来阻止这种情况:

  1. 清理库文件: 在训练前删除不好的图像(很难做到完美)。
  2. 重写规则: 教会机器新的规则(这需要很长时间,且成本很高)。
  3. 添加过滤器: 试图在门口拦截不好的词汇(黑客通常可以绕过这些过滤器)。

问题在于: 这些方法要么太贵,要么太慢,要么很容易被破解。

解决方案:“提示词-噪声优化”(Prompt-Noise Optimization, PNO)

论文作者提出了一种新的、聪明的技巧,叫做 “提示词-噪声优化”(PNO)。你可以把它想象成一个**“实时安全编辑器”**,它在机器绘画的过程中同步工作,而无需重新训练机器或改变它的“大脑”。

它是如何工作的,让我们用一个简单的类比来说明:

类比:雕塑家与黏土

想象 AI 是一个根据你的描述制作雕像的雕塑家。

  • 提示词(你的描述): 这是雕像应该长什么样的蓝图构思
  • 噪声(黏土): 这是原材料。在 AI 中,图像从随机的静态噪声开始,并逐渐被塑造成一幅画。

PNO 如何解决问题:
如果你给雕塑家一个危险的蓝图(例如“一个可怕的怪物”),机器可能会开始制作一些糟糕的东西。

  • 旧方法试图改变整个蓝图(这会破坏原始构思)或者在雕塑过程中途停止(这通常会失败)。
  • PNO 做了一些更聪明的事情。它就像一个站在雕塑家身边的副驾驶
    1. 它观察蓝图(提示词)。
    2. 它观察正在被塑造的黏土(噪声)。
    3. 它对两者进行同步的微调。它对蓝图进行恰到好处的修改,以去除“危险”的部分,同时引导黏土向另一个方向移动,使最终的雕像看起来是安全的。

这种神奇之处在于,它是同时完成这些工作的。如果它只改变蓝图,雕像看起来可能完全不像你要求的样子;如果它只改变黏土,那个危险的想法可能依然存在。通过同时调整两者,它既保留了你原始构思的神韵,又去除了那些“有毒”的元素。

为什么这很特别?

  1. 无需训练: 你不需要教 AI 新的课程。PNO 就像是一个“即插即用”的安全过滤器,你可以在生成每一张图像时开启它。
  2. 难以被破解: 黑客经常尝试使用“越狱”提示词(旨在绕过安全过滤器的奇怪词汇)。由于 PNO 在图像生成的过程中不断地检查和调整,它可以识别出这些诡计并进行纠正,而静态过滤器则经常被骗过去。
  3. 完美的平衡: 论文表明 PNO 找到了“甜点位”。它能阻止坏图像的出现,同时让好图像看起来完全符合你的要求。其他方法通常会让你面临选择:“你想要安全,还是想要它看起来符合你的提示词?”而 PNO 说:“你两者皆可。”

实际操作中它是如何运作的(“循环”)

这个过程就像一场快速的“热还是冷”游戏:

  1. AI 开始绘制你的图像。
  2. 一个安全检查器(另一个 AI)观察绘图并说:“喔,这有点不安全。”
  3. PNO 瞬间计算:“好吧,稍微调整一下蓝图,并稍微移动一下黏土。”
  4. AI 使用这些微小的变化重新绘制图像。
  5. 安全检查器再次查看。如果安全,PNO 停止;如果不安全,它会再次进行微调。
  6. 这个过程在瞬间内完成(通常只需几次尝试),从而产生一张安全且高质量的图像。

核心结论

该论文声称,这种方法是防止 AI 生成有害图像,且不破坏艺术质量或无需昂贵重训的最有效方式。它将 AI 自身的绘图过程转变为一种自我修正的安全机制,确保这台神奇的艺术机器对每个人来说都是友好且安全的。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →