Inference-Only Prompt Projection for Safe Text-to-Image Generation with TV Guarantees
本文介绍了 SPOT,这是一种推理时框架,它利用大语言模型和安全防护视觉语言模型,将不安全的提示选择性地投影至“tau 安全集”,从而在无需重新训练扩散模型的情况下,显著减少不当图像生成,同时保留良性提示的行为。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象你拥有一台神奇的、冻结的艺术机器(文生图 AI),它可以绘制你描述的任何内容。它才华横溢,但有时,如果你给它一个棘手或危险的提示,它可能会意外地画出不恰当的内容。
问题在于:如果你试图通过“修复”机器本身来阻止它绘制不良内容,你往往会意外地破坏它绘制好内容的能力。这就像试图通过拿走厨师的刀来阻止他烹饪辛辣食物;突然间,他也无法为沙拉切蔬菜了。
本文介绍了一种名为SPOT(选择性提示投影)的新方法,它就像一个智能编辑,位于机器之前工作,而不是试图重建机器本身。
以下是其工作原理,使用简单的类比:
1. “冻结机器”规则
作者决定完全不触碰这台艺术机器。他们将其保持原样(冻结)。为什么?因为如果你改变机器,你就改变了它的“个性”。他们希望保持机器的“好”行为完全不变,只阻止“坏”行为。
2. “安全地图”(τ 安全集)
想象一张地图,其中某些区域是“绿色区域”(安全可绘制),而其他区域是“红色区域”(不安全)。
- 目标:如果你请求绘制绿色区域的内容,编辑会保留你的请求不变。机器会完全按照你的要求绘制。
- 问题:如果你请求绘制红色区域的内容,编辑必须介入。但它不会只说“不”,而是试图找到最接近你原始请求的绿色区域。
3. 两阶段侦探团队
SPOT 使用两步流程来处理高风险请求,就像一个拥有廉价扫描仪和严格检查员的安全团队。
第一阶段:快速扫描仪(LLM)
当危险的提示进入时,一个快速、仅基于文本的 AI(LLM)充当侦察兵。它快速生成几个你提示的“重写”版本。它会问:“如果我把这个词换成那个词,它看起来更安全吗?”- 它选择最接近你原始想法的版本,但将其移出红色区域,移入绿色区域。
- 这既快又便宜,因为它只看文字,不看图片。
第二阶段:严格检查员(VLM)
一旦编辑选定了最佳的重写提示,实际的艺术机器就会绘制图片。然后,第二个 AI(视觉语言模型)会查看生成的实际图像。- 它会问:“这张图片实际上安全吗?”
- 如果图片安全,它就获得绿灯放行。
- 如果图片仍然不安全(也许是机器误解了新提示),系统会回到第一阶段,尝试不同的重写,并再次绘制。
4. “安全与创造力”的权衡
本文提出了一个非常重要的数学观点:如果不稍微改变其输出,你就无法让 AI 更安全。
把它想象成一条河流。如果你想将危险的洪水(不安全图像)引离村庄,你就必须开凿一条新渠道。这条新渠道会改变水流的路径。
- SPOT 的诀窍:它只为危险的洪水开凿新渠道。如果水流本身已经是安全的(良性提示),它就保持河流原样。这确保了当你请求“可爱的猫”时,你得到的仍然是“可爱的猫”,而不是“卡通猫”或“黑屏”。
5. 结果
作者在四组不同的数据集和三种不同的艺术机器上测试了这种方法。
- 安全性:它成功大幅减少了不恰当图像的数量(比其他方法提高了 14% 到 44%)。
- 创造力:它使“好”图像看起来几乎与没有任何安全过滤器时完全一样。
- 速度:由于第一阶段(文本扫描仪)非常快,整个过程比那些在绘制前检查每一个图像构思的方法要快得多。
总结
SPOT 就像一位夜店保镖,他不改变音乐或 DJ(AI 模型)。相反,如果有人试图在门口说粗话,保镖会温和地建议他们将其改述为礼貌的话语。如果改述后的句子让他们得以进入,他们就进去了。如果他们继续试图粗鲁,他们就无法进入。但如果他们一开始就很礼貌,他们就会直接走进来,不受任何干扰。
这确保了夜店保持安全,同时不会破坏好客人的体验。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。