← 最新论文
💻 computer science

GuardPaint:SpeculativeSafetyDecodingforText-to-ImageGeneration

GuardPaint 引入了一种推测解码框架,通过采用轻量级审计器来检测并手术式地修复生成轨迹中的不安全区域,从而增强了文本生成图像扩散模型的安全性,在无需修改基础模型的情况下,有效地缓解了对抗性攻击,同时保留了图像质量和提示词忠实度。

原作者: Shreyash Dhoot, Paras Dhiman, Arsh Abbas Naqvi, Aranbi Dutta, Aman Chadha, Vinija Jain, Amitava Das

发布于 2026-08-25
📖 1 分钟阅读☕ 轻松阅读

原作者: Shreyash Dhoot, Paras Dhiman, Arsh Abbas Naqvi, Aranbi Dutta, Aman Chadha, Vinija Jain, Amitava Das

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在现代人工智能的版图中,一类被称为文本生成图像的模型已经学会了将文字描述转化为生动的照片。这些工具通过从一片视觉静电噪声开始,逐步进行细化,直到出现一张与用户词汇相匹配的清晰图像。虽然这项技术提供了卓越的创意力量,但其精确遵循指令的能力也造成了一个显著的漏洞。如果用户提供了一个精心设计的、旨在欺骗系统的欺骗性提示词,模型可能会被引导偏离安全准则,被迫生成包含露骨裸体或暴力血腥内容的图像。目前的安全措施通常像是在入口处的守门人,在图像生成前拦截有害请求;或者像是在出口处的保安,在图像完成后标记不良图像。然而,这些方法让实际的图像创建过程处于无人看管的状态,往往导致系统只是简单地拒绝生成任何内容,而不是生成一张安全的、经过修正的图像。

研究人员现在引入了一种名为 GuardPaint 的新方法,它在创建过程内部充当安全机制。它不是拦截请求或拒绝最终图像,而是监控正在形成的图像。在生成的特定时刻,一个轻量级的审计器会扫描正在发展的图像,观察是否出现了任何不安全元素。如果审计器发现了问题,例如某个区域看起来正逐渐形成某种违禁内容,它并不会停止整个过程。相反,它会隔离那个特定的、有问题的微小区域,并触发修复。一个专门的工具随后会为该特定位置生成几个安全的替代方案,并由一个决策系统选择其中最佳的一个。这个选定的修复方案会被仔细地重新融合回主图像中,在保持其余部分不受影响的同时,用合规的内容替换掉不安全的部分。其结果是,该系统能够将一个潜在有害的生成过程转变为一张安全且连贯的图像,而无需重新训练底层模型或更改其核心权重。

该方法的有效性已通过针对旨在绕过现有安全过滤器的各种复杂攻击进行了测试。这些攻击包括使用隐藏含义、将单词替换为发音相似的词,或重写提示词使其听起来无害但实际带有有害意图的技术。研究人员将 GuardPaint 应用于几种不同类型的图像生成模型,包括旧的设计和更新、更先进的设计。在每种情况下,该系统都显著降低了这些攻击的成功率。例如,在其中一个流行的模型上,当防御机制激活时,成功生成有害图像的比例从超过 8% 降至不到 2%。至关重要的是,这种安全性的提升并没有以牺牲图像质量或原始请求的准确性为代价。修复后的图像依然保持视觉上的锐利,并忠实于用户的描述,安全编辑严格限制在有问题的区域内。

这一过程通过将图像生成视为一段可以暂停和纠正的旅程来运作。当系统检测到图像正偏离航向时,它不会简单地删除工作成果。它的行为更像是一位进行精密手术的外科医生,仅切除病变组织,并嫁接上与周围区域完美契合的健康组织。研究人员发现,检查的时机非常重要:干预过早(即图像仍主要是噪声时)效率低下,而等待太久则会让有害结构变得过于稳固而难以修复。通过在正确的时刻进行干预(通常是在图像完成约 80% 时),系统可以在问题仍处于可控状态时捕捉到它。修复工具经过训练,能够理解图像的安全版本应该是什么样子,学习如何用衣物或其他适当元素来替换露骨内容,从而维持场景的语境。

这项工作的一个关键创新在于用于选择最佳修复方案的方法。系统不仅仅是寻找第一个找到的安全选项,而是生成一小组候选修复方案,并根据严格的标准对其进行评估。每个候选方案都会根据其消除危险的程度、保留原始含义的程度以及与其余部分融合的无缝程度进行评分。只有当一个候选方案在所有这些方面都获得高分时,它才会被接受。如果没有任何选项足够好,系统会保持原图不变,而不是冒险产生更糟的结果。这确保了安全干预绝不会降低良性图像的质量,也不会引入新的视觉错误。研究人员还指出,虽然该系统非常有效,但并非完美无缺;它是针对特定的伤害类别(如裸体和暴力)进行训练的,但可能无法捕捉到那些没有表现为显性视觉内容的更微妙的偏见或文化敏感性问题。

这项研究表明,人工智能的安全并不一定非要是阻断创造力或拒绝请求的钝器。通过集成一个在生成过程中运行的安全层,实现实时纠正有害输出并提供合规的替代方案是可能的。这种方法可以跨越不同代的图像模型工作,而无需承担重新训练它们的巨大计算成本。虽然该系统会增加少量的生成时间,但这种权衡带来了降低产生有害内容风险的显著收益。这项工作表明,安全图像生成的未来在于这些动态的、内部的修正,使这些强大的工具能够在不牺牲其创造能力的前提下,被更广泛、更负责任地使用。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →