← 最新论文
🤖 AI

Backdoor Sentinel: Detecting and Detoxifying Backdoors in Diffusion Models via Temporal Noise Consistency

该论文提出了 TNC-Defense,这是一个利用时间噪声一致性(Temporal Noise Consistency)现象的灰盒框架,用于在无需访问模型权重的情况下检测扩散模型中的后门,并随后通过修正特定的异常时间步长对其进行去毒,从而在实现高检测准确率和触发器失效的同时,将对生成质量的影响降至最低。

原作者: Bingzheng Wang, Xiaoyan Gu, Hongbo Xu, Hongcheng Li, Zimo Yu, Jiang Zhou, Weiping Wang, Wu Liu

发布于 2026-08-25
📖 1 分钟阅读☕ 轻松阅读

原作者: Bingzheng Wang, Xiaoyan Gu, Hongbo Xu, Hongcheng Li, Zimo Yu, Jiang Zhou, Weiping Wang, Wu Liu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在现代人工智能领域,出现了一类强大的新工具,它们能够根据简单的文本描述创建图像。这些被称为扩散模型的系统,通过从一片随机的视觉静态噪声开始,并逐步将其细化为清晰的图像,在用户输入的文字引导下进行迭代。由于这些模型在生成艺术、设计和媒体方面非常有效,它们正越来越多地被用于商业服务和创意应用中。然而,正如任何复杂的机器都可能被篡改一样,这些人工智能系统也容易受到一种被称为“后门攻击”的特定破坏。在这种攻击中,恶意行为者在模型训练期间秘密地篡改模型,使其在大多数时间表现正常,但当使用特定的隐藏触发词时,会产生有害或不想要的图像。这造成了一个危险的情况:公司可能会在不知情的情况下部署了一个被破坏的系统,使其用户暴露在安全风险之中,而没有任何明显的预警信号。

安全专家面临的挑战在于,这些模型通常被视为“黑盒”;由于隐私和知识产权的考虑,拥有这些模型的公司很少分享其内部运作机制。这使得直接检查代码以寻找“毒素”几乎变得不可能。此外,即使发现了后门,修复它也非常困难。传统方法通常需要精确猜出隐藏的触发词,或者对模型进行大规模的修改,从而破坏其生成高质量图像的能力。中国科学院和中国科学技术大学的研究人员通过将图像创建过程视为一段“时间的旅程”,而非一个静态对象,解决了这一难题。他们发现,当后门被激活时,模型在创作过程的中期会以一种非常特定的方式“踉跄”,产生一种在正常工作时不会出现的、可检测的稳定性模式。

研究人员开发了一个名为 TNC-Defense 的两部分防御系统,它充当了审计员(负责检查模型的人)与使用者(公司)之间的协作安全网。第一部分是一个专为无法看到模型内部代码的审计员设计的检测工具。该工具并非试图逆向工程隐藏的触发词,而是监听模型在每一步生成过程中预测的“噪声”。在一个健康的模型中,对下一步应该呈现何种形态的预测是平滑且与前一步保持一致的。然而,当模型被迫生成后门图像时,这种一致性会在特定时刻发生崩溃,导致前后步骤之间的差异出现突然的峰值。通过测量这些微小的波动,该系统可以识别出异常情况,并精准定位模型在创作过程中的哪个阶段偏离了轨道,而无需访问模型的私有权重,也不需要知道触发词是什么。

一旦检测到后门,系统的第二部分将帮助服务提供商在不破坏模型实用性的情况下修复损伤。该修复过程并非试图寻找并删除隐藏的触发词(因为这往往难以精确定位),而是以检测器识别出的特定时刻作为引导。提供商会对该问题提示词进行处理,生成许多变体,在保持核心含义的同时改变周围的词汇。随后,他们利用这些变体进行微调训练,但仅针对检测器发现不稳定性发生的特定时间步。这种针对性的方法迫使模型在这些关键时刻学习正确的路径,同时保持其其余知识不受影响。这就像是在漫长的公路上修复一个单独的坑洼,而不是重新铺设整条高速公路,确保模型在保持生成高质量图像能力的同时,依然是安全的。

该方法的有效性针对五种不同类型的后门攻击进行了测试,涵盖了从简单的单词触发到更复杂的模型内部层操纵。检测工具表现出了极高的准确性,在几乎所有案例中都正确识别了受后门攻击的模型,其检测准确率比现有方法平均提高了 11%。更重要的是,修复过程非常高效。它成功中和了 98.5% 的触发样本中的后门,使恶意行为失效。至关重要的是,这种高水平的安全保障几乎没有降低模型为普通用户生成图像的质量。研究表明,修复后的模型能够继续生成清晰、连贯的图像,证明了在不牺牲工具主要功能的前提下移除隐藏威胁是可行的。

这项工作代表了我们思考如何保障生成式人工智能安全的一个重要转变。通过关注生成过程的时间一致性——即模型如何从一步移动到下一步——研究人员发现了一个即使在攻击者试图掩盖行踪时依然可靠的信号。该方法适用于不同的扩散模型,并且在改变图像生成设置时仍保持稳健。它为现实世界的一个问题提供了切实可行的解决方案:如何信任一个你无法完全看透其内部构造的强大工具。研究结果表明,通过监测创作过程的“节奏”,我们可以检测并治愈人工智能系统中的“感染”,确保这些创意工具能够安全地广泛使用。研究人员已将其代码公开,以便他人验证这些结果,并将这种对人工智能安全的新理解应用于未来的系统。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →