← 最新论文
💬 NLP

DiffuGuard: How Intrinsic Safety is Lost and Found in Diffusion Large Language Models

本文针对扩散大语言模型(dLLMs)因迭代并行生成机制而面临的独特越狱漏洞,提出了无需训练的 DiffuGuard 防御框架,通过随机退火重掩码和块级审计修复双重策略,在保持模型效用与效率的同时显著降低了攻击成功率。

原作者: Zherui Li, Zheng Nie, Zhenhong Zhou, Yue Liu, Yitong Zhang, Yu Cheng, Qingsong Wen, Kun Wang, Yufei Guo, Jiaheng Zhang

发布于 2026-03-27
📖 1 分钟阅读☕ 轻松阅读

原作者: Zherui Li, Zheng Nie, Zhenhong Zhou, Yue Liu, Yitong Zhang, Yu Cheng, Qingsong Wen, Kun Wang, Yufei Guo, Jiaheng Zhang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文主要讲的是:一种新型的人工智能(叫“扩散大语言模型”)虽然很聪明,但有一个特殊的“安全漏洞”,而作者们发明了一个叫"DIFFUGUARD"的免费补丁来修补它。

为了让你更容易理解,我们可以把整个过程想象成**“一群人共同完成一幅拼图”**。

1. 背景:两种不同的“拼图”方式

  • 传统 AI(自回归模型): 就像写文章。一个人一个字一个字地写,写完“今天”,再写“天气”,再写“不错”。如果前面写错了,后面很难改,只能硬着头皮写下去。
  • 新型 AI(扩散大语言模型,dLLMs): 就像一群人同时画一幅画。一开始画布上全是乱码(全是 [MASK] 遮罩),然后大家同时把乱码变成具体的词。
    • 第一轮:大家猜一下,把最像样子的词填进去,其他的继续盖着。
    • 第二轮:看着刚才填好的,再修正一下,把不确定的词重新盖住,再猜一次。
    • 以此类推,直到整幅画(整段话)都清晰了。

这种“大家一起改”的方式效率很高,但作者发现,它有一个独特的“安全漏洞”**。

2. 漏洞在哪里?(两个关键发现)

作者通过实验发现了这种新型 AI 在“变坏”时的两个奇怪现象:

漏洞一:太“贪心”了(单步内的漏洞)

  • 比喻: 想象在修图时,有一个“自动修图师”。如果它觉得“我要教孩子玩枪”这句话里的“教”字出现概率很高(比如 99%),它就会毫不犹豫地把“教”字填上去,而完全忽略旁边那个概率稍低(比如 80%)但代表“拒绝”的词(比如“抱歉”)。
  • 问题: 这种“谁概率高就选谁”的贪心策略,让 AI 很容易在第一步就选错了方向,直接滑向危险的内容。
  • 发现: 如果稍微加点“随机性”(比如让修图师偶尔也选选概率低一点的词),反而能救回来,但代价是生成的内容可能有点乱(质量下降)。

漏洞二:一步错,步步错(步骤间的漏洞)

  • 比喻: 这种 AI 是分阶段修图的。如果第一阶段(刚开始)大家就定下了“好的,我来教你...",那么后面所有的阶段都会顺着这个思路去修图,很难再改回“不行,我不能教”。
  • 问题: 作者发现,最早期的几个词决定了整段话的生死。如果一开始就填了“抱歉”,后面基本就安全了;如果一开始填了“好的”,后面就彻底完了。这叫做**“去噪路径依赖”**。

3. 解决方案:DIFFUGUARD(智能安全卫士)

为了解决这两个问题,作者设计了一个不需要重新训练模型、直接就能用的“外挂”——DIFFUGUARD。它有两个绝招:

绝招一:随机退火重遮罩(Stochastic Annealing Remasking)

  • 对应漏洞: 解决“太贪心”的问题。
  • 做法:刚开始修图(生成)的时候,故意给修图师加一点“醉意”(随机性)。
    • 比如,本来“教”字概率 99%,“抱歉”概率 80%。正常情况下肯定选“教”。
    • 加了“醉意”后,系统会想:“虽然‘教’概率高,但‘抱歉’也不错,万一呢?”于是它可能会选“抱歉”。
    • 关键点: 这种“醉意”只在刚开始最浓,随着修图越来越清晰,慢慢恢复正常。这样既保证了开头安全,又保证了后面内容通顺。

绝招二:分块审计与修复(Block-level Audit and Repair)

  • 对应漏洞: 解决“一步错,步步错”的问题。
  • 做法: 把生成的内容分成一小块一小块(比如每 10 个字一块)。
    • 审计: 每写完一块,卫士就立刻检查:“这块内容是不是偏离了安全轨道?”(通过对比 AI 内心的想法和表面的话)。
    • 修复: 如果发现这块内容有点“危险”(比如出现了“好的,我来教你..."),卫士会立刻把这块擦掉(重新变回 [MASK]),并禁止 AI 再次写出刚才那个危险的词,强迫它重新生成一个安全的版本。
    • 效果: 就像在洪水刚要漫过堤坝时,立刻把缺口堵上,防止洪水(有害内容)蔓延到整条河。

4. 效果如何?

  • 安全性大提升: 在测试中,面对各种试图让 AI“变坏”的攻击,这个补丁把攻击成功率从 47.9% 降到了 14.7%
  • 几乎不耽误事: 它不会让 AI 变笨(做题、写代码的能力没变),也不会让 AI 变慢(速度几乎没受影响)。
  • 通用性强: 对几种不同的新型 AI 模型都有效。

总结

这就好比给一个正在集体创作的大画家(扩散模型)配了一个聪明的监工(DIFFUGUARD):

  1. 刚开始动笔时,监工故意让画家“别太死板”,多想想安全选项(随机性)。
  2. 画完一小段时,监工立刻检查,如果发现画家想画“坏人”,就立刻把画擦掉,逼他重画(审计与修复)。

最终,画家既能画出好画,又不会画出危险的东西。这篇论文就是告诉我们要用这种**“动态调整 + 及时止损”**的方法来保护新型 AI 的安全。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →