← 最新论文
💬 NLP

Adaptive Steering and Remasking for Safe Generation in Diffusion Language Models

本文提出了一种用于扩散语言模型的即插即用推理时防御框架,该框架结合基于对比安全方向的检测、自适应引导与令牌重掩蔽,在迭代去噪过程中有效缓解安全漏洞,同时保持生成质量。

原作者: Yejin Lee, Yo-Sub Han

发布于 2026-05-14
📖 1 分钟阅读☕ 轻松阅读

原作者: Yejin Lee, Yo-Sub Han

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,将扩散语言模型(DLM)比作一个艺术家团队,他们根据提示共同绘制一幅画作。与一次只画一笔、按直线行事的传统作家不同,这个团队从一块完全被静态噪声覆盖的画布开始。他们分轮次工作,逐步清除静态噪声,从而显现出图像。

正如论文所解释的,问题在于:如果一个“坏”想法(例如有害指令)在清除噪声的早期轮次中混入画面,它就会被锁定。因为艺术家们会不断根据所见内容完善图像,这个早期的坏想法就会扩散开来,最终毁掉整幅画作,即使艺术家们后来试图修复也无济于事。

以下是作者的新方法自适应引导与重掩码如何修复这一问题,通过简单的类比进行解释:

1. 问题:花园里的“坏种子”

在传统人工智能中,如果你提出一个危险的问题,人工智能可能会立即拒绝。但在这些“扩散”模型中,人工智能从一个空白画布开始,缓慢地填充内容。

  • 脆弱性:如果一个有害词汇(如“炸弹”)在过程早期出现,模型会将其视为事实,并围绕它构建句子的其余部分。等到模型意识到自己正在做错误的事情时,“坏种子”已经长成参天大树,模型很难将其砍倒。
  • 旧有的修复方法:之前的方法试图扮演一位严厉园丁的角色,一旦看到任何杂草,就停止给整个花园浇水。这虽然能防止杂草生长,但也杀死了花朵,导致句子空洞或破碎。

2. 解决方案:智能向导与精准修剪器

作者提出了一种两步安全系统,它像智能向导和精准工具一样,在画作制作过程中而非制作完成后发挥作用。

第一步:“指南针”(自适应引导)

团队首先创建一个对比安全方向(CSD)。这就像指南针一样,专门指向“安全”并远离“有害”。

  • 工作原理:他们向模型展示安全回答和有害回答的示例。通过计算两者之间的数学差异来创建这个“指南针”。
  • 行动:在绘画过程的早期轮次(此时图像仍主要是噪声),系统会检查模型的方向。如果模型开始向指南针的“有害”一侧倾斜,系统会轻轻将其推回“安全”一侧。
  • 类比:想象你在迷雾森林中行走。如果你开始走向悬崖(有害),向导会轻轻推你的肩膀,引导你回到小径(安全)上,在你靠近边缘之前。这发生在早期,因此你不会迷路。

第二步:“精准修剪器”(重掩码)

即使有了指南针,有时坏词也会溜进来。这就是第二步发挥作用的地方。

  • 工作原理:系统扫描目前已揭示的词汇。如果它发现某个词汇与“有害”方向高度一致,它不会删除整个句子。相反,它会在该特定坏词上覆盖一层“掩码”(空白遮盖)。
  • 行动:然后要求模型重绘该特定位置,尝试寻找一个更安全的词汇来替换它。
  • 类比:想象一位雕塑家正在雕刻一座雕像。如果不小心刻出了一块参差不齐、丑陋的石块,他们不会砸碎整座雕像。他们只是凿掉那块特定的丑陋部分,并用新粘土将其抹平。这样,雕像其余美丽的部分得以保持完整。

3. 为何这种方法更好

  • 无需繁重工作:作者不需要重新训练模型(从头开始教授新内容)。他们只是添加了这个“指南针”和“修剪器”作为插件工具,在模型思考时发挥作用。
  • 质量与安全:旧方法就像用大锤杀苍蝇;它们阻止了危险,但也破坏了家具(文本质量)。这种新方法就像用苍蝇拍;它阻止了危险,但让家具(故事或代码)完好无损。
  • 结果:在他们的测试中,该方法几乎完全阻止了“越狱”攻击(试图诱骗人工智能变得不安全的行为)的成功(在某些情况下将成功率降至 1% 以下),同时保持了人工智能撰写好故事和解决数学问题的能力,与之前几乎相同。

总结

论文认为,要保持这些“迭代”人工智能模型的安全,不能等到最后才检查错误。你必须在非常开始的阶段温和地引导过程(引导),并在坏部分出现时修复特定部分(重掩码)。这确保了最终输出既安全又高质量,而无需从头重建人工智能。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →