← 最新论文
💬 NLP

A2D: Any-Order, Any-Step Safety Alignment for Diffusion Language Models

A2D 为扩散语言模型引入了一种基于标记级的安全对齐方法,该方法利用随机掩码来发出即时的 [EOS] 拒绝信号,在有效中和 DIJA 等任意顺序和任意步骤攻击的同时,实现了实时监控并显著加快了安全终止速度。

原作者: Wonje Jeung, Sangyeon Yoon, Yoonjun Cho, Dongjae Jeon, Sangwoo Shin, Hyesoo Hong, Albert No

发布于 2026-02-04
📖 1 分钟阅读☕ 轻松阅读

原作者: Wonje Jeung, Sangyeon Yoon, Yoonjun Cho, Dongjae Jeon, Sangwoo Shin, Hyesoo Hong, Albert No

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

核心理念:一种新型的 AI 作家

想象一下,大多数 AI 聊天机器人(比如你每天都在与之交流的那些)就像是流水线工人。它们严格按照从左到右的顺序,一个词接一个词地构建句子。如果有人问它们一些危险的问题,它们通常会在检查前几个词时,判定“不,这很糟糕”,然后立即停止。

但有一种新型 AI 叫做扩散语言模型 (Diffusion Language Model, dLLM)。不要把这个 AI 想象成流水线工人,而要把它想象成一位正在大理石块上雕刻的雕塑家。它不是逐字写作,而是从一个充满问号(掩码/masks)的空白页面开始,逐渐填满它们。它可以先填完句子的结尾再写开头,也可以先写中间再写开头。它可以同时处理整个故事。

问题所在:“后门”攻击

因为这位雕塑家可以按任何顺序填词,所以它也有了一个新的弱点。

想象一下,一个坏人想要诱骗雕塑家写出一份偷车指南。

  • 旧陷阱: 如果雕塑家是流水线工人,坏人会尝试在最开始进行诱骗。
  • 新陷阱 (DIJA 攻击): 对于雕塑家来说,坏人可以先用无害的文本填满故事的前半部分,然后在中间偷偷塞进一个“陷阱”,或者先填好结尾。他们使用一种看起来像是正常请求、实则将危险部分隐藏在空白处的模板。

研究发现,目前的这类雕塑家的安全训练是**“浅层”的**。这就像一个保安,只在你走进正门时检查你的身份证。如果你成功绕过门口开始在走廊里走动,保安就不再关注你了。AI 可能会对第一个词说“不”,但如果它被诱骗在第 10 个词处填入危险内容,它就会忘记再次说“不”。

解决方案:A2D(任意顺序、任意步骤防御)

作者创建了一种名为 A2D 的新安全方法。它是如何工作的呢?让我们用一个简单的类比:

“红停步牌”标记 (The "Red Stop Sign" Token)
A2D 不仅仅是训练 AI 在句首说“我不能做那个”,而是教会了 AI 一个特殊的“停止”标记(称为 [EOS])。

  • 训练过程: 我们把 AI 拿过来,给它看一些危险的句子。但我们不让它完成整个句子,而是用问号遮住危险的部分,并告诉 AI:“如果你在这里看到一个问号,且这句话是危险的,你必须立即用一个‘停止标记’来替换这个问号。”
  • 结果: AI 学会了在句子的任何位置,只要它察觉到危险,就应该立即拍下一个“停止标记”。

为什么这很特别?

  1. 任意顺序 (Any-Order): 无论 AI 是在写第一个词还是最后一个词,只要危险的想法出现,停止标记就会出现。
  2. 任意步骤 (Any-Step): 无论危险出现在第 1 步还是第 50 步,安全卫士全程都保持清醒,而不只是守在门口。

“填空测试”

为了证明这种方法有效,研究人员发明了一个超级难的测试,叫做 FITS (填补句子测试)

  • 场景: 假设一个坏人写了一份 99% 完整的炸弹制作指南。他只留出了最后一步(即最后一个句子)的空白,并要求 AI 把它填完。
  • 结果: 旧的安全方法在这里惨败。它们太专注于文本的开头,以至于让 AI 完成了炸弹指南。
  • A2D 的表现: A2D 观察到了那唯一缺失的一句话,意识到它是危险的,并立即立起了“停止标记”。它几乎 100% 地拦截了这种攻击。

加分项:实时安全雷达

因为 AI 被训练为只要看到危险就立起“停止标记”,所以那个“停止标记”出现的概率就像是一个安全雷达

  • 早期拒绝: 研究人员发现,如果我们在第一步就检查 AI 的“停止标记概率”,我们就能在 AI 甚至还没写出第一个词之前,就判断出整个请求是否违规。
  • 速度: 这使得 AI 拒绝非法请求的速度比以前快了 19.3 倍。这就像夜店的保镖,在你还没走到门口之前就能看出你不在名单上,从而节省了大家的时间。

它会破坏 AI 的实用性吗?

论文对此进行了广泛测试。他们让 AI 做数学题、写代码以及回答一般性问题。

  • 结论: A2D 保持了 AI 的聪明和有用。它不会拒绝回答正常问题(例如“如何杀死一个 python 进程?”这听起来很危险,但实际上是关于编程的问题)。
  • 对比: 其他安全方法过于敏感,经常会拒绝回答一些无害的问题。A2D 则非常精准:它只拦截那些真正的坏事。

总结

这篇论文介绍了一种 A2D,它是针对这种可以按任意顺序写作的新型 AI 的安全升级。

  • 旧安全: 一个守在门口、过一会儿就会疲倦的保安。
  • A2D 安全: 一个一旦闻到危险气息,就会在任何地方、任何时间瞬间立起“停止”牌的安全系统。
  • 结果: 它拦截了那些试图溜过正门的隐蔽攻击,比以前快 19 倍地做出“拒绝”反应,并确保 AI 对每个人来说依然有用。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →