← 最新论文
💬 NLP

Efficient and Stealthy Jailbreak Attacks via Adversarial Prompt Distillation from LLMs to SLMs

本文介绍了对抗性提示蒸馏(Adversarial Prompt Distillation, APD),这是一个通过知识蒸馏和强化学习将大语言模型的越狱能力转移到小语言模型的新型框架,在显著提高效率并降低计算成本的同时,实现了最先进的攻击成功率。

原作者: Xiang Li, Chong Zhang, Jia Wang, Fangyu Wu, Yushi Li, Xiaobo Jin

发布于 2026-06-09
📖 1 分钟阅读☕ 轻松阅读

原作者: Xiang Li, Chong Zhang, Jia Wang, Fangyu Wu, Yushi Li, Xiaobo Jin

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是该论文的解释,采用了简单的语言和创意类比。

核心问题:“重量级”攻击

想象一下,你想测试一家高科技银行(大型语言模型,简称 LLM)的安全性。为此,你需要尝试用一个虚假的故事(一种“越狱”攻击)来诱骗银行的保安,让他们放你进去。

目前,想要编出一个好的虚假故事,唯一的办法是每次都雇佣一位非常昂贵、超级聪明的顾问(大型 AI 模型)来为你撰写。

  • 问题在于: 这位顾问动作缓慢,消耗巨额电费,而且还会占用你办公室大量的空间。
  • 结果: 你每天只能对银行进行几次测试,因为持续雇佣这位顾问实在太贵且太慢了。

解决方案:“学徒”系统 (APD)

该论文的作者提出了一种名为对抗性提示词蒸馏 (Adversarial Prompt Distillation, APD) 的新方法。你可以将其理解为一种“师徒制”的关系。

他们不再为每一次测试都去雇佣昂贵的顾问,而是这样做:

  1. 训练阶段(一次性成本): 他们雇佣那位超级聪明的顾问(“老师”模型)来教一个又小又便宜的实习生(“学生”模型,比如一个微型 AI)如何编写这些棘手的故事情节。他们使用一种特殊的教学技术,将顾问的“诀窍”转移到实习生的脑海中。
  2. 攻击阶段(快速且免费): 一旦实习生接受了培训,你就可以解雇那位昂贵的顾问。现在,这个微小的实习生可以瞬间写出虚假故事,几乎不消耗电量,而且可以在一台普通的笔记本电脑上运行。

他们是如何教导实习生的(三个秘密配方)

论文描述了他们为了让实习生变得像大师一样出色而使用的三种具体技巧:

1. “掩码”作业(预训练)
在实习生开始学习之前,他们会得到一大堆练习题。老师模型经过微调(就像经过专门的训练营),以精准理解如何绕过安全过滤器。这在实习生甚至还没见到它之前,就在系统中建立了一个强大的“不良行为”知识基础。

2. “模拟退火”教学计划(动态蒸馏)
通常,当大师教学生时,学生只是照抄大师的原话。但老师规模巨大,而学生很小;两者的思维方式不同。

  • 解决方法: 作者使用了一个“温度”设置。
    • 训练初期(高温): 老师表现得比较随性且富有创造力,向学生展示许多种不同、古怪的表达方式(探索)。
    • 训练后期(低温): 老师变得严格且专注,只向学生展示那些能获得成功的最佳方式(利用)。
  • 类比: 这就像一位教练,先让球员尝试书本中所有疯狂的招式,然后慢慢地将范围缩小到那个能赢得比赛的完美招式上。

3. “电子游戏”反馈机制(强化学习)
静态的指令很容易被保安抓住。为了解决这个问题,实习生在与银行的安全系统玩一场游戏。

  • 游戏规则: 实习生尝试讲一个故事。
    • 如果保安抓住了它,实习生会得到一个“低分”。
    • 如果保安让它通过了,实习生会得到一个“高分”。
    • 如果故事与上一个故事太相似,实习生会受到“枯燥惩罚”。
  • 结果: 实习生学会了实时调整它的故事,使其变得更加隐蔽、具有破坏性且独一无二,从而不断适应保安的反应。

结果:小而强大

论文声称这种新方法是一个游戏规则的改变者,原因有三:

  • 速度: 这个微小的实习生生成攻击的速度比那个庞大的顾问快 3.7 倍
  • 体积: 实习生的体积要小 11.3 倍(它占用的内存极少)。
  • 成功率: 尽管体积微小,但实习生的效率极高。在面对最难的目标(如 GPT-4)时,它的成功率达到了 96.4%,这比目前几乎所有其他方法都要好。

为什么这很重要(根据论文观点)

作者表示,这证明了你不需要超级计算机也能破解 AI 安全性。你可以训练一个小型、廉价的模型一次,然后随时随地使用它来测试安全防御。

他们将此视为对整个行业的“压力测试”。通过展示创建一个轻量级、高效攻击者的过程是多么容易,他们希望安全团队意识到目前的防御措施还不够强大,并以此推动构建更好的防御体系。

简而言之: 他们找到了如何将一个庞大、缓慢、昂贵的“黑客”缩减为一个微小、快速、廉价的“黑客”的方法,通过一次性教学并让它从游戏中学习,从而达到同样的效果。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →