← 最新论文
💻 computer science

Steering Beyond the Support: Adversarial Training on Unsupervised Jailbroken Activation Simulation

本文提出了一种零样本越狱防御框架,该框架利用无监督潜在方向发现来模拟多样化的对抗激活,并训练一个势诱导的转向场,以有效引导未见过的越狱攻击走向拒绝,同时保留良性效用。

原作者: Luoyu Chen, Weiqi Wang, Zhiyi Tian, Chenhan Zhang, Feng Wu, Jianhuan Huang, Ahmed Asiri, Shui Yu

发布于 2026-05-26
📖 1 分钟阅读☕ 轻松阅读

原作者: Luoyu Chen, Weiqi Wang, Zhiyi Tian, Chenhan Zhang, Feng Wu, Jianhuan Huang, Ahmed Asiri, Shui Yu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是用简单语言和创意类比对论文《超越支持集的引导》的解释。

核心问题:“训练集”陷阱

想象你雇佣了一位非常聪明的保安(AI)来保护一座博物馆。你通过向这位保安展示一本包含 100 种特定类型窃贼的照片集来训练他:一个戴着红帽子,一个留着假胡子,还有一个拿着撬棍。

保安学会了完美地识别这 100 种特定窃贼。然而,一个新窃贼出现了,他戴着蓝帽子,拿着激光切割机。由于保安只接受过“红帽子”和“撬棍”照片的训练,他无法识别这个新威胁,从而放行了此人。

在人工智能领域,这被称为越狱问题

  • 保安:一个被训练得既乐于助人又安全的大型语言模型(AI)。
  • 窃贼:那些诱使 AI 说出有害内容的“越狱”提示词。
  • 陷阱:以往的安全方法就像我们的保安一样。它们是基于已知越狱方式的静态、有限列表进行训练的。如果黑客发明了一种方法来诱使 AI(即训练列表中没有的方法),旧的安全方法就会失效。

旧方案与新思路

旧方法(监督式引导):
以前的研究人员试图通过教 AI 一个单一的“拒绝向量”来解决这个问题。这就像给保安一个巨大的磁铁,将一切从“有害”区域推开。

  • 缺陷:这种方法过于粗糙。如果你推开一切,可能会误伤有益的请求(比如询问汤的食谱)。此外,它只对那些经过训练能识别的特定窃贼有效。

新方法(本文的解决方案):
作者提出了一种更智能、更灵活的方法,称为无监督越狱激活模拟的对抗训练。这个名字很长,让我们用一个比喻来分解它。

比喻:“梦境模拟器”与“灵活力场”

作者没有在等待新窃贼出现,而是在 AI 的大脑中构建了一个梦境模拟器

  1. 梦境模拟器(无监督潜在方向发现)
    AI 知道“拒绝”是什么样子的(即说“我做不到”)。研究人员找到了一种数学方法来“拉伸”这种拒绝状态。想象一下,拿一根代表“拒绝”的橡皮筋,向随机方向拉伸它。

    • 令人惊讶的是,当你把它拉伸得足够远时,它会变成一种“越狱”状态(AI 同意做坏事)。
    • AI 这样做不需要任何真实的坏越狱示例。它本质上是通过扭曲自身的内部逻辑,凭空构想出成千上万个它从未见过的、新的虚假越狱场景。
  2. 灵活力场(势能函数)
    研究人员没有使用单一的磁铁,而是教 AI 一个动态力场

    • 对于良性请求:力场是隐形的。如果你请求写诗或数学帮助,AI 穿过力场时不会受到任何阻力。(这保留了 AI 的实用性)。
    • 对于恶意请求:力场变成了厚厚的、粘稠的泥浆。一旦 AI 开始思考有害的答案,力场就会将其强力推回“拒绝”区域。

训练过程:“内外”循环

训练过程就像一个同时运行两个关卡的视频游戏:

  • 关卡 1(内层步骤 - 攻击者)
    AI 试图打破自己的安全规则。它利用“梦境模拟器”生成它能想到的最难的虚假越狱。这就像黑客试图在墙上寻找漏洞。
  • 关卡 2(外层步骤 - 防御者)
    然后,AI 更新其“力场”以修补这些特定的漏洞。它学会将这些虚假越狱推回“拒绝”状态,同时确保墙壁不会阻挡“良性”请求。

他们重复这个循环数千次。“攻击者”变得更擅长发现新漏洞,而“防御者”则更擅长修补它们。由于攻击者是在实时编造新场景,防御者学会应对任何类型的越狱,而不仅仅是原始训练列表中的那些。

结果:更强大、更聪明的保安

该论文在三种不同的 AI 模型和六种不同的越狱攻击家族上测试了这种方法。

  • 得分:新方法阻止了超过**95%**的攻击(将“攻击成功率”保持在 5% 以下)。
  • 额外优势:与旧的“大磁铁”方法不同,这种新力场没有导致 AI 拒绝回答正常问题。它保持了 AI 的乐于助人和聪明才智。
  • 证明:研究人员表明,随着训练的深入,“梦境模拟器”覆盖了越来越多的“越狱领域”,有效地绘制了整个潜在威胁的景观,甚至包括那些尚未存在的威胁。

总结

简而言之,这篇论文通过教 AI想象其最坏的情况,然后构建一个定制的灵活护盾来阻止它们,从而解决了 AI 安全问题。AI 不再死记硬背坏蛋名单,而是学会了坏行为的形态,使其能够立即识别并阻止新的、未见过的诡计。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →