← 最新论文
💻 computer science

Revisiting JBShield: Breaking and Rebuilding Representation-Level Jailbreak Defenses

本文表明,JBShield 越狱防御机制因其基于概念的检测存在结构性缺陷而易受一种新型自适应攻击(JB-GCG)的利用,并提出了一种更鲁棒的多层表示轨迹验证(RTV)防御方法,该方法对新型及后续自适应攻击均实现了近乎完美的检测。

原作者: Kemal Derya, Berk Sunar

发布于 2026-05-06
📖 1 分钟阅读☕ 轻松阅读

原作者: Kemal Derya, Berk Sunar

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象大型语言模型(LLM)是受过高度训练、彬彬有礼的机器人。我们教会了它们乐于助人,但也教会了它们在被要求做危险或恶意的事情时说“不”。这被称为“对齐”。然而,聪明的黑客找到了欺骗这些机器人、使其无视安全规则的方法。这些欺骗手段被称为“越狱”。

本文讲述了一个关于保安、一名聪明的黑客以及一套全新、更智能的安保系统的故事。

旧卫士:JBShield

研究人员首先审视了一套名为JBShield的最新安保系统。将 JBShield 想象成俱乐部门口检查特定证件的保安,他会在放任何人进入前检查两张特定的 ID:

  1. “有毒”ID:这个人看起来是否在表现恶意?
  2. “越狱”ID:这个人看起来是否试图偷偷混入某种诡计?

JBShield 有一条严格规则:你必须同时拥有这两张 ID 才会被标记。 如果你只有一张,或者一张都没有,保安就会放行。JBShield 的创建者声称它是完美的,能阻止 100% 的攻击。

黑客的突破:JB-GCG

本文的作者决定测试 JBShield 是否真的坚不可摧。他们扮演“白帽”黑客(即为了修复漏洞而进行破坏的人)的角色,完全了解这位保安的运作机制。

他们发现了保安逻辑中的一个缺陷。因为保安需要同时看到两张 ID 才会拉响警报,黑客意识到他们只需要隐藏其中一张即可。

他们创造了一种名为JB-GCG的新攻击手段。想象一名间谍,他穿着伪装,让自己看起来完全无辜(隐藏了“有毒”ID),但身上仍携带着秘密武器(保持“越狱”ID 激活)。由于保安只检查是否同时具备两张 ID,他看到了无辜的伪装,便让间谍进去了。

结果:黑客成功欺骗机器人做坏事的比例达到了 53.4%,尽管原始安保系统声称其安全性为 100%。这证明了一个系统可能在常规测试中看起来坚不可摧,但当聪明的对手适应其特定规则时,它便会崩溃。

新方案:RTV(“指纹”扫描仪)

作者意识到,虽然黑客擅长愚弄保安的两项具体检查,但黑客留下了另一种类型的痕迹。

当普通人提问时,机器人“大脑”的激活模式会从顶部到底部呈现出一致且可预测的规律。而当黑客试图欺骗机器人时,他们必须强迫机器人在开始时表现出不同的行为(以隐藏“有毒”ID),但机器人自身的内部处理往往会在结束时破坏这种伪装,导致模式看起来怪异且不一致。

作者构建了一种名为**RTV(表示轨迹验证)**的新防御机制。

类比

  • JBShield 就像在门口检查一个人的脸和鞋子。如果脸看起来没问题,就放人进去。
  • RTV 则像是一台监控摄像头,观察一个人穿过整个走廊的全过程。它不仅仅看脸或鞋子,而是检查其步态(行走方式)是否从走廊起点到终点保持一致。

普通人走路平稳流畅。试图混入的黑客为了隐藏身份,起步时必须跛行,但随着他们向走廊深处走去,这种跛行会加剧或发生变化。RTV 能捕捉到这种“跛行”(不一致性)并识破他们。

工作原理

  1. 它在三个不同层级观察机器人的“大脑”活动(就像观察走廊的起点、中间和终点)。
  2. 它检查“拒绝”信号(机器人的“不”的本能)在这些层级之间是否保持一致。
  3. 它使用一种名为马氏距离的数学工具(将其想象为一个“怪异度计”)来判断该模式是符合普通人还是黑客的特征。

结果

  • 针对黑客的新诡计(JB-GCG),RTV 拦截了**100%**的尝试。
  • 它不需要见过任何先前的攻击就能学习;它只需要知道什么是“正常”的样子。

最终对决:黑客能击败新系统吗?

作者并未止步于此。他们试图用一种更聪明、更强大的攻击来破解自己新构建的系统(RTV)。他们让黑客完全掌握了新安保摄像头和“怪异度计”的运作机制。

结果

  • 黑客仍然可以攻破系统,但这变得极其困难。
  • 黑客的成功率从 53% 下降到了仅仅7%
  • 为了取得这微小的成功,黑客必须消耗比之前多13 倍的计算能力(能量和时间)。

黑客为何失败?
作者解释说,新系统为黑客制造了一种“张力”或“死局”。为了隐藏身份,黑客必须让机器人的“大脑”在开始时看起来“正常”。但为了欺骗机器人做坏事,黑客又必须让“大脑”在后来看起来“异常”。黑客无法同时做到这两点。这就像试图同时向前走和向后走;你只会卡住不动。

总结

  1. 旧防御(JBShield):检查两个特定项目。黑客通过隐藏其中一项找到了漏洞。
  2. 攻击(JB-GCG):利用该漏洞,以 53% 的比率突破了防御。
  3. 新防御(RTV):检查机器人“思维过程”在整个系统中的连贯性,而不仅仅是某个单点。
  4. 最终裁决:新防御强大得多。它几乎每次都能抓住黑客,而攻破它所需的努力如此之大,以至于对大多数攻击者来说已不切实际。

该论文得出结论:仅在思维过程的某一点检查机器人的安全性是不够的。你必须观察整个旅程,才能抓住那些诡计多端的人。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →