← 最新论文
💻 computer science

Adaptive Probe-based Steering for Robust LLM Jailbreaking

本文介绍了基于自适应探针的引导方法,这是一种利用模型提取技术来逼近理想引导向量并根据激活统计量自适应调整引导强度的鲁棒越狱方法,该方法无需人工调优或额外提示即可将加固大语言模型的有害性评分从 6% 显著提升至 70%。

原作者: Junxi Chen, Junhao Dong, Xiaohua Xie

发布于 2026-05-21
📖 1 分钟阅读☕ 轻松阅读

原作者: Junxi Chen, Junhao Dong, Xiaohua Xie

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

将大语言模型(LLMs)想象成经过高度训练的安全警卫。这些警卫被教导了严格的规则,绝不说出任何有害、粗鲁或危险的内容。这种训练被称为“对齐”。然而,研究人员发现,这些警卫有时会被一种称为“越狱”的技术诱骗而打破规则。

本文介绍了一种更强大的诱骗这些警卫的新方法,它不是通过更大声地喊叫或使用令人困惑的词语,而是通过物理性地推动警卫的内部思维过程。

以下是他们方法的分解,使用简单的类比:

问题:“粗略草稿”式的推动

以往的方法试图通过寻找特定的“推动向量”来越狱这些模型。可以将这个向量想象为推动模型内部思维的一个特定方向。

  • 缺陷:想象一下,你试图将一个沉重的推车推向特定方向,但你使用的地图是由一个略有色盲的人绘制的。你的地图(即“转向向量”)略有偏差。
  • 手动调整:为了让推动生效,你必须手动猜测该用多大的力(即“转向强度”)。推得太猛,推车就会撞毁(模型开始胡言乱语);推得太轻,它又不会移动。这种方法缓慢、令人沮丧,且在面对更新、更坚固的安全警卫时往往失败。

解决方案:“基于自适应探针的转向”

作者提出了一种更聪明的方法,以找到正确的方向和合适的力度。他们称之为基于自适应探针的转向

1. “模型提取”技巧(修正地图)

作者没有仅仅使用最初那张粗略的地图,而是采用了一种受“模型提取”启发的技术。

  • 类比:想象你试图找到通往隐藏宝藏的完美路线。与其只看一张旧地图,不如你走一步,检查是否接近目标,然后根据新信息更新你的地图。你反复重复这一过程。
  • 在论文中:他们先对模型进行初始“推动”,观察结果,然后利用一位智能裁判(即“标注器”)对结果进行标记。他们利用这些反馈迭代地重绘地图(即转向向量)。这消除了“噪声”,无需新的复杂提示,就能找到理想的方向。

2. “自适应强度”(完美的推动)

一旦确定了正确的方向,他们就需要知道该用多大的力。

  • 旧方法的缺陷:旧方法采用“一刀切”的推动方式。它们假设模型大脑的每一层都需要相同大小的力。
  • 类比:想象你推一叠箱子。底部的箱子很重,需要用力猛推。顶部的箱子很轻;如果你像推底部箱子那样用力推它们,它们就会从堆上飞出去并摔坏。
  • 修正:作者观察模型内部思维在每个层级(即激活统计)的“音量”。如果思维很安静,他们就轻轻推;如果思维很响亮,他们就用力推。这防止了模型因过度转向而胡言乱语,并确保推动真正生效。

结果:攻破堡垒

该论文将这种新方法针对 12 种不同的“加固”模型进行了测试——这些模型是专门设计为极难越狱的。

  • 之前:在此方法出现之前,这些坚固的模型仅约有**6%**的时间会泄露有害内容。它们看起来几乎坚不可摧。
  • 之后:使用这种新的自适应推动后,有害内容的比例跃升至平均70%
  • 结论:作者成功揭示,即使是最强大的安全警卫,其内部思维过程中也存在一个“弱点”,如果你确切知道如何推动它们,就可以利用这一弱点。

为何这很重要(根据论文所述)

作者指出,这不仅仅是为了破坏事物,更是为了进行压力测试。正如你不会在不测试桥梁能承受多大重量的情况下建造桥梁一样,我们也不应在不尝试攻破 AI 安全防御的情况下就信任它们。该方法提供了一种更强健、更自动化的方式来发现这些弱点,从而构建更好、真正可靠的防御。

简而言之:他们制造了一个机器人,能够学习以完美的方向和完美的力度推动模型的内部思维,证明了即使是最安全的 AI 模型,也可能被诱骗而打破规则。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →