← 最新论文
💻 computer science

Safety-Potential Pruning for Enhancing Safety Prompts Against VLM Jailbreaking Without Retraining

该论文提出了一种无需重训练的“安全潜力剪枝”框架,通过识别并移除对安全提示响应较弱的权重来放大安全子网络,从而在保持模型良性性能的同时显著降低视觉语言模型遭受越狱攻击的成功率。

原作者: Chongxin Li, Hanzhang Wang, Lian Duan

发布于 2026-03-17
📖 1 分钟阅读☕ 轻松阅读

原作者: Chongxin Li, Hanzhang Wang, Lian Duan

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文提出了一种名为"安全潜力剪枝"(Safety-Potential Pruning)的新方法,用来给多模态大模型(既能看图又能聊天的 AI)穿上更坚固的“防弹衣”,防止它们被“越狱”(Jailbreaking,即通过特殊话术诱导 AI 说坏话或做坏事)。

为了让你轻松理解,我们可以把整个故事想象成管理一家繁忙的“全能餐厅”

1. 背景:餐厅里的“捣蛋鬼”

现在的 AI 模型就像一家全能餐厅,厨师(模型)什么菜都能做(看图、回答问题、写代码)。但是,总有一些捣蛋鬼(黑客或恶意用户)试图通过特殊的“暗号”(越狱提示词)让厨师做出违规的菜(比如教人制造武器、泄露隐私)。

  • 现状:以前,餐厅老板(开发者)主要靠两招:
    1. 重新培训厨师(微调):让厨师重新学习规矩。但这很贵、很慢,而且容易让厨师忘了怎么做好吃的菜(损害了正常功能)。
    2. 门口贴标语(安全提示):在菜单上写“禁止做坏事”。但这招有时候不管用,因为厨师脑子里的“坏习惯”回路太深,标语只是浮在表面。

2. 核心发现:餐厅里藏着“隐形保安”

作者通过观察发现,这家餐厅里其实一直藏着一群隐形的保安(安全子网络)。

  • 平时大家点正常菜时,这些保安都在睡觉(参数处于静默状态)。
  • 只有当有人大声喊出“这是违规的!”(安全提示词)时,这群保安才会突然醒过来,开始工作,阻止厨师做坏事。
  • 关键问题:这些保安虽然醒了,但周围还有很多捣乱的闲杂人员(对安全不敏感的参数)在干扰他们,导致保安有时候拦不住坏人。

3. 解决方案:只剪掉“闲杂人员”

作者提出的"安全潜力剪枝",就像是一个超级精准的“大扫除”

  • 传统剪枝(为了省空间):像是一个粗心的清洁工,不管是谁,只要看着不起眼就砍掉。这可能会误伤保安,或者把保安周围的干扰源留得太少,导致餐厅瘫痪。
  • 我们的方法(安全潜力剪枝):
    1. 观察:先让厨师面对一个“安全提示”(比如“不要做坏事”),看看哪些神经元(厨师的大脑回路)被强烈激活了。
    2. 识别:找出那些对“安全提示”毫无反应的神经元。这些就是“闲杂人员”或者“捣乱分子”。
    3. 剪枝(一刀切):直接把这些不听话的神经元剪掉(把权重设为 0),完全不需要重新培训厨师
    4. 结果:剩下的网络里,“安全保安”的通路变得非常清晰和强壮。当坏人再来时,保安能更敏锐、更果断地拦截。

4. 比喻总结:修剪花园

想象你的大脑(AI 模型)是一个大花园

  • 杂草:那些容易让 AI 产生危险想法的神经连接。
  • 花朵:那些让 AI 变聪明、能正常聊天的神经连接。
  • 安全提示:就像是一阵特定的风
  • 传统做法:给花园喷除草剂(重新训练),或者在门口挂个牌子(提示词)。
  • 本文做法
    1. 先吹一阵“安全风”(输入安全提示)。
    2. 发现只有特定的几株植物(安全子网络)在风中剧烈摇摆(被激活)。
    3. 其他的植物在风中纹丝不动
    4. 于是,园丁(算法)拿着剪刀,只剪掉那些纹丝不动的植物
    5. 神奇效果:剩下的花园里,那些“摇摆植物”(安全机制)因为没有了杂草的遮挡,长得更壮、反应更快了。而且,因为没动那些负责“开花结果”(正常任务)的植物,花园依然美丽。

5. 实验结果:既安全又好用

作者在三个不同的 AI 模型(Qwen, LLaVA, InstructBLIP)和三个“越狱”测试集上做了实验:

  • 防越狱能力大增:相比只用提示词,这种方法让 AI 拒绝坏请求的成功率提高了最高 22%
  • 正常能力没受损:AI 在正常回答问题、看图说话时,表现依然很好,没有变笨。
  • 无需重训:整个过程像是一次性的“手术”,剪完就完事,不需要像重新训练那样烧钱烧时间。

6. 结论

这篇论文告诉我们:AI 的安全能力其实早就藏在它的身体里了,只是平时被“杂草”挡住了。我们不需要给 AI 做“整容手术”(重新训练),只需要用一种聪明的方法(安全潜力剪枝)把干扰它的“杂草”剪掉,就能让 AI 自带的“安全卫士”发挥最大威力。

一句话总结
这就好比给 AI 做了一次精准的“排毒”手术,去掉了那些让它容易“走火入魔”的多余神经,让它原本就有的“正义感”变得更强,而且做完手术它依然聪明能干。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →