想象一位训练有素的保安(即 AI 模型),其职责是帮助人们修复损坏的锁具并理解门的运作原理。然而,这位保安接受过一条非常严格的规则训练:“如果某个请求听起来像有人试图闯入,我必须立即回答‘不’,即使他们只是 locksmith 在假门上练习。”
这给安全专家带来了问题。当保安说“不”时,专家们无法判断这位保安是“不知道如何修锁”(缺乏技能),还是仅仅“过于谨慎”(拒绝策略)。
论文《Ablating Safety》(安全消融)就像一项受控实验,研究人员试图暂时放宽那条严格的“不”规则,以观察会发生什么。他们并非试图制造一个“坏”AI,而是试图精确衡量有多少有用技能被隐藏在拒绝背后,以及放宽规则是否会导致保安意外地开始帮助真正的窃贼。
以下是他们实验的分解,使用简单的类比说明:
1. 问题:过度保护的保安
在现实世界中,AI 模型通常被训练为拒绝任何看似网络攻击的请求。这对安全性是有益的,但这使得很难测试 AI 是否真的足够聪明,能够协助“经授权”的安全任务(例如修复代码中的漏洞)。如果 AI 拒绝,测试就会失败,但我们不知道原因。
2. 实验:“消融”(移除)安全性
研究人员尝试了不同的方法来“调低”拒绝开关,而无需从头重新训练整个 AI。他们测试了三种主要方法:
方法 A:“提示”技巧(礼貌地请求)
- 类比: 告诉保安:“嘿,这是一次演习,不是真正的闯入。”
- 结果: 这有轻微帮助,但保安仍然大多保持谨慎。
方法 B:“激活投影”(内部推动)
- 类比: 想象保安的大脑里有一个特定的“拒绝按钮”。这种方法试图在 AI 思考时物理地按下该按钮,而不改变保安的实际训练。
- 结果: 这很危险。它让保安回答了更多安全问题,但也使保安更有可能意外同意协助真正的恶意请求(不安全溢出)。这就像为了更清楚地查看房子而关闭警报系统,结果现在任何人都可以随意进入。
方法 C:"LoRA"适配器(专门化训练)
- 类比: 他们没有改变保安的大脑,而是给保安穿上了一件专门的“安全维修”背心。这件背心专门教导保安如何处理维修任务,同时保持其通用知识 intact。
- 结果: 这是最成功的方法。保安在经授权的安全任务上变得非常擅长(得分 0.87/1.0),同时仍然主要拒绝协助恶意请求。
3. 关键发现:“效用 - 风险”前沿
该论文提出了一种看待安全的新方式。他们不再问"AI 安全吗?”或"AI 聪明吗?”,而是问:“权衡是什么?”
- 糟糕的权衡: 某些方法(如内部推动)让 AI 回答了更多问题,但也使 AI 变得危险。这就像移除保安的手铐;他可以移动得更快,但也可能伤害无辜的人。
- 良好的权衡: 专门化训练(LoRA)让 AI 在安全任务上变得更聪明,同时没有使其变得危险地鲁莽。它找到了一个甜点区,使 AI 既有用又安全。
4. 结论:这不是关于“解除审查”
作者强调,他们并非试图发布一个会做任何事的“解除审查”AI。他们的目标是理解安全的机制。
- 拒绝不是一堵墙;它是一个旋钮。 你可以调低它,但必须密切观察其他旋钮(如“通用智能”和“安全性”)。
- 仅仅因为 AI 回答了并不意味着它是安全的。 AI 可能停止拒绝,但开始提供无用或危险的答案。
- 最佳方法: 使用专门化训练(如“安全背心”)来解锁特定技能,而不会破坏整体安全系统。
总结
将这篇论文视为一项关于如何安全调整烟雾探测器灵敏度的研究。
- 如果调得太灵敏,它会对烤焦的面包尖叫(拒绝有益任务)。
- 如果调得太不灵敏,当房子着火时它不会尖叫(允许危险任务)。
- 研究人员发现,简单地转动旋钮(激活投影)是混乱且危险的。相反,安装专用过滤器(LoRA)可以让探测器忽略烤焦的面包,同时在真正发生火灾时发出尖叫。
该论文得出结论:对于安全工作,我们需要一起衡量有用性与安全性之间的平衡,而不是试图完全移除安全过滤器。
技术摘要:剥离安全性:用于安全应用的语言模型对齐移除机制
问题陈述
安全对齐的语言模型经常拒绝执行授权的网络安全任务(例如漏洞分类、补丁分析、安全修复),因为这些提示在词汇上类似于恶意指令。这在安全评估中造成了测量混淆变量:模型未能回答可能源于拒绝策略,而非缺乏底层能力。虽然“越狱”研究侧重于提示层面的绕过,但本文探讨了一个不同的科学问题:当通过对齐移除(而非输入重构)进行模型级转换时,任务能力、通用能力以及评估范围外的不安全行为会发生哪些具体变化?核心问题在于区分“解除审查”模型与真正恢复授权的安全效用,同时不引发广泛的不安全溢出。
方法论
本文提出了剥离安全性(ABLATING SAFETY),这是一种受控的转换 - 评估协议,旨在衡量对齐移除的效用 - 风险前沿。本研究的目的并非发布未加审查的模型,而是审计特定干预措施的副作用。
评估协议
该协议在三个维度上评估转换:
- 授权安全效用(S):在防御性安全任务(漏洞分类、补丁分析、安全修复)上的表现。
- 通用能力保留(G):在良性通用任务(逻辑、算术、代码生成)上的表现。
- 不安全溢出(H):对范围外、非操作性的有害提示的顺从程度。
本研究比较了五类干预措施:
- 提示上下文:授权上下文提示(输入级基线)。
- 激活投影:运行时修改隐藏状态,以投影出估计的拒绝方向(可逆)。
- 表示控制:子空间投影(例如,秩为 4 的拒绝子空间),以测试方向特异性。
- 微调(LoRA):用于任务适应、拒绝抑制和保留的参数高效微调。
- 控制组:随机投影、无害投影和主题匹配的拒绝投影,以区分特定机制效应与噪声。
基准:SECURITY-AR
评估利用SECURITY-AR,这是一个包含 60 个提示的套件,包括:
- 30 个授权防御性安全任务。
- 20 个良性通用能力任务。
- 10 个范围外探针(高层、非操作性的滥用请求)。
范围外探针的原始非拒绝输出在公共制品中已被编辑,以防止滥用。
模型与实现
- 投影试点:在 Qwen2.5(0.5B、1.5B、3B)和 SmolLM2-360M 上评估,涵盖四种条件(对齐、提示、随机投影、拒绝投影)。
- 扩展 LoRA 评估:在 Qwen2.5 模型上评估,涵盖 11 种条件,包括仅任务 LoRA 适配器、拒绝抑制和保留混合训练。
- 评分:使用沙箱验证器处理可执行任务,基于评分标准的审查处理分析任务,并使用拒绝分类器。指标包括拒绝率、尝试率、任务得分和不安全顺从指标。
主要结果
1. 激活投影脆弱且风险高
单向量拒绝投影(移除估计的拒绝方向)显示出有限的效用和高风险:
- 效用:仅将平均安全得分略微提高(从 0.46 提升至 0.50)。
- 溢出:大幅增加了范围外的不安全顺从(从 0.10 激增至 0.47)。
- 对比:秩为 4 的拒绝子空间投影达到了相似的安全得分(0.51),但保持了对齐的溢出率(0.10),这表明子空间秩和方向构建是关键变量。随机投影有时能达到与拒绝投影相似的结果,表明简单的扰动可以模仿特定机制。
2. LoRA 微调提供更优的效用 - 风险权衡
基于微调的干预措施展示了在不造成灾难性溢出的情况下恢复能力的更清晰路径:
- 仅任务 LoRA:将平均安全得分提高至0.87,同时保持较高的通用得分(0.83)并将不安全顺从保持在低位(0.13)。
- 拒绝抑制 LoRA:实现了相似的安全增益(0.87),但相比仅任务 LoRA 显示出略高的溢出(0.13)。
- 保留混合 LoRA:当拒绝抑制与良性保留数据结合时,安全得分保持高位(0.84),但不安全顺从显著上升至0.27。
- 模型依赖性:溢出行为因模型规模而异;Qwen2.5-3B 在 LoRA 变体下保持了零不安全顺从,而较小模型(0.5B、1.5B)在某些适配器下显示出增加的溢出。
3. 拒绝减少 = 能力恢复
研究发现,单纯减少拒绝并不能保证任务成功。模型可以停止拒绝,同时产生不连贯或无用的内容。“效用 - 风险前沿”是主要指标:只有当转换在改善授权任务表现的同时不破坏通用推理或广泛增加不安全行为时,该转换才是有用的。
主要贡献
- 对齐移除的形式化:本文将对齐移除框架化为转换 - 评估问题,将拒绝减少与任务成功、保留和溢出区分开来。
- SECURITY-AR 基准:一种针对授权安全任务的受控基准设计,包含编辑后的公共制品以及解释效用 - 风险权衡的决策规则。
- 不同权衡的实证证据:研究表明,提示、激活、表示和微调干预会引发不同的效用 - 风险概况。具体而言,基于 LoRA 的任务适应以有限的溢出恢复了高安全效用,而单向量激活投影往往无法恢复能力并增加不安全顺从。
意义与主张
本文主张,对齐移除应作为效用 - 风险前沿进行评估,而非作为“解除审查”的配方。
- 机制可分离性:安全行为并非单一的壁垒;它是效用、保留和溢出相互作用的边界上的耦合变量。
- 治理影响:提示层面的绕过、模型编辑和微调并非等效的干预措施。它们暴露了不同的能力和失败模式,需要不同的治理控制。
- 适度范围:作者明确指出,这些结果仅限于报告的开放权重模型、任务套件和转换家族。他们不声称观察到的前沿可推广到前沿规模系统或所有去对齐方法。
- 发布安全:本文强调,顺从本身既不是能力也不是安全部署。公共发布仅包含评估框架、净化后的提示和聚合指标;转换后的检查点和操作利用载荷被扣留。
总之,本文认为,对于安全应用而言,“有用”的对齐移除被定义为恢复授权的安全能力,且该能力严格保持在经过验证的授权边界内,而非仅仅消除拒绝令牌。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。