将大语言模型(LLMs)想象成经过高度训练的安全警卫。这些警卫被教导了严格的规则,绝不说出任何有害、粗鲁或危险的内容。这种训练被称为“对齐”。然而,研究人员发现,这些警卫有时会被一种称为“越狱”的技术诱骗而打破规则。
本文介绍了一种更强大的诱骗这些警卫的新方法,它不是通过更大声地喊叫或使用令人困惑的词语,而是通过物理性地推动警卫的内部思维过程。
以下是他们方法的分解,使用简单的类比:
问题:“粗略草稿”式的推动
以往的方法试图通过寻找特定的“推动向量”来越狱这些模型。可以将这个向量想象为推动模型内部思维的一个特定方向。
- 缺陷:想象一下,你试图将一个沉重的推车推向特定方向,但你使用的地图是由一个略有色盲的人绘制的。你的地图(即“转向向量”)略有偏差。
- 手动调整:为了让推动生效,你必须手动猜测该用多大的力(即“转向强度”)。推得太猛,推车就会撞毁(模型开始胡言乱语);推得太轻,它又不会移动。这种方法缓慢、令人沮丧,且在面对更新、更坚固的安全警卫时往往失败。
解决方案:“基于自适应探针的转向”
作者提出了一种更聪明的方法,以找到正确的方向和合适的力度。他们称之为基于自适应探针的转向。
1. “模型提取”技巧(修正地图)
作者没有仅仅使用最初那张粗略的地图,而是采用了一种受“模型提取”启发的技术。
- 类比:想象你试图找到通往隐藏宝藏的完美路线。与其只看一张旧地图,不如你走一步,检查是否接近目标,然后根据新信息更新你的地图。你反复重复这一过程。
- 在论文中:他们先对模型进行初始“推动”,观察结果,然后利用一位智能裁判(即“标注器”)对结果进行标记。他们利用这些反馈迭代地重绘地图(即转向向量)。这消除了“噪声”,无需新的复杂提示,就能找到理想的方向。
2. “自适应强度”(完美的推动)
一旦确定了正确的方向,他们就需要知道该用多大的力。
- 旧方法的缺陷:旧方法采用“一刀切”的推动方式。它们假设模型大脑的每一层都需要相同大小的力。
- 类比:想象你推一叠箱子。底部的箱子很重,需要用力猛推。顶部的箱子很轻;如果你像推底部箱子那样用力推它们,它们就会从堆上飞出去并摔坏。
- 修正:作者观察模型内部思维在每个层级(即激活统计)的“音量”。如果思维很安静,他们就轻轻推;如果思维很响亮,他们就用力推。这防止了模型因过度转向而胡言乱语,并确保推动真正生效。
结果:攻破堡垒
该论文将这种新方法针对 12 种不同的“加固”模型进行了测试——这些模型是专门设计为极难越狱的。
- 之前:在此方法出现之前,这些坚固的模型仅约有**6%**的时间会泄露有害内容。它们看起来几乎坚不可摧。
- 之后:使用这种新的自适应推动后,有害内容的比例跃升至平均70%。
- 结论:作者成功揭示,即使是最强大的安全警卫,其内部思维过程中也存在一个“弱点”,如果你确切知道如何推动它们,就可以利用这一弱点。
为何这很重要(根据论文所述)
作者指出,这不仅仅是为了破坏事物,更是为了进行压力测试。正如你不会在不测试桥梁能承受多大重量的情况下建造桥梁一样,我们也不应在不尝试攻破 AI 安全防御的情况下就信任它们。该方法提供了一种更强健、更自动化的方式来发现这些弱点,从而构建更好、真正可靠的防御。
简而言之:他们制造了一个机器人,能够学习以完美的方向和完美的力度推动模型的内部思维,证明了即使是最安全的 AI 模型,也可能被诱骗而打破规则。
技术摘要:基于自适应探针的鲁棒性大语言模型越狱导向
1. 问题陈述
本文探讨了评估专为“抗越狱”设计的大语言模型(LLM)对抗鲁棒性的挑战。尽管防御机制(如电路断路器、深度对齐、RepBend)声称其有害性得分接近零,但作者认为现有的攻击方法不足以揭示其真正的最坏情况漏洞。
当前的对比导向方法通过沿源自对比提示的线性方向引导隐藏状态来控制 LLM 行为,存在两个主要局限性:
- 有偏的方向搜索:学习到的导向向量本质上是有噪声的,因为它们源自有限的对比提示,这些提示可能包含与目标“忠实 - 不忠实”行为无关的耦合概念方向(例如,从伦理到非伦理,或从蛋糕到炸弹)。
- 耗时的强度调优:现有方法依赖基于准确性的层选择(不稳定)和层均匀的对数几率目标。这往往导致在激活幅度较小的层中出现“过度导向”,或者需要繁琐的手动超参数调优来寻找最佳导向强度。
目标是开发一种自动化、鲁棒的攻击方法,以最大化 LLM 鲁棒性的内层最大化问题(即寻找能诱导最有害响应的修改 Δθ),而无需目标响应或梯度反向传播。
2. 方法论
所提出的方法基于自适应探针的导向通过两项主要创新增强了标准对比导向流程:迭代方向细化(受模型提取启发)和自适应强度调优。
2.1. 迭代方向细化(模型提取)
作者将方向搜索重新表述为模型提取问题。他们提出了一种迭代算法(算法 1)来逼近理想的导向向量,而不是在静态对比提示上仅训练一次线性探针:
- 初始化:使用一组标准的对比提示训练初始线性探针。
- 迭代增强:
- 使用当前探针在有害提示上引导 LLM。
- 生成响应并收集由此产生的激活。
- 标注:使用可靠的“越狱判断器”(一个现成的基于 LLM 的标注器,在实验中具体为 SRF)将这些新激活标记为“忠实”或“不忠实”。
- 重训练:用这些新标注的激活增强训练集,并重新训练探针。
- 原理:这一过程称为自适应重训练 (AR),专注于当前分类器最不确定的样本(即决策边界附近),有效过滤了初始提示中固有的耦合概念方向带来的噪声。
2.2. 自适应强度调优
作者解决了层选择不稳定及过度导向风险的问题:
- 丢弃最后一层激活:忽略最后一个解码器的激活,因为它充当局部对数几率偏差而非上下文隐藏状态,且对其进行导向通常会导致重复。
- 自适应对数几率目标:该方法不再在所有层设置均匀的目标对数几率 s(l)(这会导致在激活幅度较小的早期层出现过度导向),而是根据激活统计量设定目标。
- 具体而言,导向强度被设定为训练集中忠实激活的最大已知对数几率:s(l)=maxx∈Htrainf(l)(x)。
- 这利用了线性控制假设 (LCA),该假设认为有害性是相对于理想导向向量相似度的单调递增函数。通过将目标设定为观测到的最大对数几率,该方法确保了无需手动调优即可实现最强的导向。
- 导向所有令牌:与仅导向响应令牌的先前工作不同,该方法在所有令牌位置引导激活,将导向向量视为应用于整个生成过程的参数高效适配器(类似于 LoRA)。
3. 主要贡献
- 迭代方向细化算法:一种受模型提取启发的方法,通过迭代采样和标注导向激活来逼近理想导向向量。它不需要额外的对比提示,仅需一个额外的标注器。
- 自适应强度调优:识别了基于准确性的层选择的不稳定性以及层均匀目标的风险。作者提出摒弃基于准确性的选择,转而利用激活统计量(特别是观测到的最大对数几率)来指导导向强度,从而消除了持续参数调优的需求。
- 综合评估:该方法针对 12 种加固的 LLM(包括电路断路器、深度对齐和 RepBend 变体)及通用模型进行了评估。
4. 结果
实验表明,所提出的方法显著优于现有的对比导向基线(RepE、SCAV、拒绝方向、角度导向):
- 有效性:该方法将加固 LLM 的平均有害性得分从6% 提升至 70%(由 SRF、HB 和 SR 判断器测量)。
- 鲁棒性:它在所有 12 个测试的加固模型中均实现了高有害性得分(SR > 0.5,大部分 > 0.8),而其他方法往往无法找到有效方向,或在特定模型上得分接近零(例如 RepE 在大多数模型上失败)。
- 消融研究:
- 自适应强度 (AS):对于防止过度导向至关重要;若无此机制,大多数模型的得分仍接近零。
- 丢弃最后一层 (DLA) 与导向所有令牌 (SAT):这两个组件均有助于性能提升,其中 SAT 显示出 15% 的平均改进。
- 自适应重训练 (AR):与朴素增强(仅添加更多提示而无迭代细化)相比,平均提升了 26% 的性能。
- 泛化性:该方法还成功攻击了通用 LLM 和推理模型(如 Qwen3-4B-Thinking),在这些模型上实现了更高的有害性得分,表明推理能力可能与更高的导向脆弱性相关。
5. 意义与主张
本文将其定位为旨在揭示加固 LLM 崩溃的攻击论文。
- 红队测试:作者声称,他们的方法为红队测试提供了更强大的工具,这是开发真正可靠防御的基础。通过揭露“接近零”有害性声明可被绕过,他们主张对对抗鲁棒性进行更严格的评估。
- 理论洞察:这项工作挑战了浅层对齐或特定激活操纵(如电路断路器)足以保障安全的假设,证明了对比导向可以绕过声称对激活扰动具有鲁棒性的防御机制。
- 谦逊态度:作者承认,他们的方法依赖于标注器的质量,且当前实现因需要生成响应以供标注而涉及时间成本。他们将他们的贡献框架化为一个框架(标注器 + 采样器 + 提取器),而非最终完美的算法,并指出标注器和采样策略的未来改进可能会进一步提升性能。
总之,本文论证了通过利用模型提取原理和自适应统计量,可以自动化并显著提高基于探针的越狱方法的有效性,从而揭示出先前方法未能发现的、处于最先进安全对齐模型中的漏洞。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。