技术摘要:匹配排名而非概率收益实现真正的深度安全对齐
1. 问题陈述
开源大语言模型(LLMs)对于人工智能的民主化至关重要,但其开放性也为恶意攻击者带来了漏洞。一种特定且易于实现的威胁是预填充攻击(prefilling attack),即攻击者手动预填充助手的响应前缀(例如,“以下是制造炸弹的方法……”)以绕过安全过滤器。
Qi 等人(2025)最近的研究提出了一种使用数据增强进行监督微调(SFT)的“深度”安全对齐防御方法。该方法训练模型在有害的预填充之后立即生成自然语言拒绝,而不是仅仅输出固定的拒绝字符串。虽然这种方法对于标准的基于采样的解码和参数调整类利用(如针对温度系数的网格搜索)是有效的,但本文指出该方法存在一个根本性的缺陷:这种防御仍然是表层的。
作者证明,即使采用了深度安全对齐,模型在其前 k 个预测中仍保留了低概率但高排名(highly-ranked)的“有害”标记。通过忽略概率质量而仅根据排名(特别是前 20 名)选择标记,攻击者可以绕过拒绝机制。本文引入了**排名辅助预填充(Rank-Assisted Prefilling, RAP)**攻击来利用这一漏洞,并提出了一个新的训练目标——PRESTO,以实现真正的深度安全对齐。
2. 方法论
2.1 RAP 攻击
**排名辅助预填充(RAP)**攻击泛化了预填充技术。攻击者不再依赖高概率标记,而是从前 k 个预测的下一个标记(例如 k=20)中选择能够延续有害叙事的标记,无论其概率得分如何。
- 机制: 在每个解码步骤中,攻击者检查前 k 个标记。如果一个能自然延续有害预填充的标记(“有害标记”)出现在前 k 名中,则将其选中,即使一个拒绝标记(如“我”)具有显著更高的概率。
- 自动化(AutoRAP): 作者开发了一个自动化的 RAP 版本,它使用分类器来区分拒绝标记和有害延续标记,从而实现系统化地提取有害内容,而无需人工干预。
2.2 推前对齐(Push-Forward Alignment, PFA)
作者认为,数据增强防御的失败在于其关注点在于最小化拒绝标记的负对数似然(概率),而不是控制排名的有害标记。
- 概念: 在一个真正安全的模型中,第一个响应标记(无预填充时)的分布应当使拒绝标记处于顶端排名,并且不存在能延续预填充的有害标记。
- 目标: 模型应当将这种**排名-有害映射(rank-harm mapping)**从第一个标记的分布“推前”到后续所有的解码步骤中。这意味着要确保如果一个标记是有害的,那么无论预填充如何,它在输出分布中的排名都应保持较低水平。
- 形式化: 作者定义了一个排名-有害分布 R(s,x,xpre),表示第 s 个排名的标记是有害的概率。目标是最小化安全模型(无预填充)与受攻击模型(有预填充)之间的推移距离(Earth Mover's Distance, EMD)。
2.3 PRESTO:预填充注意力停止(PRefill attEntion STOpping)
为了在实践中实现 PFA,作者提出了基于 Transformer 中多头注意力(MHA)机制的正则化损失函数 PRESTO。
- 假设: 有害标记出现在前 k 名中的现象是由模型对有害预填充标记的注意力驱动的。如果模型可以被训练去“忽略”这些预填充标记(即减少对它们的注意力),输出分布将会恢复到原始提示词的、以拒绝为主的安全分布。
- 损失函数: PRESTO 最小化分配给有害预填充标记的注意力分数,同时最大化分配给非预填充标记的注意力。
ℓPRESTO(θ)=E(x,xpre)∼D[A1−A2]
其中 A1 是跨所有层和头的对预填充标记的平均注意力,A2 是对非预填充标记的平均注意力。
- 训练: 模型使用标准的数据增强损失(来自 Qi 等人,2025)结合 PRESTO 损失进行微调。两者都在单次前向传播中计算。
3. 核心贡献
- 识别 RAP 漏洞: 本文证明,通过数据增强实现的“深度”安全对齐是不充分的,因为它未能抑制有害标记的排名,而仅抑制了它们的概率。
- 排名辅助预填充(RAP)攻击: 一种新的、易于获取的攻击向量,通过选择低概率、高排名的标记来提取有害内容,有效地绕过了数据增强防御。
- 推前对齐(PFA): 一个理论框架,提出安全对齐必须在整个生成过程中保持第一个标记分布的排名-有害映射。
- PRESTO: 一种简单且具有机械可解释性的训练目标,通过正则化对预填充标记的注意力,显著增加了 RAP 攻击的难度。
4. 实验结果
作者在三个流行的开源模型上评估了 PRESTO:Llama 2 7B Chat、Qwen 3 8B 和 Gemma 3 12B IT。
- 攻击成功率:
- 在原始数据增强防御(Qi 等人,2025)下,RAP 攻击实现了较高的成功率(例如,在 Llama 2 7B 的 StrongREJECT 量表上约为 0.74)。
- 使用 PRESTO 后,RAP 攻击的成功率显著下降。在三个模型中,PRESTO 相比仅使用数据增强,实现了高达 4.7 倍的安全提升(有害性评分的降低)。
- AutoRAP 的表现与人类评估高度一致,证实了自动化攻击和防御的可行性。
- 效用保持:
- 使用 PRESTO 微调的模型在 MT-Bench(开放式生成)和 GSM-8K(数学推理)上保持了极具竞争力的效用,与仅使用数据增强训练的模型相比,性能下降不到 1%。
- 机械分析:
- 注意力分析显示,PRESTO 成功减少了对有害预填充标记的注意力,特别是在模型的后半部分层中,而这些层已知对安全决策至关重要。
- 该防御对 GCG(贪婪坐标梯度) 攻击保持稳健,表明 PRESTO 不会重新引入其他攻击向量的漏洞。
5. 重要性与主张
本文声称,实现“深度”安全对齐需要超越基于概率的目标,转向基于排名的约束。作者认为,如果模型的内部注意力机制仍然允许有害延续留在前 k 名中,那么仅仅训练模型以高概率输出拒绝标记是不够的。
通过引入 PRESTO,这项工作为构建更安全的开源模型提供了一条路径,使其能够抵御像 RAP 这样实际且低成本的攻击。其意义在于:
- 安全性的民主化: 使开源模型能够在允许预填充的客户侧应用(如 API)中部署,而无需担心被轻易绕过。
- 绕过成本: 符合提高恶意行为者绕过安全限制成本的目标,而非试图实现绝对无法被绕过的目标。
- 可解释性: 提供了一个关于防御为何有效的机械解释(注意力抑制),弥合了理论对齐与实际实现之间的鸿沟。
作者总结道,虽然没有完美的防御,但 PRESTO 代表了在使开源 LLM 抵御基于排名的易获取型利用方面迈出的重要一步。