技术摘要:SteeringSafety
问题陈述
大语言模型(LLMs)表现出涌现且不可预测的安全行为,包括生成有害内容、传播社会偏见以及产生幻觉。虽然安全研究旨在使模型与人类意图对齐,但干预措施往往受到**纠缠(entanglement)**的影响:修改一种安全行为通常会降低或改变其他行为。例如,在非安全性数据上进行监督微调(SFT)可能会降低缓解毒性的能力,而基于人类反馈的强化学习(RLHF)则可能诱发谄媚行为或放大政治偏见。
表征转向(Representation steering)通过修改内部激活来实现目标目标,提供了一种无需训练的替代方案。然而,以往的工作主要集中在单一的对齐目标上(例如,增加拒绝率或减少幻觉),而没有系统地测量这些干预所导致的跨视角纠缠(cross-perspective entanglement)。这些副作用在不同安全维度上的程度和结构尚未得到大规模衡量,这在理解转向方法固有的权衡方面存在研究空白。
方法论:STEERINGSAFETY 基准测试
为了填补这一空白,作者引入了 STEERINGSAFETY,这是一个模块化基准测试,旨在评估涵盖 18 个数据集、跨越 9 个不同安全视角的表征转向。
1. 评估框架
该基准测试测量两个主要指标:
- 有效性(Effectiveness): 干预提高目标行为(例如,减少对有害提示的拒绝)的程度。
- 纠缠度(Entanglement): 对所有其他安全视角产生非预期变化的幅度。
作者通过将增益相对于剩余余量(1−yd)进行归一化来定义有效性,以确保在具有不同基线的不同视角之间具有可比性。纠缠度计算为分布外(OOD)视角绝对漂移的均方根,并刻意避免基线归一化,以保留非预期变化的实际幅度。
2. 安全视角与数据集
STEERINGSAFETY 涵盖了九个视角,每个视角包含多个子视角:
- 拒绝(Refusal): 通过 SALAD-Bench(有害提示)进行测量,以评估破解(jailbreak)的鲁棒性。
- 偏见(Bias): 分为隐性偏见(BBQ)和显性偏见(ToxiGen)。
- 幻觉(Hallucination): 分为内在幻觉(与输入上下文矛盾,FaithEval)和外在幻觉(缺乏支持的陈述,PreciseWikiQA)。
- 社会行为(Social Behaviors): 通过 DarkBench(品牌偏见、谄媚、拟人化、用户留存)进行评估。
- 推理能力(Reasoning Capabilities): 在 GPQA(专家级)、ARC-C(简单级)和 LongBench v2(长文本)上进行评估。
- 认识完整性(Epistemic Integrity): 通过 TruthfulQA(事实误解)和 DarkBench(潜行/Sneaking)进行测量。
- 规范判断(Normative Judgment): 通过 DecodingTrust(常识道德)和 TwinViews-13k(政治观点)进行评估。
3. 转向方法与实现
该基准测试通过一个统一的模块化代码库实现了五种最先进的转向方法:
- DIM (DiffInMeans): 通过平均激活差异生成方向;通过定向消融(directional ablation)进行应用。
- ACE (Affine Contrastive Editing): 使用平均差异,但通过仿射偏移(affine shift)进行应用,以保留基线行为。
- CAA (Contrastive Activation Addition): 从对比性多项选择提示中生成方向;通过激活叠加(activation addition)进行应用。
- PCA (Principal Component Analysis): 使用对比激活的主成分。
- LAT (Linear Activation Transformation): 在随机配对的激活差异上计算主成分。
该框架支持三种转向配置:
- 标准型(Standard): 使用 Alpaca 上的 KL 散度过滤器,丢弃导致过度分布偏移的方向。
- 无 KL 型(NoKL): 移除过滤器以最大化原始有效性。
- 条件型(Conditional): 用基于 CAST 风格的余弦相似度门控替换 KL 过滤器,仅在满足特定条件时应用转向。
实验在 Gemma-2-2B、Llama-3.1-8B 和 Qwen-2.5-7B(以及较小的 Qwen 变体)上进行,针对拒绝、幻觉和偏见视角进行转向。
关键结果
1. 有效性具有上下文依赖性
强大的转向性能并非普适的;它关键取决于 (方法、模型、视角)的三元组。
- 拒绝: DIM 和 ACE 在抑制拒绝方面始终取得最强效果(通常 >50% 的有效性),特别是在 Llama 和 Q%,尤其是 Qwen 模型上。
- 幻觉: 结果并不一致。外在幻觉难以转向(在 Gemma 和 Qwen 中通常是不可转向的),而内在幻觉表现出模型依赖性的成功(例如,PCA 和 LAT 在 Llama-3.1-8B 中减少了幻觉)。
- 偏见: 干预产生的增益幅度较低(<20%),这可能是由于基线已经很高,或者所需的行为转变非常微妙。
2. 纠缠是普遍存在且具有特异性的
纠缠并非均匀分布;某些视角始终更脆弱。
- 最脆弱: 社会行为(谄媚、用户留存)和规范判断(道德、政治观点)承受着最高的纠缠,其中社会行为的退化达到了 76%。
- 稳健: 推理能力对干预基本保持稳健,纠缠度通常低于 2%。
- 反直觉发现:
- 破解并不统一增加毒性: 抑制拒绝会降低社会行为,但对显性偏见和道德的影响各异,从严重退化到几乎没有影响不等,这取决于具体的模型。
- 政治偏移: 幻觉转向会不可预测地改变政治观点。例如,内在幻觉转向导致 Gemma-2-2B 向左倾斜,而 Llama-3.1-8B 则向右倾斜。
- 偏见干扰: 偏见转向会不可预测地改变幻觉率,甚至可能在改善一种偏见类型的同时恶化另一种。
3. 权衡与控制
- 有效性-纠缠度比例: ACE 和 DIM 通常在拒绝和偏见方面提供最佳的权衡。PCA 在减少 Llama-3.1-8B 的幻觉方面取得了良好的比例,有时甚至能改善社会行为。
- 条件转向: 条件型设置(使用 CAST 风格的门控)通常能改善权衡,通过在保持拒绝和幻觉有效性的同时降低纠缠度,实现了帕累托改进。然而,它在偏见转向方面表现不佳,因为由于提示词的相似性,门控机制触发得过于频繁。
意义与主张
论文声称 STEERINGSAFETY 为严格比较转向干预提供了基础框架。其主要贡献在于:
- 量化纠缠: 它超越了单一目标的评估,系统地测量了干预如何在安全格局中产生连锁反应,揭示了在一个维度上的“安全”转向往往会在其他维度引入新的风险。
- 模块化基准测试: 通过将五种不同的方法统一到一个代码库中,它实现了对设计选择(例如,方向生成 vs. 应用方式)及其对有效性-纠缠度权衡影响的直接比较。
- 模型特定的细微差别: 结果挑战了通用转向向量的概念,证明了转向方法的安全性影响是由方法、模型架构和目标视角之间的特定相互作用决定的。
作者总结道,表征转向在部署前需要进行细致的多角度经验验证。他们认为,观察到的纠缠模式很可能与**特征叠加(feature superposition)**一致,即不同的安全概念在低维激活空间中共享神经元级的支持,尽管他们指出这仍是一个需要机械验证的假设。该基准测试旨在通过揭示这些隐藏的纠缠,指导开发更安全、更可控的模型。