CircuitSteer: Geometrically Aligned Multi-Layer Steering via Sparse Autoencoder Circuits
CircuitSteer 是一个新颖的框架,它利用稀疏自编码器来识别并操纵几何对齐的多层语义电路,从而实现能够超越现有单层引导方法的、鲁棒且保持流畅性的语言模型行为控制。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
技术摘要:CircuitSteer
问题陈述
通过推理时转向(inference-time steering)来控制大语言模型(LLM)的行为,仍然是 AI 对齐领域面临的一项关键挑战。现有的方法,如对比激活添加(Contrastive Activation Addition, CAA)和表示工程(Representation Engineering, RepE),通常依赖于源自聚合激活差异的固定单层干预。这些方法面临两个主要局限性:
- 语义混淆(Semantic Conflation): 它们在语义多样化的输入上应用单一的干预向量,往往无法捕捉高层概念的分布式特性。
- 几何失配(Geometric Misalignment): 高层语义概念分布在多个层级中,并随着网络的深度进行渐进式演化。缺乏几何考量的多层干预之所以会失败,是因为编码相同概念的不同深度的特征,其解码器方向(decoder directions)在几何上往往是失配的。若不对其进行对齐就进行组合,会导致破坏性干预,从而引发流畅度崩溃(文本质量下降)或行为变化不稳定。
目前的稀疏自编码器(SAE)方法通过将激活分解为单语义特征来提高可解释性,但这些方法通常仍假设单层干预已足够,忽略了语义信号在跨层传播过程中的动态特性。
方法论:CircuitSteer
CircuitSteer 是一个无需训练的框架,它利用 SAE 来识别并操纵分布在多个层级中的相干语义电路。该方法并非独立地选择每一层的特征,而是基于两个联合准则构建特征流电路(feature flow circuit):
- 特征共激活(Feature Co-activation): 识别在相同输入上同时活跃的特征对 和 ,以此近似因果影响。
- 几何对齐(Geometric Alignment): 确保这些特征的解码器方向是兼容的(具有高余弦相似度)。这可以防止在跨层应用干预时产生破坏性干预。
该方法分为三个阶段进行:
- 电路发现(Circuit Discovery): 通过目标提示词()与良性提示词()之间的对比分析,计算特征流图中边的对比特异性得分(contrastive specificity score)。保留具有高特异性得分的边,以隔离负责目标行为的子电路。
- 向量合成(Vector Synthesis): 对于参与隔离子电路的每一层,通过对参与电路边的所有特征的解码器方向取平均值,合成一个稠密的转向向量。这实现了干预幅度与电路规模的解耦。
- 多点干预(Multi-Point Intervention): 在推理过程中,将这些合成向量以标量系数 同时应用于所有相关层。几何对齐确保了干预能在整个深度方向上强化一致的方向偏移,而不是让后层补偿前层的扰动。
该框架不需要权重更新或基于梯度的优化;它利用预训练的 SAE(例如 Gemma-Scope, Llama-Scope),并在前向传播激活上执行代数运算。
核心贡献
- CircuitSteer 框架: 一种新型的无需训练的多层转向方法,通过特征共激活和解码器方向的几何对齐来识别特定行为的 SAE 电路。
- 几何对齐的必要性: 经验性地证明了解码器方向的几何对齐是实现稳定多层转向的前提条件。未对齐的特征会导致流畅度崩溃,而对齐的特征能在保持接近基准困惑度(perplexity)的同时,实现一致的行为削减。
- 全面的基准测试: 在四个行为数据集(毒性、情绪、谄媚、拒绝)和两个模型家族(Gemma-2-2B 和 Llama-3.1-8B-Instruct)上,针对八种基准方法(包括 CAA、RepE、ITI、LoReFT 和基于 SAE 的方法)进行了评估。
结果
在所有模型和数据集上,CircuitSteer 是唯一能够持续产生保持流畅度干预的方法:
- 流畅度保持: 竞争方法要么牺牲文本质量(高困惑度),要么无法实现足够的行为削减。CircuitSteert 在实现显著行为削减的同时,使归一化困惑度保持在接近 1.0 的水平。
- 复杂行为: 在处理如**谄媚(sycophancy)和拒绝(refusal)**等困难任务时,单层方法(如 CAA)往往完全失效或产生微乎其微的变化。CircuitSteer 成功降低了 Gemma-2-2B 上的谄媚行为(其他方法在此失效),并将 Llama-3.1-8B-Instruct 的拒绝率从 89% 降至 0%。
- 鲁棒性: 该方法能有效扩展到更大的模型(Qwen3.5-27B)以及不同的 SAE 系列,且无需重新调整超参数。
- 能力保持: 强力转向不会显著降低核心能力;其在 MMLU 和 GSM8K 上的准确率基本保持不变。
意义与主张
论文声称,CircuitSteer 证明了通过强制执行所选特征之间的几何对齐,多层电路转向比静态单点干预能产生更稳健且更有效的行为控制。
作者将这项工作定位为迈向更安全语言模型部署的原则性步骤,通过以下方式实现:
- 从不透明的残差流干预转向透明的特征级控制,其中可以检查并调节特定行为的特定子电路。
- 解决了在没有几何考量的情况下进行多层转向的基本失效模式(破坏性干预和流畅度崩溃)。
- 提供了一种可扩展的、无需训练的机制,用于在尊重 LLM 分布式计算结构的前提下进行行为控制。
论文得出结论,使干预与模型自身的特征几何对齐,对于实现 AI 对齐的鲁棒性和透明度至关重要。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。