CircuitSteer: Geometrically Aligned Multi-Layer Steering via Sparse Autoencoder Circuits
CircuitSteerは、疎な自己符号化器(Sparse Autoencoders)を活用して、幾何学的に整列した多層的な意味回路を特定および操作することで、既存の単層的なステアリング手法を凌駕する、大規模言語モデルにおける堅牢かつ流暢さを維持した振る舞いの制御を可能にする新しいフレームワークである。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
技術要約: CircuitSteer
問題提起
大規模言語モデル(LLM)の挙動を推論時に制御することは、AIアライメントにおける極めて重要な課題である。Contrastive Activation Addition (CAA) や Representation Engineering (RepE) といった既存の手法は、通常、集約された活性化の差から導出される固定された単一レイヤーへの介入に依存している。これらのアプローチには、主に以下の2つの制限がある:
- 意味的な混同 (Semantic Conflation): 意味的に多様な入力に対して単一の介入ベクトルを適用するため、高次概念の分散的な性質を捉えきれないことが多い。
- 幾何学的な不整合 (Geometric Misalignment): 高次の意味的概念は複数のレイヤーに分散しており、ネットワークを通じて漸進的に進化する。幾何学的な考慮なしにマルチレイヤー介入を行うと、同じ概念をエンコードする特徴量が異なる深さでデコーダー方向において幾何学的に不整合となるため、失敗に終わる。これらの方向を整合させずに組み合わせると、破壊的な干渉が発生し、流暢性の崩壊(テキスト品質の低下)や不安定な挙動の変化を引き起こす。
現在のSparse Autoencoder (SAE) ベースの手法は、活性化を単一意味的な特徴へと分解することで解釈性を向上させているが、依然として単一レイヤーの介入で十分であると仮定しており、特徴量のクロスレイヤー間の伝播を無視している。
手法: CircuitSteer
CircuitSteerは、SAEを活用して、複数のレイヤーに分散した一貫性のある意味的回路(semantic circuits)を特定・操作する、トレーニングフリーのフレームワークである。各レイヤーで独立に特徴量を選択するのではなく、以下の2つの結合基準に基づいて「特徴フロー回路(feature flow circuit)」を構築する:
- 特徴量の共活性化 (Feature Co-activation): 同一の入力に対して同時に活性化している特徴量のペア と を特定し、因果的な影響を近似する。
- 幾何学的整合性 (Geometric Alignment): これらの特徴量のデコーダー方向が互いに適合している(高いコサイン類似度を持つ)ことを保証する。これにより、複数のレイヤーにわたって介入を適用する際の破壊的な干渉を防ぐ。
本手法は以下の3つのステージで進行する:
- 回路の発見 (Circuit Discovery): ターゲットとなるプロンプト () と無害なプロンプト () の間の対照分析を用い、特徴フローグラフのエッジに対する対照的特異性スコア (contrastive specificity score) を算出する。エッジの特異性スコアが高いものを保持することで、ターゲットとなる挙動を司るサブ回路を孤立させる。
- ベクトルの合成 (Vector Synthesis): 孤立させたサブ回路に含まれる各レイヤーについて、回路のエッジに参加しているすべての特徴量のデコーダー方向を平均することで、高密度なステアリングベクトルを合成する。これにより、介入の大きさを回路のサイズから切り離す。
- マルチポイント介入 (Multi-Point Intervention): 推論時、合成されたベクトルをスカラー係数 を用いて、関連するすべてのレイヤーに同時に適用する。幾何学的整合性により、介入が層が進むにつれて前の層による摂動を相殺するのではなく、一貫した方向へのシフトを強化するようにする。
このフレームワークは、重みの更新や勾配ベースの最適化を必要とせず、学習済みのSAE(例:Gemma-Scope, Llama-Scope)を利用し、フォワードパスの活性化に対して代数的な操作を行う。
主な貢献
- CircuitSteerフレームワーク: 特徴量の共活性化とデコーダー方向の幾何学的整合性を通じて、挙動固有のSAE回路を特定する、新しいトレーニングフリーのマルチレイヤー・ステアリング手法。
- 幾何学的整合性の必要性: デコーダー方向の幾何学的整合性が、安定したマルチレイヤー・ステアリングの前提条件であることを実証した。不整合な特徴量は流暢性の崩壊を引き起こすが、整合した特徴量は、ベースラインに近いパープレキシティを維持しながら一貫した挙動の低減を実現する。
- 包括的なベンチマーク: 4つの行動データセット(毒性、感情、サイコファンシー、拒絶)および2つのモデルファミリー(Gemma-2-2BおよびLlama-3.1-8B-Instruct)にわたり、8つのベースライン(CAA、RepE、ITI、LoReFT、およびSAEベースの手法を含む)と比較評価を行った。
結果
すべてのモデルとデータセットにおいて、CircuitSteerは唯一、流暢性を維持した介入を実現している:
- 流暢性の保持: 競合する手法は、テキストの質を犠牲にする(高いパープレキシティ)か、あるいは十分な挙動の低減を実現できない。CircuitSteerは、正規化パープレキシティを1.0付近に維持しながら、大幅な挙動の低減を達成する。
- 複雑な挙動: サイコファンシー(おべっか使い)や拒絶といった困難なタスクにおいて、単一レイヤーの手法(例:CAA)はしばしば完全に失敗するか、変化が無視できる程度になる。CircuitSteerは、Gemma-2-2Bにおいて(他の手法が失敗する中で)サイコファンシーを減少させ、Llama-3.1-8B-Instructにおいて拒絶率を89%から0%へと減少させることに成功した。
- 堅牢性: 本手法は、ハイパーパラメータの再調整なしに、より大きなモデル(Qwen3.5-27B)や異なるSAEファミリーへと効果的にスケールする。
- 能力の保持: 強力なステアリングを行っても、コアとなる能力は大きく損なわれない。MMLUおよびGSM8Kの精度は概ね維持されている。
意義と主張
本論文は、幾何学的整合性を強制することによって実現されるマルチレイヤー・サーキット・ステアリングが、静的な単一ポイント介入よりも厳密に堅牢かつ効果的な挙動制御をもたらすことを示している。
著者らは、本研究を以下の点において、より安全な言語モデル展開への原理的なステップとして位置づけている:
- 不透明な残差ストリームへの介入から、特定の挙動に関するサブ回路を検査・調整可能な、透明性の高い特徴レベルの制御へと移行すること。
- 幾何学的考慮を欠いたマルチレイヤー・ステアリングの根本的な失敗モード(破壊的干渉と流暢性の崩壊)に対処すること。
- LLMの分散的な計算構造を尊重した、トレーニングフリーでスケーラブルな挙動制御メカニズムを提供すること。
結論として、介入をモデル自身の特徴幾何学に適合させることは、AIアライメントにおける堅牢性と透明性の両方を達成するために不可欠であるとしている。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。