NeuronFuzz: Safety Neuron Guided Fuzzing for LLM Safety Evaluation
NeuronFuzzは、内部の安全性ニューロンの活性化を連続的かつ微分可能なフィードバックとして活用することで、安全に敏感なプロンプトの位置を効率的に特定し、完全なレスポンス生成を必要とせずに効果的なジェイルブレイク攻撃を生成するホワイトボックス・ファジング・フレームワークであり、多様なLLMにわたる脆弱性の発見において既存の手法を大幅に上回る性能を発揮します。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
技術要約: NeuronFuzz
問題提起
アライメント(調整)された大規模言語モデル(LLM)がジェイルブレイク攻撃に対して堅牢であり続けることを保証するためには、安全性評価が極めて重要である。しかし、既存の自動テスト手法は、レスポンスレベルのフィードバックに大きく依存している。このパラダイムでは、すべての候補プロンプトをターゲットモデルに送信し、自己回帰的なデコーディングによってレスポンスを生成させ、その出力を分類器やジャッジによって評価する必要がある。このアプローチには、以下の2つの根本的な制限がある:
- 疎な探索フィードバック (Sparse Search Feedback): 強固にアライメントされたモデルでは、ほとんどの変異させたプロンプトが拒絶され、結果として同じ「失敗」という結果をもたらす。レスポンスレベルの評価では、「安全メカニズムに変化を与えなかった候補」と、「安全メカニズムを大幅に弱めたものの、ジェイルブレイクの成功には至らなかった候補」を区別することができない。この粒度の欠如により、ファザー(fuzzer)はどの候補を保持すべきかについてのガイダンスを得ることが困難になる。
- 高価なレスポンス生成 (Expensive Response Generation): すべての候補に対して完全なレスポンスを生成することは、入力プロンプトのみを処理する場合と比較して計算コストが高い。これは、大量の候補を評価する必要がある自動ファジングにおけるスケーラビリティのボトルネックとなる。
手法: NeuronFuzz
本論文は、高価で疎なレスポンスレベルの評価を、安全性ニューロンの活性化から得られる連続的な内部フィードバックに置き換えるホワイトボックス・ファジング・フレームワークであるNeuronFuzzを提案している。このフレームワークは、主に2つのステージで動作する。
1. SafetyOracle の構築
NeuronFuzzの中核は、モデルの内部活性化を連続的な「安全性アラーム・スコア」() にマッピングする軽量な SafetyOracle である。
- テンプレート不変な活性化抽出 (Template-Invariant Activation Extraction): ジェイルブレイク・テンプレートのアーティファクトではなく、有害な意図を捉えることを確実にするため、著者らは、同一のジェイルブレイク・テンプレートを共有しながら、有害または無害なペイロードを含む入力ペアを構築した。彼らは、レスポンス生成の前段階であるプリフィル(prefill)段階における、Transformer MLPブロックのゲートおよびアップ・プロジェクションからの活性化を抽出する。
- 安定性を考慮したニューロン選択 (Stability-Aware Neuron Selection): 生の活性化は高次元でノイズが多い。著者らは、ブートストラップに基づく安定性選択プロセスを採用し、コンパクトな「安全性ニューロン」のセットを特定する。これらは、再サンプリングされた訓練セット全体を通じて、有害な入力に対して一貫して正の係数を示すニューロンであり、サンプリングの変動に対する堅牢性を確保している。
- スコアリング・ヘッド (Scoring Head): 選択されたニューロンの活性化を連続的なスコア にマッピングするために、Elastic Net 正則化を用いたロジスティック回帰モデルを学習させる。スコアが高いほど、有害な意図に対する内部的な認識が強いことを示し、スコアが低いほど、安全メカニズムがバイパスされている可能性を示唆する。
2. 勾配誘導型ファジング・パイプライン (Gradient-Guided Fuzzing Pipeline)
NeuronFuzzは、中間候補のレスポンス生成を回避するファジング・ループにSafetyOracleを統合する:
- シード・スケジューリング (Seed Scheduling): モンテカルロ木探索(MCTS)を使用して、変異させるべき有望なジェイルブレイク・テンプレートを選択する。
- 勾配誘導型変異 (Gradient-Guided Mutation): SafetyOracleのスコアは入力埋め込みに対して微分可能であるため、フレームワークは勾配を計算して、テンプレート内の安全性に敏感なトークン位置を特定する。
- コンテキスト互換性のある変異 (Context-Compatible Mutation): マスク言語モデル(MLM)を使用して、選択された敏感な位置に対して流暢な置換を行う。決定的なのは、変異がジェイルブレイク・テンプレートのみに制限されることであり、有害なペイロードは固定されたままとなる。これにより、プロンプトのフレーミングのバリエーションを探索しながら、自然言語の構造と核心となる有害な意図を維持する。
- フィードバック・ループ: 候補は、安全性ニューロンの活性化を収集するためのプリフィルのみのパスを通じて評価される。SafetyOracleは連続的なスコアを割り当て、これがシード・スケジューラーを更新するための報酬信号として機能する。ターゲットモデルは、最終的なジェイルブレイクの検証のためにのみレスポンスを生成する。
主な貢献
- 新しいファジングの視点: 高価なレスポンスレベルの評価を、プリフィル中に利用可能な連続的な信号である内部の安全性ニューロンの活性化に置き換える、新しい実行フィードバックの概念を導入した。
- SafetyOracle の設計: テンプレート不変な活性化抽出と安定性を考慮したニューロン選択に基づいた、軽量なオラクルを開発した。その微分可能なスコアは、候補のランキングと、安全性に敏感なテンプレート位置の特定の両方をガイドする。
- NeuronFuzz フレームワーク: プリフィルのみのフィードバックと、勾配誘導型のマスク・トークン変異を組み合わせることで、有害なペイロードと自然言語の構造を維持しながら、ジェイルブレイク・テンプレートを効率的に探索する。
- 広範な評価: 21のテキストおよびマルチモーダルモデルにわたってアプローチを検証し、ジェイルブレイクの発見、効率性、および転移性の向上を実証した。
実験結果
著者らは5つのホワイトボックス・ソースモデル(DeepSeek-R1-14B, GPT-OSS-20B, Gemma-3-4B-it, Gemma-4-E4B-it, Llama-3.1-8B-Instruct)でNeuronFuzzを評価し、さらに16の追加ターゲットモデル(プロプライエタリなAPIを含む)への転移性をテストした。
- ジェイルブレイク発見率 (JDR): NeuronFuzzは、5つのソースモデルにおいて76–100%のJDRを達成し、強固にアライメントされたモデル(例:GPT-OSS-20BにおいてLLM-Fuzzerの48%に対し96%)において、ベースライン(GCG, AutoDAN, PAIR, LLM-Fuzzer)を最大48パーセントポイント上回った。
- 効率性: 中間候補のレスポンス生成を排除することにより、NeuronFuzzは発見あたりのレスポンス生成数 (RGD) 1.0(最終検証のためにのみレスポンスを生成)を達成した。これにより、数百回のレスポンス生成を必要とするベースラインと比較して、発見あたりのエンドツーエンド時間(ETD)を大幅に短縮した。
- ユニバーサル・テンプレート: 本フレームワークは、異なる有害ペイロード間で汎用化できる共有テンプレートの最適化に成功し、ホワイトボックス・ターゲットに対して92.6%のアンサンブル攻撃成功率 (EASR)(トップ5テンプレート)を達成した。
- 転移性: 最適化されたテンプレートは、オープンウェイトモデルおよびプロプライエタリなターゲットモデルに対してゼロショットで転移した。オープンウェイトモデルでは、平均ASR 69.6%、トップ5 EASR **92.6%**を達成した。プロプライエタリなAPIにおいては、平均ASR 44.1%、トップ5 EASR **60.0%**を達成した。
- オラクルの妥当性: 安全性アラーム・スコアは、ジェイルブレイク成功率と強い負の相関(スペアマン係数 )を示し、レスポンスが生成される前であっても、低い内部安全性スコアがジェイルブレイクの成功を確実に予測することを裏付けた。
意義と主張
本論文は、LLMの内部状態を活用することで、現在の自動安全性テストの根本的な非効率性を解決できると主張している。その意義は以下の通りである:
- 疎性の克服: レスポンスレベルのフィードバックではバイナリ(二値的)かつ情報量が少ないことが多い一方で、ジェイルブレイクに「有望な」候補と「有望でない」候補を区別できる、高密度で連続的なフィードバック信号を提供すること。
- スケーラビリティ: 探索フェーズにおける自己回帰的デコーディングの必要性を排除することで、安全性評価の計算コストを劇的に削減すること。
- 堅牢性: レスポンスレベルのフィードバックがしばしばバイナリで情報を持たない、強固にアライメントされたモデルにおいても、内部の安全性信号が情報価値を持ち続けることを実証したこと。
著者らは、NeuronFuzzを、開発者や監査人がデプロイ前に体系的に安全性の弱点を特定するためのツールとして、また、攻撃者が転移可能なジェイルブレイクを最適化するための手法として位置付けており、内部モデル分析のデュアルユース(軍民両用)の性質を強調している。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。