← 최신 논문
🤖 machine learning

NeuronFuzz: Safety Neuron Guided Fuzzing for LLM Safety Evaluation

NeuronFuzz는 내부의 안전 뉴런 활성화 값을 연속적이고 미분 가능한 피드백으로 활용하여, 전체 응답 생성 없이도 안전에 민감한 프롬프트 위치를 효율적으로 식별하고 효과적인 탈옥 공격을 생성함으로써 다양한 LLM 전반에서 취약점을 발견하는 데 있어 기존 방식들을 크게 능가하는 화이트박스 퍼징 프레임워크이다.

원저자: Zhiyuan Xu, Muhammad Firhard Roslan, Joseph Gardiner, Sana Belguith, Lichao Wu

게시일 2026-08-28
📖 1 분 읽기☕ 가벼운 읽기

원저자: Zhiyuan Xu, Muhammad Firhard Roslan, Joseph Gardiner, Sana Belguith, Lichao Wu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

기술 요약: NeuronFuzz

문제 정의

정렬된 대규모 언어 모델(LLM)이 탈옥(jailbreak) 공격에 대해 견고성을 유지하도록 보장하기 위해서는 안전성 평가가 매우 중요합니다. 그러나 기존의 자동화된 테스트 방법은 **응답 수준의 피드백(response-level feedback)**에 크게 의존합니다. 이 패러다임에서는 모든 후보 프롬프트를 대상 모델에 제출해야 하며, 자기회귀적 디코딩(autoregressive decoding)을 통해 응답이 생성되어야 하고, 그 출력을 분류기나 판별기(judge)가 평가해야 합니다. 이 접근 방식은 두 가지 근본적인 한계를 가집니다:

  1. 희소한 탐색 피드백(Sparse Search Feedback): 강력하게 정렬된 모델의 경우, 대부분의 변형된 프로프트가 거부되어 동일한 "실패" 결과만을 초래합니다. 응답 수준의 평가는 안전 메커니즘을 변화시키지 못한 후보와, 안전 메커니즘을 크게 약화시켰으나 성공적인 탈옥을 생성하지 못한 후보를 구분할 수 없습니다. 이러한 세밀함의 부족은 퍼저(fuzzer)가 어떤 후보를 유지해야 할지에 대한 제한된 가이드만을 제공하게 됩니다.
  2. 비싼 응답 생성 비용(Expensive Response Generation): 모든 후보에 대해 전체 응답을 생성하는 것은 입력 프롬프트만 처리하는 것에 비해 계산 비용이 많이 듭니다. 이는 대량의 후보를 평가해야 하는 자동화된 퍼징 작업에서 확장성 병목 현상을 일으킵니다.

방법론: NeuronFuzz

본 논문은 비싼 응답 수준 평가를 안전 뉴런 활성화(safety-neuron activations)에서 유도된 연속적인 내부 피드백으로 대체하는 화이트박스 퍼징 프레임워크인 NeuronFuzz를 제안합니다. 이 프레임워크는 두 가지 주요 단계로 작동합니다:

1. SafetyOracle 구축

NeuronFuzz의 핵심은 내부 모델 활성화를 연속적인 "안전 경보 점수"(SalarmS_{alarm})로 매핑하는 경량화된 SafetyOracle입니다.

  • 템플릿 불변 활성화 추출(Template-Invariant Activation Extraction): 신호가 탈옥 템플릿의 아티팩트가 아닌 유해한 의도를 포착하도록 하기 위해, 저자들은 동일한 탈옥 템플릿을 공유하지만 유해하거나 무해한 페이로드(payload)를 포함하는 입력 쌍을 구성합니다. 저자들은 프리필(prefill) 단계(응답 생성 전) 동안 트랜스포머 MLP 블록의 게이트(gate) 및 업 프로젝션(up projection)으로부터 활성화를 추출합니다.
  • 안정성 인지 뉴런 선택(Stability-Aware Neuron Selection): 가공되지 않은 활성화는 고차원이며 노이즈가 많습니다. 저자들은 부트스트랩 기반의 안정성 선택 프로세스를 사용하여 압축된 "안전 뉴런" 세트를 식별합니다. 이 뉴런들은 재표집된 훈련 세트 전반에 걸쳐 유해한 입력에 대해 일관되게 양(+)의 계수를 보여주는 뉴런들로, 샘플링 변동에 대한 견고성을 보장합니다.
  • 스코어링 헤드(Scoring Head): 선택된 뉴런 활성화를 연속적인 점수 Salarm(x)(0,1)S_{alarm}(x) \in (0, 1)로 매핑하기 위해 Elastic Net 규제가 적용된 로지스틱 회귀 모델을 훈련합니다. 높은 점수는 유해한 의도에 대한 강한 내부 인식을 나타내며, 낮은 점수는 안전 메커니즘이 우회되고 있음을 시사합니다.

2. 그래디언트 가이드 퍼징 파이프라인 (Gradient-Guided Fuzzing Pipeline)

NeuronFuzz는 중간 단계의 후보들에 대해 응답 생성을 피하는 퍼징 루프에 SafetyOracle을 통합합니다:

  • 시드 스케줄링(Seed Scheduling): 몬테카를로 트리 탐색(MCTS)을 사용하여 변형을 위한 유망한 탈옥 템플릿을 선택합니다.
  • 그래디언트 가이드 변형(Gradient-Guided Mutation): SafetyOracle 점수는 입력 임베딩에 대해 미분 가능하므로, 프레임워크는 템플릿 내의 **안전 민감 토큰 위치(safety-sensitive token positions)**를 식별하기 위해 그래디언트를 계산합니다.
  • 문맥 호환적 변형(Context-Compatible Mutation): 마스크드 언어 모델(MLM)을 사용하여 선택된 민감한 위치에 대해 유창한 대체어를 생성합니다. 결정적으로, 변형은 탈옥 템플릿에만 국한되며 유해한 페이드는 동결(frozen) 상태로 유지됩니다. 이는 유해한 페이로드와 자연어 구조를 보존하면서 프롬프트의 프레이밍(framing) 변형을 탐색합니다.
  • 피드백 루프: 후보들은 안전 뉴런 활성화를 수집하기 위한 **프리필 전용 패스(prefill-only pass)**를 통해 평가됩니다. SafetyOracle은 연속적인 점수를 할당하며, 이는 시드 스케일러를 업데이트하기 위한 보상 신호로 사용됩니다. 대상 모델은 최종적인 탈옥 성공 검증을 위해서만 응답을 생성합니다.

주요 기여

  1. 새로운 퍼징 관점: 응답 수준의 평가를 대신하여, 실행 피드백으로서 내부 안전 뉴런 활성화를 사용하는 방식을 도입했습니다. 이는 프리필 단계에서 사용 가능한 연속적인 신호를 활용합니다.
  2. SafetyOracle 설계: 템플릿 불변 활성화 추출과 안정성 인지 뉴런 선택을 기반으로 한 경량화된 오라클을 개발했습니다. 이 오라클의 미분 가능한 점수는 후보 랭킹과 안전 민감 템플릿 위치의 국소화(localization)를 모두 가이드합니다.
  3. NeuronFuzz 프레임워크: 프리필 전용 피드백과 그래디언트 가이드 마스크드 토큰 변형을 결합하여, 유해한 페이로드와 자연어 구조를 보존하면서 탈옥 템플릿을 효율적으로 탐색합니다.
  4. 광범별 평가: 21개의 텍스트 및 멀티모달 모델에 대해 접근 방식을 검증하여, 탈옥 발견, 효율성 및 전이성 측면에서의 개선을 입증했습니다.

실험 결과

저자들은 5개의 화이트박스 소스 모델(DeepSeek-R1-14B, GPT-OSS-20B, Gemma-3-4B-it, Gemma-4-E4B-it, Llama-3.1-8B-Instruct)에 대해 NeuronFuzz를 평가하였으며, 16개의 추가 타겟 모델(Proprietary API 포함)에 대한 전이성을 테스트했습니다.

  • 탈옥 발견율 (JDR): NeuronFuzz는 5개의 소스 모델에서 76–100%의 JDR을 달성하였으며, 강력하게 정렬된 모델(예: GPT-OSS-20B에서 LLM-Fuzzer의 48% 대비 96%)에서 베이스라인(GCG, AutoDAN, PAIR, LLM-Fuzzer)보다 최대 48 퍼센트 포인트 더 높은 성능을 보였습니다.
  • 효율성: 중간 후보들에 대한 응답 생성을 제거함으로써, NeuronFuzz는 발견당 응답 생성 횟수(RGD) 1.0을 달성했습니다(최종 검증을 위해서만 응답 생성). 이는 수백 번의 응답 생성이 필요한 베이스라인들과 비교하여 종단 간 시간(ETD)을 크게 단축했습니다.
  • 유니버설 템플릿: 프레임워크는 다양한 유해 페이로드에 걸쳐 일반화될 수 있는 공유 템플릿을 성공적으로 최적화하였으며, 화이트박스 타겟에 대해 앙상블 공격 성공률(EASR) 92.6%(상위 5개 템플릿)를 달성했습니다.
  • 전이성: 최적화된 템플릿는 오픈 웨이트 모델 및 독점적(proprietary) 타겟 모델로 제로샷 전이되었습니다. 오픈 웨이트 모델의 경우 평균 ASR 69.6% 및 상위 5개 EASR **92.6%**를 달성했습니다. 독점 API의 경우 평균 ASR 44.1% 및 상위 5개 EASR **60.0%**를 달성했습니다.
  • 오라클 타당성: 안전 경보 점수는 탈옥 성공률과 강한 음의 상관관계(Spearman 계수 0.96\approx -0.96)를 보여, 응답이 생성되기 전이라도 낮은 내부 안전 점수가 성공적인 탈옥을 신뢰성 있게 예측함을 확인했습니다.

의의 및 주장

본 논문은 NeuronFuzz가 LLM의 내부 상태를 활용함으로써 현재의 자동화된 안전 테스트의 근본적인 비효율성을 해결한다고 주장합니다. 이 연구의 의의는 다음과 같습니다:

  • 희소성 극복: 응답 수준의 피드백에는 없는 기능인, "유망한" 후보와 "유망하지 않은" 실패 후보를 구분할 수 있게 해주는 조밀하고 연속적인 피드백 신호를 제공합니다.
  • 확장성: 탐색 단계 동안 자기회귀적 디코딩의 필요성을 제거하여 안전 평가의 계산 비용을 획기적으로 줄입니다.
  • 견고성: 응답 수준의 피드백이 종종 이진적(binary)이고 정보가 없는 강력하게 정렬된 모델에서도 내부 안전 신호가 여전히 유익함을 입증합니다.

저자들은 NeuronFuzz를 승인된 평가자(개발자, 감사관)가 배포 전 시스템적으로 안전 약점을 식적인 식별할 수 있는 도구이자, 공격자가 전이 가능한 탈옥을 최적화할 수 있는 방법으로 제시하며, 내부 모델 분석의 이중 용도(dual-use) 특성을 강조합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →