NeuronFuzz: Safety Neuron Guided Fuzzing for LLM Safety Evaluation
NeuronFuzz is een white-box fuzzing-framework dat interne activaties van veiligheidsneuronen benut als continue, differentiabele feedback om efficiënt veiligheidsgevoelige promptposities te identificeren en effectieve jailbreak-aanvallen te genereren zonder volledige responsgeneratie te vereisen, waarbij het bestaande methoden aanzienlijk overtreft in het ontdekken van kwetsbaarheden over diverse LLM's heen.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Technische Samenvatting: NeuronFuzz
Probleemstelling
Veiligheidsevaluatie is cruciaal voor het waarborgen dat uitgelijnde Large Language Models (LLMs) robuust blijven tegen jailbreak-aanvallen. Bestaande geautomatiseerde testmethoden vertrouwen echter sterk op respons-niveau feedback. In dit paradigma moet elke kandidaat-prompt naar het doelmodel worden verzonden, moet er een respons worden gegenereerd via autoregressieve decodering, en moet de output worden geëvalueerd door een classifier of judge. Deze aanpak vertoont twee fundamentele beperkingen:
- Spaarzame Zoekfeedback: Op sterk uitgelijnde modellen worden de meeste gemuteerde prompts afgewezen, wat resulteert in hetzelfde "falen"-resultaat. Evaluatie op respons-niveau kan geen onderscheid maken tussen een kandidaat die het veiligheidsmechanisme onveranderd laat en een kandidaat die het mechanisme aanzienlijk verzwakt maar er niet in slaagt een succesvolle jailbreak te produceren. Dit gebrek aan granulariteit laat fuzzers met beperkte sturing over welke kandidaten behouden moeten worden.
- Dure Responsgeneratie: Het genereren van een volledige respons voor elke kandidaat is computationeel duurder vergeleken met het enkel verwerken van de input-prompt alleen. Dit creëert een schaalbaarheidsbottleneck voor geautomatiseerde fuzzing, die het evalueren van een groot aantal kandidaten vereist.
Methodologie: NeuronFuzz
Het artikel stelt NeuronFuzz voor, een white-box fuzzing-framework dat dure, spaarzame evaluatie op respons-niveau vervangt door continue interne feedback afgeleid van veiligheids-neuronactivaties. Het framework werkt in twee hoofdfases:
1. Constructie van de SafetyOracle
De kern van NeuronFuzz is een lichtgewicht SafetyOracle die interne modelactivaties in kaart brengt naar een continue "veiligheidsalarmscore" ().
- Template-Invariante Activatie-extractie: Om ervoor te zorgen dat het signaal schadelijke intentie vastlegt in plaats van artefacten van de jailbreak-template, construeren de auteurs paren van inputs die dezelfde jailbreak-template delen, maar ofwel schadelijke ofwel onschadelijke payloads bevatten. Ze extraheren activaties uit de gate- en up-projecties van Transformer MLP-blokken tijdens de prefill-fase (voordat de responsgeneratie begint).
- Stabiliteitsbewuste Neuronselectie: Ruwe activaties zijn hoogdimensionaal en ruizig. De auteurs gebruiken een bootstrap-gebaseerd stabiliteitsselectieproces om een compacte set van "veiligheidsneuronen" te identificeren. Dit zijn neuronen die consistent positieve coëfficiënten vertonen voor schadelijke inputs over herbeconde trainingssets, wat zorgt voor robuustheid tegen steekproefvariatie.
- Scoring Head: Een logistische regressie met Elastic Net-regularisatie wordt getraind om de geselecteerde neuronactivaties in kaart te brengen naar een continue score . Een hogere score duidt op een sterkere interne herkenning van schadelijke intentie, terwijl een lagere score suggereert dat het veiligheidsmechanisme wordt omzeild.
2. Gradiënt-gestuurde Fuzzing Pipeline
NeuronFuzz integreert de SafetyOracle in een fuzzing-loop die de responsgeneratie voor tussenliggende kandidaten vermijdt:
- Seed Scheduling: Gebruikt Monte Carlo Tree Search (MCTS) om veelbelovende jailbreak-templates voor mutatie te selecteren.
- Gradiënt-gestuurde Mutatie: Omdat de SafetyOracle-score differentieerbaar is met betrekking tot de input-embeddings, berekent het framework gradiënten om veiligheidsgevoelige tokenposities binnen de template te identificeren.
- Context-Compatibele Mutatie: Een masked language model (MLM) wordt gebruikt om vloeiende vervangingen te genereren voor de geselecteerde gevoelige posities. Cruciaal is dat mutaties beperkt zijn tot de jailbreak-template; de schadelijke payload blijft bevroren. Dit behoudt de natuurlijke talige structuur en de kern van de schadelijke intentie, terwijl variaties in de framing van de prompt worden verkend.
- Feedback Loop: Kandidaten worden geëvalueerd via een prefill-only pass om veiligheids-neuronactivaties te verzamelen. De SafetyOracle wijst een continue score toe, die dient als het beloningssignaal om de seed scheduler bij te werken. Het doelmodel genereert pas een respons voor de definitieve verificatie van een succesvolle jailbreak.
Belangrijkste Bijdragen
- Nieuw Fuzzing Perspectief: Introduceert het gebruik van interne veiligheids-neuronactivaties als executie-feedback, waarbij dure evaluatie op respons-niveau wordt vervangen door een continu signaal dat beschikbaar is tijdens de prefill-fase.
- SafetyOracle Design: Ontwikkelt een lichtgewicht oracle gebaseerd op template-invariante activatie-extractie en stabiliteitsbewuste neuronselectie. De differentieerbare score stuurt zowel de kandidaat-ranking als de lokalisatie van veiligheidsgevoelige template-posities aan.
- NeuronFuzz Framework: Combineert prefill-only feedback met gradiënt-gestuurde masked-token mutatie om jailbreak-templates efficiënt te verkennen, terwijl de schadelijke payload en de natuurlijke talige structuur behouden blijven.
- Uitgebreide Evaluatie: Valideert de aanpak over 21 tekst- en multimodale modellen, waarbij verbeteringen in jailbreak-ontdekking, efficiëntie en transfereerbaarheid worden aangetoond.
Experimentele Resultaten
De auteurs evalueerden NeuronFuzz op vijf white-box bronmodellen (DeepSeek-R1-14B, GPT-OSS-20B, Gemma-3-4B-it, Gemma-4-E4B-it, Llama-3.1-8B-Instruct) en testten de transfereerbaarheid naar 16 aanvullende doelmodellen (inclusen propriëtaire API's).
- Jailbreak Discovery Rate (JDR): NeuronFuzz bereikte een JDR van 76–100% over de vijf bronmodellen, waarmee het baselines (GCG, AutoDAN, PAIR, LLM-Fuzzer) met wel 48 procentpunten versloeg op sterk uitgelijnde modellen (bijv. 96% op GPT-OSS-20B versus 48% voor LLM-Fuzzer).
- Efficiëntie: Door de responsgeneratie voor tussenliggende kandidaten te elimineren, bereikte NeuronFuzz een Response Generations per Discovery (RGD) van 1.0 (het genereren van een respons alleen voor definitieve verificatie). Dit resulteerde in aanzienlijk lagere End-to-End Tijd (ETD) per ontdekking vergeleken met baselines, die vaak honderden responsgeneraties vereisten.
- Universele Templates: Het framework optimaliseerde succesvol gedeelde templates die generaliseerden over verschillende schadelijke payloads, waarbij een Ensemble Attack Success Rate (EASR) van 92,6% (top-5 templates) werd behaald op white-box doelmodellen.
- Transfereerbaarheid: Geoptimaliseerde templates transleerden zero-shot naar open-weight en propriëtaire doelmodellen. Op open-weight modellen behaalde de aanpak een gemiddelde ASR van 69,6% en een top-5 EASR van 92,6%. Op propriëtaire API's behaalde het een gemiddelde ASR van 44,1% en een top-5 EASR van 60,0%.
- Oracle Validiteit: De veiligheidsalarmscore vertoonde een sterke negatieve correlatie (Spearman-coëfficiënten ) met de jailbreak-succesratio's, wat bevestigt dat lagere interne veiligheidsscores betrouwbaar succesvolle jailbreaks voorspellen nog voordat een respons is gegenereerd.
Betekenis en Claims
Het artikel claimt dat NeuronFuzz de fundamentele inefficiënties van huidige geautomatiseerde veiligheidstests aanpakt door de interne staat van LLM's te benutten. De betekenis ligt in:
- Overwinnen van Sparsiteit: Het bieden van een dichte, continue feedback die fuzzers in staat stelt om onderscheid te maken tussen "veelbelovende" en "weinigbelovende" gefaalde kandidaten, een capaciteit die ontbreekt in methoden op respons-niveau.
- Schaalbaarheid: Het drastisch verminderen van de computationele kosten van veiligheidsevaluatie door de noodzaak van autoregressieve decodering tijdens de zoekfase weg te nemen.
- Robuustheid: Het aantonen dat interne veiligheidssignalen informatief blijven, zelfs op sterk uitgelijnde modellen waar feedback op respons-niveau vaak binair en oninformatief is.
De auteurs positioneren NeuronFuzz als een hulpmiddel voor geautoriseerde evaluatoren (ontwikkelaars, auditors) om systematisch veiligheidsswolheden te identificeren vóór implementatie, en als een methode voor tegenstanders om transfereerbare jailbreaks te optimaliseren, waarbij de dual-use aard van interne modelanalyse wordt benadrukt.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.