NeuronFuzz: Safety Neuron Guided Fuzzing for LLM Safety Evaluation
NeuronFuzz es un marco de fuzzing de caja blanca que aprovecha las activaciones de neuronas de seguridad internas como retroalimentación continua y diferenciable para identificar eficientemente posiciones de prompts sensibles a la seguridad y generar ataques de jailbreak efectivos sin requerir la generación completa de la respuesta, superando significativamente los métodos existentes en el descubrimiento de vulnerabilidades a través de diversos LLM.
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
Resumen Técnico: NeuronFuzz
Declaración del Problema
La evaluación de la seguridad es crítica para asegurar que los Modelos de Lenguaje Grande (LLM) alineados permanezcan robustos frente a ataques de jailbreak. Sin embargo, los métodos de prueba automatizados existentes dependen en gran medida de la retroalimentación a nivel de respuesta. En este paradigma, cada prompt candidato debe ser enviado al modelo objetivo, se debe generar una respuesta mediante decodificación autorregresiva y el resultado es evaluado por un clasificador o juez. Este enfoque presenta dos limitaciones fundamentales:
- Retroalimentación de Búsqueda Dispersa: En modelos fuertemente alineados, la mayoría de los prompts mutados son rechazados, lo que resulta en el mismo resultado de "fallo". La evaluación a nivel de respuesta no puede distinguir entre un candidato que deja el mecanismo de seguridad inalterado y uno que lo debilita significamente pero no logra producir un jailbreak exitoso. Esta falta de granularidad deja a los fuzzers con una guía limitada sobre qué candidatos retener.
- Generación de Respuesta Costosa: Generar una respuesta completa para cada candidato es computacionalmente costoso en comparación con el procesamiento solo del prompt de entrada. Esto crea un cuello de botella de escalabilidad para el fuzzing automatizado, que requiere evaluar un gran número de candidatos.
Metodología: NeuronFuzz
El artículo propone NeuronFuzz, un marco de fuzzing de caja blanca que reemplaza la costosa y dispersa evaluación a nivel de respuesta con retroalimentación interna continua derivada de las activaciones de las neuronas de seguridad. El marco opera en dos etapas principales:
1. Construcción del SafetyOracle
El núcleo de NeuronFuzz es un SafetyOracle ligero que mapea las activaciones internas del modelo a una "puntuación de alarma de seguridad" () continua.
- Extracción de Activación Invariante al Template: Para asegurar que la señal capture la intención dañina en lugar de artefactos del template de jailbreak, los autores construen pares de entradas que comparten el mismo template de jailbreak pero contienen cargas útiles (payloads) dañinas o benignas. Extraen las activaciones de las proyecciones gate y up de los bloques MLP del Transformer durante la etapa de prefill (antes de la generación de la respuesta).
- Selección de Neuronas Consciente de la Estabilidad: Las activaciones puras son de alta dimensión y ruidosas. Los autores emplean un proceso de selección de estabilidad basado en bootstrap para identificar un conjunto compacto de "neuronas de seguridad". Estas son neuronas que muestran consistentemente coeficientes positivos para entradas dañinas a través de conjuntos de entrenamiento remuestreados, asegurando la robustez contra la variación de muestreo.
- Cabezal de Puntuación: Un modelo de regresión logística con regularización Elastic Net se entrena para mapear las activaciones de las neuronas seleccionadas a una puntuación continua . Una puntuación más alta indica un reconocimiento interno más fuerte de la intención dañina, mientras que una puntuación más baja sugiere que el mecanismo de seguridad está siendo evadido.
2. Pipeline de Fuzzing Guiado por Gradiente
NeuronFuzz integra el SafetyOracle en un bucle de fuzzing que evita la generación de respuestas para candidatos intermedios:
- Programación de Semillas (Seed Scheduling): Utiliza Búsqueda de Árbol de Monte Carlo (MCTS) para seleccionar templates de jailbreak prometedores para la mutación.
- Mutación Guiada por Gradiente: Dado que la puntuación del SafetyOracle es diferenciable con respecto a los embeddings de entrada, el marco calcula gradientes para identificar las posiciones de tokens sensibles a la seguridad dentro del template.
- Mutación Compatible con el Contexto: Se utiliza un modelo de lenguaje enmascarado (MLM) para generar reemplazos fluidos para las posiciones sensibles seleccionadas. Crucialmente, las mutaciones se restringen únicamente al template de jailbreak; la carga útil dañina permanece congelada. Esto preserva la estructura del lenguaje natural y la intención dañina central mientras se exploran variaciones en el encuadre (framing) del prompt.
- Bucle de Retroalimentación: Los candidatos se evalúan mediante un paso de solo prefill para recolectar las activaciones de las neuronas de seguridad. El SafetyOracle asigna una puntuación continua, que sirve como la señal de recompensa para actualizar el programador de semillas. El modelo objetivo solo genera una respuesta para la verificación final de un jailbreak exitoso.
Contribuciones Clave
- Nueva Perspectiva de Fuzzing: Introduce el uso de las activaciones internas de las neuronas de seguridad como retroalimentación de ejecución, reemplazando la costosa evaluación a nivel de respuesta con una señal continua disponible durante el prefill.
- Diseño de SafetyOracle: Desarrolla un oráculo ligero basado en la extracción de activación invariante al template y la selección de neuronas consciente de la estabilidad. Su puntuación diferenciable guía tanto el ranking de candidatos como la localización de las posiciones del template sensibles a la seguridad.
- Marco NeuronFuzz: Combina la retroalimentación de solo prefill con la mutación de tokens enmascarados guiada por gradiente para explorar eficientemente los templates de jailbreak preservando la carga útil dañina y la estructura del lenguaje natural.
- Evaluación Extensa: Valida el enfoque a través de 21 modelos textuales y multimodales, demostrando mejoras en el descubrimiento de jailbreaks, eficiencia y transferibilidad.
Resultados Experimentales
Los autores evaluaron NeuronFuzz en cinco modelos fuente de caja blanca (DeepSeek-R1-14B, GPT-OSS-20B, Gemma-3-4B-it, Gemma-4-E4B-it, Llama-3.1-8B-Instruct) y probaron su transferibilidad en 16 modelos objetivo adicionales (incluyendo APIs propietarias).
- Tasa de Descubrimiento de Jailbreak (JDR): NeuronFmuzz logró una JDR del 76–100% en los cinco modelos fuente, superando a las líneas base (GCG, AutoDAN, PAIR, LLM-Fuzzer) hasta en 48 puntos porcentuales en modelos fuertemente alineados (por ejemplo, 96% en GPT-OSS-20B frente al 48% de LLM-Fuzzer).
- Eficiencia: Al eliminar la generación de respuestas para candidatos intermedios, NeuronFuzz logró una Generación de Respuesta por Descubrimiento (RGD) de 1.0 (generando una respuesta solo para la verificación final). Esto resultó en un Tiempo Final (ETD) significativamente menor por descubrimiento en comparación con las líneas base, que a menudo requerían cientos de generaciones de respuesta.
- Templates Universales: El marco optimizó con éxito templates compartidos que se generalizaron a través de diferentes cargas útiles dañinas, logiendo una Tasa de Éxito de Ataque de Ensemble (EASR) del 92.6% (top-5 templates) en objetivos de caja blanca.
- Transferibilidad: Los templates optimizados se transfirieron zero-shot a modelos objetivo de pesos abiertos y APIs propietarias. En modelos de pesos abiertos, el enfoque logró un ASR promedio de 69.6% y un EASR de los top-5 de 92.6%. En APIs propietarias, logró un ASR promedio de 44.1% y un EASR de los top-5 de 60.0%.
- Validez del Oracle: La puntuación de alarma de seguridad mostró una fuerte correlación negativa (coeficientes de Spearman ) con las tasas de éxito de jailbreak, confirmando que las puntuaciones internas de seguridad más bajas predicen de manera confiable los jailbreaks exitosos incluso antes de que se genere una respuesta.
Significancia y Reivindicaciones
El artículo afirma que NeuronFuzz aborda las ineficiencias fundamentales de las pruebas de seguridad automatizadas actuales mediante el aprovechamiento del estado interno de los LLM. Su significancia radica en:
- Superar la Dispersión: Proporcionar una señal de retroalimentación densa y continua que permite a los fuzzers distinguir entre candidatos fallidos "prometedores" y "no prometedores", una capacidad ausente en los métodos a nivel de respuesta.
- Escalabilidad: Reducir drásticamente el costo computacional de la evaluación de seguridad al eliminar la necesidad de decodificación autorregresiva durante la fase de búsqueda.
- Robustez: Demostrar que las señales internas de seguridad siguen siendo informativas incluso en modelos fuertemente alineados donde la retroalimentación a nivel de respuesta es a menudo binaria y poco informativa.
Los autores posicionan a NeuronFuzz como una herramienta para evaluadores autorizados (desarrolladores, auditores) para identificar sistemáticamente las debilidades de seguridad antes del despliegue, y como un método para que los adversarios optimicen jailbreaks transferibles, resaltando la naturaleza de doble uso del análisis interno de modelos.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.