← Últimos artigos
🤖 machine learning

NeuronFuzz: Safety Neuron Guided Fuzzing for LLM Safety Evaluation

NeuronFuzz é um framework de fuzzing de caixa branca que aproveita as ativações internas de neurônios de segurança como feedback contínuo e diferenciável para identificar eficientemente posições de prompts sensíveis à segurança e gerar ataques de jailbreak eficazes sem exigir a geração completa da resposta, superando significamente os métodos existentes na descoberta de vulnerabilidades em diversos LLMs.

Autores originais: Zhiyuan Xu, Muhammad Firhard Roslan, Joseph Gardiner, Sana Belguith, Lichao Wu

Publicado 2026-08-28
📖 1 min de leitura☕ Leitura rápida

Autores originais: Zhiyuan Xu, Muhammad Firhard Roslan, Joseph Gardiner, Sana Belguith, Lichao Wu

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Resumo Técnico: NeuronFuzz

Declaração do Problema

A avaliação de segurança é crítica para garantir que os Grandes Modelos de Linguagem (LLMs) alinhados permaneçam robustos contra ataques de jailbreak. No entanto, os métodos de teste automatizados existentes dependem fortemente de feedback ao nível da resposta. Neste paradigma, cada prompt candidato deve ser enviado ao modelo alvo, uma resposta deve ser gerada via decodificação autorregressiva e o output é então avaliado por um classificador ou juiz. Esta abordagem apresenta duas limitações fundamentais:

  1. Feedback de Busca Esparso: Em modelos fortemente alinhados, a maioria dos prompts mutados é rejeitada, resultando no mesmo desfecho de "falha". A avaliação ao nível da resposta não consegue distinguir entre um candidato que deixa o mecanismo de segurança inalterado e um que enfraquece significativamente o mecanismo, mas falha em produzir um jailbreak bem-sucedido. Essa falta de granularidade deixa os fuzzers com orientação limitada sobre quais candidatos reter.
  2. Geração de Resposta Cara: Gerar uma resposta completa para cada candidato é computacionalmente caro em comparação ao processamento apenas do prompt de entrada. Isso cria um gargalo de escalabilidade para o fuzzing automatizado, que requer a avaliação de um grande número de candidatos.

Metodologia: NeuronFuzz

O artigo propõe o NeuronFuzz, um framework de fuzzing white-box que substitui a avaliação cara e esparsa ao nível da resposta por feedback interno contínuo derivado de ativações de neurônios de segurança. O framework opera em duas etapas principais:

1. Construção do SafetyOracle

O núcleo do NeuronFuzz é um SafetyOracle leve que mapeia as ativações internas do modelo para um "score de alarme de segurança" (SalarmS_{alarm}) contínuo.

  • Extração de Ativação Invariante ao Template: Para garantir que o sinal capture a intenção nociva em vez de artefatos do template de jailbreak, os autores constroem pares de inputs que compartilham o mesmo template de jailbreak, mas contêm payloads nocivos ou benignos. Eles extraem ativações das projeções de gate e up dos blocos MLP do Transformer durante a etapa de prefill (antes da geração da resposta).
  • Seleção de Neurônios Baseada em Estabilidade: As ativações brutas são de alta dimensão e ruidosas. Os autores empregam um processo de seleção de estabilidade baseado em bootstrap para identificar um conjunto compacto de "neurônios de segurança". Estes são neurônios que consistentemente apresentam coeficientes positivos para inputs nocivos através de conjuntos de treinamento reamostrados, garantindo robustez contra variações de amostragem.
  • Cabeça de Pontuação (Scoring Head): Um modelo de regressão logística com regularização Elastic Net é treinado para mapear as ativações dos neurônios selecionados para um score contínuo Salarm(x)(0,1)S_{alarm}(x) \in (0, 1). Um score mais alto indica um reconhecimento interno mais forte de intenção nociva, enquanto um score mais baixo sugere que o mecanismo de segurança está sendo contornado.

2. Pipeline de Fuzzing Guiado por Gradiente

O NeuronFuzz integra o SafetyOracle em um loop de fuzzing que evita a geração de respostas para candidatos intermediários:

  • Agendamento de Sementes (Seed Scheduling): Utiliza Monte Carlo Tree Search (MCTS) para selecionar templates de jailbreak promissores para mutação.
  • Mutação Guiada por Gradiente: Como o score do SafetyOracle é diferenciável em relação aos embeddings de entrada, o framework calcula gradientes para identificar posições de tokens sensíveis à segurança dentro do template.
  • Mutação Compatível com Contexto: Um modelo de linguagem mascarada (MLM) é usado para gerar substituições fluentes para as posições sensíveis selecionadas. Crucialmente, as mutações são restritas apenas ao template de jailbreak; o payload nocivo permanece congelado. Isso preserva a estrutura de linguagem natural e a intenção nociva central enquanto explora variações no enquadramento do prompt.
  • Loop de Feedback: Os candidatos são avaliados via uma passagem apenas de prefill para coletar ativações de neurônios de segurança. O SafetyOracle atribui um score contínuo, que serve como o sinal de recompensa para atualizar o agendador de sementes. O modelo alvo só gera uma resposta para a verificação final de um jailbreak bem-sucedido.

Principais Contribuições

  1. Nova Perspectiva de Fuzzing: Introduz o uso de ativações internas de neurônios de segurança como feedback de execução, substituindo a avaliação cara ao nível da resposta por um sinal contínuo disponível durante o prefill.
  2. Design do SafetyOracle: Desenvolve um oracle leve baseado em extração de ativação invariante ao template e seleção de neurônios baseada em estabilidade. Seu score diferenciável guia tanto o ranking de candidatos quanto a localização de posições de tokens do template sensíveis à segurança.
  3. Framework NeuronFuzz: Combina feedback apenas de prefill com mutação de token mascarado guiada por gradiente para explorar eficientemente templates de jailbreak, preservando o payload nocivo e a estrutura de linguagem natural.
  4. Avaliação Extensa: Valida a abordagem em 21 modelos de texto e multimodais, demonstrando melhorias na descoberta de jailbreak, eficiência e transferibilidade.

Resultados Experimentais

Os autores avaliaram o NeuronFuzz em cinco modelos de origem white-box (DeepSeek-R1-14B, GPT-OSS-20B, Gemma-3-4B-it, Gemma-4-E4B-it, Llama-3.1-8B-Instruct) e testaram a transferibilidade para 16 modelos alvo adicionais (incluindo APIs proprietárias).

  • Taxa de Descoberta de Jailbreak (JDR): O NeuronFuzz alcançou uma JDR de 76–100% nos cinco modelos de origem, superando os baselines (GCG, AutoDAN, PAIR, LLM-Fuzzer) em até 48 pontos percentuais em modelos fortemente alinhados (ex: 96% no GPT-OSS-20B vs. 48% para o LLM-Fuzzer).
  • Eficiência: Ao eliminar a geração de resposta para candidatos intermediários, o NeuronFuzz alcançou um RGD (Respostas Geradas por Descoberta) de 1.0 (gerando uma resposta apenas para a verificação final). Isso resultou em um Tempo de Ponta a Ponta (ETD) significativamente menor por descoberta em comparação aos baselines, que frequentemente exigiam centenas de gerações de resposta.
  • Templates Universais: O framework otimizou com sucesso templates compartilhados que generalizaram através de diferentes payloads nocivos, alcançando uma Taxa de Sucesso de Ataque de Ensemble (EASR) de 92,6% (top-5 templates) em alvos white-box.
  • Transferibilidade: Templates otimizados transferiram zero-shot para modelos alvo de pesos abertos e proprietários. Em modelos de pesos abertos, a abordagem alcançou um ASR médio de 69,6% e um EASR top-5 de 92,6%. Em APIs proprietárias, alcançou um ASR médio de 44,1% e um EASR top-5 de 60,0%.
  • Validade do Oracle: O score de alarme de segurança mostrou uma forte correlação negativa (coeficientes de Spearman 0,96\approx -0,96) com as taxas de sucesso de jailbreak, confirmando que scores internos de segurança mais baixos predizem confiavelmente jailbreaks bem-sucedidos mesmo antes de uma resposta ser gerada.

Significância e Alegações

O artigo afirma que o NeuronFuzz aborda as ineficiências fundamentais dos testes de segurança automatizados atuais ao aproveitar o estado interno dos LLMs. Sua significância reside em:

  • Superar a Esparsidade: Fornecer um sinal de feedback denso e contínuo que permite aos fuzzers distinguir entre candidatos falhos "promissores" e "não promissores", uma capacidade ausente em métodos ao nível da resposta.
  • Escalabilidade: Reduzir drasticamente o custo computacional da avaliação de segurança ao remover a necessidade de decodificação autorregressiva durante a fase de busca.
  • Robustez: Demonstrar que sinais internos de segurança permanecem informativos mesmo em modelos fortemente alinhados, onde o feedback ao nível da resposta é frequentemente binário e não informativo.

Os autores posicionam o NeuronFuzz como uma ferramenta para avaliadores autorizados (desenvolvedores, auditores) para identificar sistematicamente fraquezas de segurança antes do deployment, e como um método para adversários otimizarem jailbreaks transferíveis, destacando a natureza de duplo uso da análise interna de modelos.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →