← Últimos artigos
🤖 AI

Refusal Before Decoding: Detecting and Exploiting Refusal Signals in Intermediate LLM Activations

Este artigo demonstra que o comportamento de recusa de LLMs é linearmente decodificável a partir de ativações intermediárias antes da geração de saída, permitindo o desenvolvimento do "Mechanism AutoDAN", um método de ataque guiado por sondas que reduz significativamente o tempo de busca enquanto mantém taxas de sucesso competitivas em comparação com abordagens tradicionais.

Autores originais: Matteo Gioele Collu, Riccardo Conte, Alberto Giaretta, Denis Kleyko, Mauro Conti, Matteo Zavatteri, Roberto Confalonieri

Publicado 2026-05-28
📖 4 min de leitura☕ Leitura rápida

Autores originais: Matteo Gioele Collu, Riccardo Conte, Alberto Giaretta, Denis Kleyko, Mauro Conti, Matteo Zavatteri, Roberto Confalonieri

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine um Modelo de Linguagem de Grande Escala (LLM) como uma fábrica massiva de vários andares. Quando você faz uma pergunta, as "matérias-primas" (suas palavras) entram no térreo e sobem por diversos departamentos (camadas) antes que um produto final (a resposta) seja expedido.

Geralmente, para verificar se a fábrica vai produzir algo perigoso (como um "jailbreak" ou uma recusa em seguir regras de segurança), você precisa esperar até que o produto chegue ao cais de expedição no topo. Se for perigoso, você o rejeita. Mas, até lá, a fábrica já gastou muita energia para processar a solicitação até o topo.

Este artigo faz uma pergunta simples: Podemos espiar dentro da fábrica enquanto os materiais ainda estão no meio da escada para ver se o produto final será seguro ou perigoso?

O "Sinal de Recusa"

Os pesquisadores descobriram que a resposta é sim.

Eles constataram que o "comportamento de recusa" do modelo (a decisão interna de dizer "Não, não posso fazer isso") não é apenas uma decisão final tomada no muito final. Em vez disso, é como uma luz de aviso que se acende no meio da fábrica. Mesmo antes de o modelo terminar sua frase, a "maquinaria" interna (especificamente as ativações do fluxo residual) já contém um sinal claro e linear indicando se o modelo está prestes a recusar uma solicitação.

Eles construíram um detector simples (chamado de "sonda") capaz de ler essa luz de aviso. É como ter um guarda de segurança no 10º andar que pode dizer a você: "Este pacote será rejeitado", muito antes de o pacote chegar ao 64º andar.

O Novo Ataque: "Mechanistic AutoDAN"

Os pesquisadores não pararam apenas em detectar o sinal; eles o usaram para criar uma maneira mais rápida de quebrar as regras de segurança do modelo.

Pense na maneira padrão de quebrar a segurança de um modelo (chamada "AutoDAN") como um arqueiro vendado. O arqueiro dispara uma flecha (um prompt), espera para ver se acerta o alvo (o modelo diz "Sim") e, se errar, tenta novamente. Isso é lento porque o arqueiro tem que esperar a flecha voar até o alvo a cada vez.

O novo método, Mechanistic AutoDAN, dá ao arqueiro visão de raio X.

  1. Em vez de esperar a flecha atingir o alvo, o arqueiro verifica a "luz de aviso" no 10º andar.
  2. Se a luz disser "Esta flecha será rejeitada", o arqueiro muda a flecha imediatamente, sem esperar que ela voe até o fim.
  3. Se a luz disser "Esta flecha parece promissora", eles deixam-na voar o restante do caminho.

O Resultado: Este método de "visão de raio X" foi tão eficaz em quebrar as regras de segurança quanto o antigo método vendado, mas foi até 72% mais rápido porque não desperdiçou tempo processando flechas destinadas a falhar.

A Regra de que o Tamanho Importa

O artigo encontrou uma reviravolta interessante em relação ao tamanho da fábrica:

  • Fábricas Pequenas (Modelos Menores): A luz de aviso se acende quase imediatamente. Mesmo no primeiro andar, o sinal é tão forte que o arqueiro pode adivinhar o resultado facilmente. No entanto, nessas fábricas pequenas, o arqueiro já fazia um trabalho razoável adivinhando por conta própria, então a "visão de raio X" não agregou muito valor extra.
  • Fábricas Gigantes (Modelos Maiores): Em fábricas massivas, a luz de aviso não se acende até os andares do meio. Aqui, a "visão de raio X" foi um divisor de águas. Sem ela, o arqueiro estava adivinhando às cegas e falhando frequentemente. Com ela, eles podiam navegar pelos andares do meio complexos de forma eficiente e encontrar o caminho certo para o alvo muito mais rápido.

A Conclusão

O artigo prova duas coisas principais:

  1. Decisões de segurança acontecem cedo: A decisão do modelo de recusar uma solicitação prejudicial está codificada em suas camadas intermediárias, muito antes de ele falar a palavra final.
  2. Podemos usar isso para acelerar ataques: Ao verificar essas camadas intermediárias em vez de esperar a saída final, podemos otimizar prompts (perguntas) muito mais rápido.

Os autores enfatizam que, embora isso torne os ataques mais rápidos, entender como esses sinais de segurança funcionam é crucial. Assim como saber como uma trava funciona ajuda um ladrão, também ajuda um serralheiro a construir uma trava melhor. Eles esperam que esse conhecimento ajude os pesquisadores a construir defesas mais fortes, mesmo que seu método específico tenha sido projetado para testar as fraquezas do modelo.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →