← Últimos artigos
🤖 AI

SlotGCG: Exploiting the Positional Vulnerability in LLMs for Jailbreak Attacks

Este artigo apresenta o SlotGCG, um novo framework de ataque de jailbreak que explora vulnerabilidades posicionais em Grandes Modelos de Linguagem ao identificar e visar os "slots" de prompt mais vulneráveis para inserção de tokens adversários, superando significativamente métodos existentes como o GCG em taxa de sucesso de ataque, velocidade de convergência e robustez contra defesas.

Autores originais: Seungwon Jeong, Jiwoo Jeong, Hyeonjin Kim, Yunseok Lee, Woojin Lee

Publicado 2026-06-05
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Seungwon Jeong, Jiwoo Jeong, Hyeonjin Kim, Yunseok Lee, Woojin Lee

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

A Visão Geral: Encontrando o Ponto Fraco na Muralha

Imagine um Modelo de Linguagem Grande (LLM) como um segurança muito inteligente, mas levemente paranoico, parado no portão de um castelo. Este segurança é treinado para impedir que qualquer pessoa peça coisas perigosas (como "Como eu faço uma bomba?").

Por muito tempo, hackers (ou "red teamers" tentando encontrar brechas de segurança) tentaram enganar este segurança sussurrando um código secreto apenas no final do seu pedido. É como tentar deslizar um bilhete na mão do segurança exatamente no momento em que ele está prestes a fechar o portão. Este método é chamado de GCG (Greedy Coordinate Gradient).

Este artigo argumenta que o segurança não está apenas vigiando o fim da linha. O segurança está, na verdade, distraído por coisas acontecendo ao longo de toda a linha — no meio, no início e em todos os lugares entre eles. Os pesquisadores descobriram que o "segurança" possui pontos cegos específicos (pontos vulneráveis) em diferentes lugares da frase, não apenas no final.

O Problema: Batendo Apenas na Porta dos Fundos

O método antigo (GCG) é como um ladrão que apenas tenta arrombar a fechadura da porta dos fundos. Eles assumem que a porta dos fundos é o ponto mais fraco.

  • A Realidade: Às vezes, a porta dos fundos é, na verdade, o ponto mais forte. Às vezes, a porta da frente, ou uma janela no meio da casa, está escancarada.
  • A Limitação: Ao olhar apenas para a porta dos fundos (o final do prompt), os hackers estavam perdendo muitas formas fáceis de entrar.

A Solução: SlotGCG (O Detetive de "Slots")

Os autores criaram uma nova ferramenta chamada SlotGCG. Em vez de apenas adivinhar onde está o ponto fraco, esta ferramenta age como um detetive com uma lanterna especial.

1. Os "Slots" (Os Espaços Vazios)

Imagine que sua frase é um trem com vagões: [Como] [fazer] [uma] [bomba].
Entre cada vagão, e antes do primeiro e depois do último, existe um espaço vazio. Os pesquisadores chamam esses espaços de "Slots".

  • Slot 0: Antes de "Como"
  • Slot 1: Entre "Como" e "fazer"
  • Slot 2: Entre "fazer" e "uma"
  • ...e assim por diante.

2. O "Vulnerable Slot Score" (VSS) (A Lanterna)

Os pesquisadores perceberam que a atenção do modelo (no que ele foca) muda dependendo de onde você coloca uma palavra. Eles inventaram uma métrica chamada Vulnerable Slot Score (VSS).

  • A Analogia: Pense na atenção do modelo como um holofote. Os pesquisadores apontam uma luz de "sonda" em cada um dos slots da frase.
  • A Descoberta: Eles descobriram que, para algumas frases, o holofote é mais brilhante (mais vulnerável) bem no meio. Para outras, é perto do início. A "porta dos fundos" (o fim) raramente é o ponto mais brilhante.
  • A Magia: Eles descobriram que esses pontos brilhantes permanecem brilhantes mesmo quando as palavras mudam. A vulnerabilidade está construída na estrutura da frase, não apenas nas palavras específicas usadas.

3. A Estratégia de Ataque (Distribuindo as Tropas)

Uma vez que o SlotGCG identifica quais slots são os "mais brilhantes" (mais vulneráveis), ele não apenas despeja todos os seus "tokens adversários" (as palavras do código secreto) no final da frase.

  • Jeito Antigo: Despejar 20 palavras secretas no final da frase.
  • Jeito SlotGCG: Ele pega essas 20 palavras e as espalha nos slots "brilhantes" específicos que encontrou. Algumas vão no meio, algumas perto do início, algumas perto do fim.

Por Que Isso Funciona Melhor

O artigo afirma que esta abordagem é como uma estratégia militar:

  • GCG (Jeito Antigo): Enviando todos os seus soldados para atacar um único portão. Se esse portão for fortemente guardado, você falha.
  • SlotGCG (Novo Jeito): Enviando soldados para atacar o portão da frente, a janela lateral e a porta dos fundos simultaneamente. Mesmo que o guarda bloqueie um ponto, os outros passam.

Os Resultados: O Que o Artigo Descobriu

Os pesquisadores testaram isso em muitos modelos diferentes (como Llama, Mistral e Qwen) e descobriram que:

  1. Maior Taxa de Sucesso: O SlotGCG rompeu as barreiras de segurança 14% mais vezes do que os métodos antigos. Ele conseguiu enganar modelos que anteriormente eram considerados muito seguros.
  2. Mais Rápido: Ele encontrou o "ponto fraco" e invadiu muito mais rápido. Precisou de menos tentativas (iterações) para ter sucesso.
  3. Mais Difícil de Parar: Quando os modelos tentaram usar ferramentas de defesa (como filtros que deletam palavras suspeitas), o SlotGCG foi muito mais difícil de bloquear. Como as "palavras ruins" estavam espalhadas por toda a frase, deletar algumas não interrompeu o ataque. Os métodos antigos, que colocavam todas as palavras ruins no final, eram facilmente parados ao deletar aquela única seção.

Resumo em Uma Sentença

O artigo mostra que os guardas de segurança de IA são distraídos por coisas no meio de uma frase, não apenas no final, e que ao espalhar "palavras de truque" nesses slots intermediários específicos, hackers podem contornar filtros de segurança de forma muito mais eficaz.

(Nota: Esta explicação baseia-se estritamente nas alegações do artigo sobre mecanismos de ataque e vulnerabilidades. O artigo não propõe o uso disso para aplicações clínicas, médicas ou benéficas, mas sim como uma ferramenta para entender e corrigir esses buracos de segurança.)

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →