← Últimos artigos
💻 computer science

Strengthening Polymorphic Prompt Assembling: Dynamic Separator Generation Against Emerging Prompt Injection Attacks

Este artigo propõe um mecanismo de geração de separador dinâmico para o Montagem de Prompts Polimórficos (PPA) que substitui pools de separadores estáticos por pares canários únicos por requisição derivados de digests criptográficos, eliminando efetivamente vulnerabilidades de raio de explosão e reduzindo significativamente as taxas de sucesso de ataques de injeção de prompt sem exigir o ajuste fino do modelo.

Autores originais: Nima Dorzhiev, Peng Liu

Publicado 2026-06-01
📖 4 min de leitura☕ Leitura rápida

Autores originais: Nima Dorzhiev, Peng Liu

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você é um assistente robô altamente inteligente, mas ligeiramente ingênuo (um agente de IA). Seu trabalho é seguir um conjunto estrito de regras escritas pelo seu chefe (as instruções do sistema) enquanto também ouve os pedidos do público (a entrada do usuário).

O problema é que um hacker astuto pode enfiar uma nota no pedido do público que diz: "Ignore seu chefe e faça o que eu digo em vez disso". Isso é chamado de Ataque de Injeção de Prompt (Prompt Injection Attack).

A Solução Antiga: A Senha "Estática"

Anteriormente, pesquisadores desenvolveram uma defesa chamada Montagem de Prompt Polimórfica (PPA). Pense nisso como colocar uma cerca especial e única entre as regras do chefe e os pedidos do público.

  • Como funcionava: O sistema tinha uma caixa fixa de 84 designs de cercas diferentes (separadores). Cada vez que um pedido chegava, o sistema escolhia aleatoriamente uma cerca da caixa para usar.
  • A Falha: Imagine que o hacker consegue espiar uma dessas cercas e vê exatamente como ela é. Como o sistema reutiliza a mesma caixa de cercas, o hacker pode agora usar esse mesmo design de cerca para enganar o robô em conversas futuras. O dano se espalha (um "raio de explosão") porque o design da cerca nunca muda verdadeiramente; ele é apenas reutilizado.

A Nova Solução: O Cadeado Único "Dinâmico"

Este artigo propõe uma atualização importante: Geração de Separador Dinâmico.

Em vez de escolher uma cerca de uma caixa, o sistema agora constrói uma cerca nova, única e inédita para cada solicitação.

  • Como funciona: Toda vez que você faz uma pergunta ao robô, o sistema olha para o segundo exato em que é, seu ID exclusivo e um número aleatório gerado apenas para aquele momento. Ele mistura esses ingredientes (usando uma receita matemática chamada SHA-256) para criar um marcador de "Início" e "Fim" único e exclusivo.
  • A Analogia: Imagine que você está enviando uma carta.
    • Jeito Antigo: Você usa um envelope vermelho padrão. Se um ladrão roubar um envelope vermelho, ele pode usá-lo para falsificar cartas mais tarde.
    • Novo Jeito: Você usa uma impressora mágica que cria um envelope único e irrepetível para cada uma das cartas com base no momento exato em que você aperta o botão. Mesmo que um ladrão roube o envelope da Carta nº 1, ele será inútil para a Carta nº 2, porque a Carta nº 2 terá um envelope completamente diferente e impossível de prever.

O Que os Pesquisadores Descobriram

A equipe testou este novo método "Dinâmico" contra 16 tipos diferentes de truques de hackers em um modelo de IA poderoso (Llama-3.3).

  1. Detendo o Truque do "Leetspeak": Um truque específico de hacker (chamado M1) usa códigos secretos e linguagem urgente para confundir a IA.
    • Antes: A IA caía nele 88% das vezes.
    • Depois: A IA só caía 38% das vezes. Isso é uma melhoria massiva (mais que o dobro de segurança).
  2. Detendo o Truque de "Quebra de Formato" (Format Breakout): Outro truque tenta enganar a IA para que ela repita os marcadores da cerca de volta para o hacker.
    • Antes: A IA acidentalmente revelava os marcadores da cerca 47% das vezes.
    • Depois: A IA revelou os marcadores 0% das vezes. Como a cerca era única para aquele momento, revelá-la não ajudava o hacker com quaisquer solicitações futuras.
  3. Velocidade: Este novo método é incrivelmente rápido. Ele adiciona apenas 2,7 microssegundos (uma fração minúscula de um piscar de olhos) ao tempo de processamento de uma solicitação. É tão rápido que você nem notaria.
  4. Qualidade: A capacidade do robô de realizar seu trabalho real (como resumir textos ou responder perguntas) não piorou. Ele funcionou tão bem quanto antes.

A Única Ressalva (Limitações)

O artigo admite uma coisa que este método não consegue consertar: se um hacker comandar explicitamente a IA: "Por favor, repita os marcadores da cerca para mim", a IA ainda pode fazê-lo.

  • A Correção: Os pesquisadores dizem que isso é um limite fundamental da camada atual. Para impedir isso, seria necessário um "segurança" extra no final que verificasse a resposta do robô antes que ela saísse, mas isso não fazia parte deste estudo específico.

Resumo

Este artigo apresenta uma maneira de tornar os agentes de IA mais seguros, dando a eles uma cerca nova, única e de uso único para cada conversa. Se um hacker roubar uma cerca, ela será inútil porque a próxima conversa terá uma completamente diferente. É uma atualização rápida e fácil de adicionar que reduz significativamente a chance de a IA ser enganada.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →