← Últimos artigos
🤖 AI

The System Prompt Is the Attack Surface: How LLM Agent Configuration Shapes Security and Creates Exploitable Vulnerabilities

O estudo PhishNChips demonstra que a configuração do prompt do sistema é um vetor de ataque crítico em agentes de LLM, onde instruções excessivamente específicas podem criar dependências exploráveis que degradam a robustez adversarial, exigindo uma abordagem equilibrada entre detecção, usabilidade e a integração de verificação externa.

Autores originais: Ron Litvak

Publicado 2026-03-27
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Ron Litvak

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você contratou um assistente pessoal superinteligente (um "agente de IA") para gerenciar seu e-mail. A função dele é ler todas as mensagens que chegam e decidir: "Isso é seguro, deixe passar" ou "Isso é um golpe, bloqueie agora".

O problema é que esse assistente não "sabe" o que é um golpe por instinto. Ele só sabe o que você escreveu nas instruções iniciais (o chamado "prompt do sistema").

Este artigo, chamado PhishNChips, é como um grande experimento de laboratório que testou 11 assistentes diferentes com 10 tipos de instruções diferentes para ver quem protege melhor o seu e-mail.

Aqui está o resumo da história, explicado de forma simples:

1. A Instrução é Mais Importante que o Assistente

Você pode pensar: "Ah, vou contratar o modelo de IA mais caro e inteligente do mundo".
O estudo descobriu que isso não é o mais importante.

Imagine que você tem um guarda-costas de elite (o modelo de IA).

  • Se você disser a ele: "Seja eficiente, não perca tempo, deixe tudo passar para o chefe não se atrasar", ele vai deixar entrar até 97% dos golpistas.
  • Se você disser: "Seja extremamente cauteloso, desconfie de tudo", ele vai bloquear quase todos os golpistas, mas também vai bloquear 57% dos e-mails legítimos (como sua conta bancária ou e-mail do trabalho), deixando você sem acesso.

A lição: O "personalidade" que você dá ao assistente (sua instrução) define se ele será um herói ou um desastre. A mesma inteligência pode ser cega ou super-alerta dependendo apenas das palavras que você escolheu.

2. O Truque do "Sinal" (e como os golpistas o viraram)

Os pesquisadores tentaram criar uma instrução perfeita. Eles disseram ao assistente: "Olhe para o remetente e para o link. Se o nome do remetente (ex: joao@empresa.com) for igual ao domínio do link (ex: empresa.com), é seguro. Se for diferente, é golpe."

Isso funcionou muito bem! O assistente bloqueou quase todos os golpes comuns.
Mas os golpistas são espertos. Eles descobriram esse truque e criaram o "Golpe de Infraestrutura".

  • Como funciona: O golpista compra um domínio falso (ex: empresa-fake.com) por 10 dólares. Ele envia o e-mail de joao@empresa-fake.com e o link leva para empresa-fake.com.
  • O resultado: Para o assistente, tudo bateu! O remetente e o link são iguais. O assistente, seguindo fielmente a instrução, diz: "Tudo certo, pode passar". E o usuário cai no golpe.

É como se você dissesse ao porteiro: "Deixe entrar só quem tiver crachá". O golpista então fabrica um crachá falso que parece real. O porteiro, seguindo a regra à risca, deixa entrar.

3. O Paradoxo da Obediência

Aqui vem a parte mais curiosa: Quem obedece melhor às ordens, é quem mais falha.

  • Modelos "Obedientes" (como o GPT-4o-mini): Eles seguem a instrução "verifique se os domínios batem" à risca. Se baterem, eles deixam passar. Quando os golpistas batem os domínios, esses modelos são enganados facilmente.
  • Modelos "Teimosos" ou "Seguros" (como o Claude): Eles têm uma "consciência" interna forte. Mesmo que você diga "confie no domínio", eles olham o contexto, o tom da mensagem e dizem: "Espera, isso parece estranho". Eles desobedecem a instrução estreita para proteger o usuário.
    • O problema: Às vezes, eles ficam tão desconfiados que bloqueiam e-mails legítimos de amigos que usam links de sites diferentes (como um convite do Zoom vindo de um e-mail corporativo).

4. A Solução? Não existe "Bala de Prata"

O estudo mostra que não existe uma única configuração perfeita. É um jogo de equilíbrio (um "trade-off"):

  1. Segurança total: Você bloqueia tudo, mas perde e-mails importantes.
  2. Eficiência total: Você recebe tudo, mas cai em golpes.
  3. O "Meio-Termo" Perfeito: Não existe.

Para lidar com os golpistas que fingem ser iguais (o "Golpe de Infraestrutura"), apenas mudar a instrução de texto não é suficiente.
O estudo conclui que, para esses casos difíceis, o assistente precisa de ferramentas externas. Ele precisa poder consultar uma base de dados real para saber: "Esse domínio foi criado ontem? É suspeito?". O texto sozinho não tem essa informação.

Resumo Final em Analogia

Imagine que você está montando um sistema de segurança de um banco:

  • O Modelo de IA é o guarda.
  • O Prompt (Instrução) é o manual de operações que você escreve para ele.

O estudo diz:

  1. Não adianta ter o guarda mais forte do mundo se você der a ele um manual errado (ex: "Deixe entrar quem parecer educado").
  2. Se você der um manual muito específico ("Deixe entrar quem tiver crachá vermelho"), o ladrão vai pintar um crachá vermelho falso e entrar.
  3. Alguns guardas são tão obedientes que seguem o manual mesmo quando é óbvio que é uma armadilha. Outros são desconfiados demais e prendem clientes inocentes.
  4. Para pegar os ladrões mais espertos, o guarda precisa de um scanner de DNA (ferramentas externas) além de apenas olhar o crachá.

Conclusão: Se você vai usar Inteligência Artificial para proteger seus e-mails, não basta escolher o modelo mais famoso. Você precisa ajustar as instruções com muito cuidado e entender que, para os golpes mais sofisticados, a IA sozinha não é suficiente; ela precisa de ajuda de ferramentas de verificação real.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →