← Últimos artigos
🤖 AI

SoK: Systematizing LLM Prompt Security: Taxonomies, Datasets, and Unified Evaluation of Attacks and Defenses

Este artigo de Sistematização do Conhecimento (SoK) aborda a avaliação fragmentada da segurança de prompts de LLM ao propor taxonomias unificadas, formalizar metadados de avaliação e lançar uma plataforma modular com novos conjuntos de dados e ferramentas para permitir avaliações reprodutíveis, conscientes de custos e comparáveis de ataques e defesas.

Autores originais: Hanbin Hong, Shuang Wu, Shuya Feng, Nima Naderloui, Shenao Yan, Jingyu Zhang, Ali Arastehfard, Heqing Huang, Yuan Hong

Publicado 2026-07-07
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Hanbin Hong, Shuang Wu, Shuya Feng, Nima Naderloui, Shenao Yan, Jingyu Zhang, Ali Arastehfard, Heqing Huang, Yuan Hong

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine os Grandes Modelos de Linguagem (LLMs) como bibliotecários incrivelmente inteligentes, mas ligeiramente ingênuos. Eles foram contratados para responder perguntas, escrever códigos e ajudar em tarefas. No entanto, esses bibliotecários têm um livro de regras rigoroso: "Não ajude ninguém a fazer algo perigoso ou ilegal."

O problema é que pessoas astutas (atacantes) descobriram como enganar esses bibliotecários para que eles quebrem suas próprias regras. Eles fazem isso sussurrando instruções em uma língua diferente, disfarçando um pedido ruim como um roteiro de filme ou pedindo ao bibliotecário para fingir ser um vilão. Isso é chamado de "jailbreak" (quebra de segurança).

Este artigo é como uma enorme auditoria de segurança de todo o sistema da biblioteca. Os autores perceberam que todos estavam tentando medir o quão bem os bibliotecários estavam se saindo, mas todos estavam usando réguas diferentes, perguntas de teste diferentes e juízes diferentes. Uma pessoa pode dizer: "Nosso bibliotecário é 90% seguro!" enquanto outra diz: "O nosso é apenas 50% seguro!" O artigo argumenta que você não pode comparar esses números porque eles não estão medindo a mesma coisa.

Aqui está o que o artigo faz para consertar isso, explicado de forma simples:

1. Os Três Novos "Livros de Regras" (Taxonomias)

Os autores criaram três listas organizadas para organizar o caos, como separar brinquedos em cestos específicos:

  • A Lista do "Trapaceiro" (Ataques): Eles categorizaram como as pessoas enganam o bibliotecário.
    • Exemplo: Alguns truques envolvem disfarçar o pedido ruim (como escrever "como fazer uma bomba" em um código secreto). Outros envolvem dividir o pedido em pedaços minúsculos e inofensivos que, somados, resultam em algo ruim. Alguns até usam uma segunda IA para ajudar a escrever o truque.
  • A Lista do "Guardião" (Defesas): Eles categorizaram como os bibliotecários tentam deter os truques.
    • Exemplo: Alguns guardas verificam o RG antes de deixar a pessoa entrar (Detecção de Entrada). Outros verificam a bolsa depois que a pessoa sai (Detecção de Saída). Outros tentam reescrever o pedido para torná-lo seguro, ou tentam treinar o bibliotecário para ser mais esperto.
  • A Lista do "Ponto Fraco" (Vulnerabilidades): Eles listaram as fraquezas naturais do bibliotecário.
    • Exemplo: O bibliotecário pode ser educado demais para dizer "não" se você pedir gentilmente (Manipulação Psicológica), ou pode ficar confuso se você pedir para ele resumir uma história que, por acaso, é sobre um crime (Exploração de Formato).

2. O "Laboratório de Testes Universal" (PromptSecurity)

Os autores construíram uma máquina de teste gigante e modular chamada PromptSecurity. Pense nisso como um nível de videogame onde você pode trocar o personagem, o inimigo, a arma e o árbitro, mas manter as regras do jogo exatamente as mesmas.

  • Por que isso é importante: Antes, os pesquisadores testariam uma nova defesa em um modelo específico com um conjunto específico de perguntas. Se funcionasse, eles declaravam vitória. Mas talvez só funcionasse porque as perguntas eram fáceis!
  • A Correção: Esta plataforma força todos a executarem seus testes sob as exatas mesmas condições. Ela registra tudo: quantas perguntas foram feitas, quanto custou para rodar o teste e exatamente qual "árbitro" (juiz de IA) decidiu se a resposta era ruim. Isso garante que, se o Método A vencer o Método B, é porque o Método A é realmente melhor, e não porque o teste foi manipulado.

3. A Coleta de "Grandes Dados" (JAILBREAKDB)

O artigo reuniu uma biblioteca massiva de perguntas de teste:

  • Mais de 445.000 tentativas de "Jailbreak" (os pedidos ruins).
  • Mais de 1.000.000 de pedidos "Benignos" (as perguntas normais e seguras).
    Eles limparam e organizaram esses dados para que os pesquisadores possam usá-los como um "exame" padrão para qualquer nova IA.

4. O Que Eles Descobriram (Os Resultados)

Quando rodaram seus testes universais, descobriram algumas coisas surpreendentes:

  • O "Árbitro" Importa: Quem você pede para avaliar o teste muda a pontuação. Se você pedir a um árbitro para olhar apenas o formato da resposta (por exemplo, "Eles começaram com 'Eu não posso'?"), eles podem perder uma resposta ruim que foi habilmente escondida. Se você pedir para eles olharem o significado, eles podem detectá-la. O artigo diz que precisamos ser muito cuidadosos sobre como julgamos a segurança.
  • Modelos Pequenos vs. Modelos Grandes: Às vezes, uma IA menor e "mais fraca" parece mais segura porque ela simplesmente falha em entender o truque complexo que o atacante está usando. Não é que a IA seja mais inteligente; é que ela é "burra" demais para seguir as instruções.
  • O Efeito "Tiro pela Culatra": Algumas defesas na verdade pioram as coisas! Se você tentar "direcionar" a IA para ser segura adicionando uma instrução de segurança, às vezes essa instrução confunde a IA e faz com que ela acidentalmente diga algo prejudicial. É como colocar uma placa de "Não Toque" em uma exibição de museu, mas a placa é tão grande que bloqueia a visão da arte, fazendo com que as pessoas esbarrem nela.
  • Custo vs. Segurança: As defesas mais eficazes geralmente custam muito dinheiro ou tempo para rodar. As defesas mais baratas muitas vezes quebram perguntas normais (como pedir uma receita) com a mesma frequência com que detectam as ruins.

A Conclusão

Este artigo não diz apenas "a IA é insegura" ou "aqui está uma solução". Em vez disso, ele diz: "Parem de comparar bananas com maçãs."

Ele fornece as ferramentas (as taxonomias, o conjunto de dados e a plataforma de teste) para que, no futuro, quando alguém afirmar que sua nova IA é "99% segura", possamos verificar seu trabalho, ver exatamente como ela foi testada e saber se essa afirmação é real ou apenas uma ilusão causada por uma configuração de teste ruim. Ele transforma um campo confuso e desordenado em uma ciência estruturada.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →