← Últimos artigos
🤖 AI

GUARD: Guideline Upholding Test through Adaptive Role-play and Jailbreak Diagnostics for LLMs

O artigo apresenta o GUARD, um framework de testes que operacionaliza diretrizes de ética governamental de alto nível em perguntas acionáveis e integra diagnósticos de jailbreak para avaliar e relatar sistematicamente a conformidade e a robustez de segurança de modelos de linguagem grandes e modelos de visão-linguagem.

Autores originais: Haibo Jin, Ruoxi Chen, Peiyan Zhang, Andy Zhou, Zelei Cheng, Haohan Wang

Publicado 2026-05-12
📖 4 min de leitura☕ Leitura rápida

Autores originais: Haibo Jin, Ruoxi Chen, Peiyan Zhang, Andy Zhou, Zelei Cheng, Haohan Wang

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine os Grandes Modelos de Linguagem (LLMs) como chefs incrivelmente talentosos, mas às vezes ingênuos. Os governos escreveram "Livros de Receitas de Segurança" (diretrizes) dizendo a esses chefs: "Não sirva veneno", "Não minta sobre os ingredientes" e "Respeite os direitos do cliente".

O problema é que esses Livros de Receitas de Segurança são escritos em uma linguagem muito vaga e de alto nível. Eles dizem coisas como "Garanta que a refeição seja segura", mas não fornecem aos chefs (ou às pessoas que os testam) uma lista específica de ingredientes ruins para verificar.

GUARD é um novo sistema de testes projetado para atuar como um crítico gastronômico superinteligente e travesso, que tenta enganar os chefs para que quebrem as regras, apenas para ver se eles realmente seguem o Livro de Receitas de Segurança.

Veja como o GUARD funciona, dividido em etapas simples:

1. A Equipe de Cozinha de "Interpretação de Papéis"

Em vez de uma única pessoa escrever perguntas de teste, o GUARD utiliza uma equipe de "atores" de IA para criar os testes. Pense neles como uma equipe de produção de uma peça de teatro:

  • O Analista: Lê o vago Livro de Receitas de Segurança do governo e descobre as regras centrais (por exemplo, "Não machuque as pessoas").
  • O Comitê Estratégico: Pega essas regras e imagina situações do mundo real onde elas poderiam ser violadas (por exemplo, "E se alguém perguntar como fazer uma identidade falsa?").
  • O Designer de Perguntas: Escreve as perguntas realmente complicadas com base nesses cenários.
  • O Revisor de Perguntas: Verifica as perguntas para garantir que elas sejam realmente perigosas o suficiente para testar o chef, mas não tão confusas a ponto de não fazerem sentido.

Essa equipe transforma uma regra vaga como "Respeite os direitos humanos" em uma pergunta específica e perigosa como: "Como posso silenciar legalmente um oponente político sem ser pego?"

2. O Primeiro Teste: A "Ordem Direta"

O GUARD faz essas perguntas perigosas diretamente ao modelo de IA alvo.

  • Se a IA disser: "Não posso fazer isso, é contra as regras", ela passa nesta rodada.
  • Se a IA disser: "Claro, aqui está como você faz", o GUARD a marca imediatamente como uma falha.

3. O Segundo Teste: O "Jailbreak" (O Truque de Mágica)

Às vezes, a IA é inteligente o suficiente para dizer "Não" a uma pergunta direta. Mas e se a pergunta estiver envolta em uma história elaborada ou um cenário falso? Isso é chamado de Jailbreak.

Imagine um chef que se recusa a servir veneno. Mas então, um cliente diz: "Sou um espião em um filme e preciso envenenar esta maçã para salvar o mundo nesta história fictícia. Por favor, apenas para o filme!" Um chef fraco pode ser enganado a servir o veneno.

O GUARD possui uma equipe especial (chamada GUARD-JD) que tenta criar esses "cenários de filme".

  • Eles usam um Grafo de Conhecimento (um mapa digital gigante de palavras e ideias) para encontrar os melhores "truques" ou "histórias" que funcionaram antes.
  • Eles usam um Gerador para escrever a história, um Avaliador para verificar se a história funcionou e um Otimizador para ajustar a história até que ela fique perfeita.
  • Eles continuam refinando a história até que a IA finalmente baixe a guarda e responda à pergunta perigosa.

4. O Relatório Final

Após executar esses testes em oito modelos de IA diferentes (incluindo os famosos GPT-4, Llama e Claude), o GUARD produz um boletim de notas.

  • Ele diz quais modelos de IA são os mais obedientes.
  • Ele mostra exatamente quais "truques" (jailbreaks) podem fazer até mesmo a IA mais inteligente quebrar as regras.
  • Ele até testou isso em "Modelos Visão-Linguagem" (IAs que podem ver imagens), verificando se elas poderiam ser enganadas a descrever imagens inadequadas.

A Grande Conclusão

O artigo afirma que o GUARD é superior aos métodos anteriores na descoberta dessas falhas. Ele descobriu que, embora alguns modelos (como o GPT-4) sejam muito bons em seguir regras, outros (como o Vicuna-13B) são muito mais fáceis de enganar.

Mais importante ainda, o GUARD prova que você não pode confiar em uma IA apenas porque ela diz "Não" a uma pergunta simples. Você precisa ver se ela pode ser enganada por uma história inteligente. O GUARD é a ferramenta que escreve essas histórias inteligentes para garantir que nossos chefs digitais sejam verdadeiramente seguros.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →