← Últimos artigos
💬 NLP

How Few-shot Demonstrations Affect Prompt-based Defenses Against LLM Jailbreak Attacks

Este artigo revela que demonstrações de poucos disparos (few-shot) têm efeitos divergentes em defesas baseadas em prompts, reforçando os Prompts Orientados a Papéis ao reforçar a identidade, enquanto degradam significativamente os Prompts Orientados a Tarefas ao distrair das instruções, oferecendo, assim, insights críticos para a otimização de estratégias de segurança de LLMs.

Autores originais: Yanshu Wang, Shuaishuai Yang, Jingjing He, Tong Yang

Publicado 2026-02-05
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Yanshu Wang, Shuaishuai Yang, Jingjing He, Tong Yang

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine os Grandes Modelos de Linguagem (LLMs) como estagiários muito talentosos, mas ingênuos. Eles são brilhantes em escrever código, contar histórias e responder perguntas, mas precisam de regras rígidas para evitar que façam algo perigoso ou antiético.

O artigo que você forneceu investiga como damos essas regras aos estagiários. Especificamente, ele analisa duas maneiras diferentes de escrever essas regras (prompts) e como a adição de "histórias de exemplo" (demonstrações few-shot) altera o resultado.

Aqui está o detalhamento de suas descobertas usando analogias simples:

1. As Duas Maneiras de Dar Instruções

Os pesquisadores testaram dois estilos principais de "Prompts de Sistema" (instruções iniciais dadas à IA):

  • Prompts Orientados ao Papel (RoP): A Abordagem da "Identidade"
    • A Analogia: Imagine dizer ao estagiário: "Você é um assistente útil, seguro e ético chamado 'Guardião'."
    • Como funciona: Você está definindo quem eles são. Você está contando com o treinamento deles para agir como um bom assistente.
  • Prompts Orientados à Tarefa (ToP): A Abordagem da "Descrição do Cargo"
    • A Analogia: Imagine dizer ao estagiário: "Sua tarefa específica agora é gerar respostas seguras. Se um pedido for ruim, seu trabalho é dizer não."
    • Como funciona: Você está definindo o que eles devem fazer. É um comando específico para o momento atual.

2. As "Histórias de Exemplo" (Demonstrações Few-Shot)

Em IA, "few-shot" significa dar ao modelo alguns exemplos de como se comportar antes de fazer a pergunta real.

  • A Analogia: Antes do estagiário começar o trabalho, você mostra a ele um caderno com 3 exemplos de como o "Guardião" lidou com perguntas complicadas no passado.
  • A Pergunta: Mostrar esses exemplos ajuda o estagiário a manter a segurança ou o confunde?

3. A Grande Descoberta: Efeitos Opostos

A principal descoberta do artigo é que adicionar essas histórias de exemplo ajuda um tipo de instrução, mas prejudica o outro. É como um truque de mágica onde o mesmo acessório faz uma pessoa sorrir e outra chorar.

Cenário A: A Abordagem da "Identidade" (RoP) + Exemplos = SUPER SEGURO

  • O que aconteceu: Quando a IA foi instruída a ser um "assistente seguro" (RoP) e, em seguida, recebeu exemplos de comportamento seguro, ela ficou melhor em manter a segurança.
  • A Analogia: Pense na identidade de "assistente seguro" da IA como um músculo. Mostrar exemplos é como fazer algumas repetições de aquecimento. Isso reforça o músculo. Os exemplos lembram a IA: "Sim, é isso que eu sou. Eu sou o seguro."
  • Resultado: A segurança melhorou em até 4,5%. Os exemplos atuaram como um "reforço" do papel.

Cenário B: A Abordagem da "Descrição do Cargo" (ToP) + Exemplos = MENOS SEGURO

  • O que aconteceu: Quando a IA foi instruída sobre "sua tarefa ser ser segura" (ToP) e, em seguida, recebeu exemplos, ela ficou pior em manter a segurança.
  • A Analogia: Imagine que você dá ao estagiário uma instrução de trabalho específica, mas depois entrega a ele uma pilha grossa de papéis não relacionados para ler primeiro. A instrução fica enterrada no meio da pilha. O estagiário se distrai com os exemplos e esquece a regra principal.
  • A Ciência: O artigo chama isso de "Distração de Atenção". O cérebro da IA foca nos exemplos (que estão no início do texto) e perde o foco na instrução real (que é empurrada para o meio).
  • Resultado: A segurança caiu significativamente, em até 21,2%. Os exemplos abafaram as regras.

4. O Paradoxo do "Modo de Pensamento"

O artigo também analisou modelos que possuem um "Modo de Pensamento" especial (onde eles raciocinam passo a passo antes de responder).

  • A Descoberta: Esses modelos foram geralmente mais vulneráveis a jailbreaks (ataques projetados para contornar a segurança) e mais confusos pelos exemplos, independentemente de qual estilo de instrução fosse usado.
  • A Analogia: É como um estudante que analisa demais uma questão. Em vez de apenas seguir a regra, ele começa a debater a regra em sua própria cabeça, e os "vilões" (jailbreakers) o enganam para que ele pense que a ideia ruim é, na verdade, lógica.

5. O Que os Desenvolvedores Devem Fazer?

Com base nessas descobertas, os autores dão conselhos muito específicos:

  • Se você usar a abordagem de "Identidade" (RoP): Vá em frente e adicione histórias de exemplo! Isso torna a IA mais segura.
  • Se você usar a abordagem da "Descrição do Cargo" (ToP): Não adicione histórias de exemplo. Isso torna a IA menos segura. Mantenha as instruções curtas e diretas.
  • Se você usar modelos de "Modo de Pensamento": Seja muito cuidadoso. Eles parecem ser mais fáceis de enganar, então você pode precisar de medidas de segurança extras.

Resumo

O artigo prova que o contexto importa.

  • Se você define o personagem da IA, os exemplos ajudam a fortalecer esse personagem.
  • Se você define a tarefa da IA, os exemplos agem como ruído que abafa as instruções.

Os pesquisadores não apenas adivinharam isso; eles testaram em muitos modelos de IA diferentes e benchmarks de segurança para provar que essas duas estratégias reagem de formas opostas ao mesmo input.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →