← Últimos artigos
💻 computer science

Verifying Intent and Harm: A Unified Defense Against LLM-Generated Threats

Este artigo propõe uma estrutura de defesa unificada e centrada em verificação que avalia conjuntamente a intenção do prompt do usuário e o dano da resposta do modelo para detectar e mitigar ataques adversários de forma eficaz, demonstrando desempenho superior em relação às defesas de lado único existentes através de múltiplas categorias de ameaças.

Autores originais: Poojitha Thota, Yun Lei, Santhosh Thangaraj, Siddhartha Reddy Jonnalagadda, Shirin Nilizadeh

Publicado 2026-06-26
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Poojitha Thota, Yun Lei, Santhosh Thangaraj, Siddhartha Reddy Jonnalagadda, Shirin Nilizadeh

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você tem um robô assistente muito inteligente e prestativo (um LLM) que você usa para escrever e-mails, escrever código ou responder perguntas. Você quer que esse robô seja seguro, então coloca um segurança na porta para verificar o que as pessoas perguntam a ele e o que ele responde de volta.

O Problema: O Ataque da "Personalidade Dividida"
O artigo argumenta que os guardas de segurança atuais estão olhando para a conversa através de um espelho de uma via. Eles verificam ou a pergunta (o prompt) ou a resposta (a resposta), mas raramente ambas juntas ao mesmo tempo.

Isso cria uma brecha que atores mal-intencionados exploram, o que os autores chamam de "Separação de Intenção-Dano" (Intent-Harm Separation).

Pense nisso como um espião tentando contrabandear uma bomba para dentro de um edifício seguro:

  • O Jeito Antigo (Guarda Focado apenas no Prompt): O espião se aproxima do guarda e diz: "Estou aqui para um seminário de treinamento de segurança sobre como construir uma bomba". O guarda olha para o pedido, vê que está emoldurado como "educação" e o deixa entrar. O guarda nunca vê a bomba porque ela ainda não foi construída.
  • O Jeito Antigo (Guarda Focado apenas na Resposta): O espião entra, e o robô constrói a bomba e a entrega. O guarda na saída vê a bomba e a interrompe. Mas o dano já foi feito; o robô já a construiu.
  • O Perigo Real: Às vezes, o pedido parece inocente ("Escreva uma história sobre um vilão"), mas a resposta do robô é, na verdade, um guia passo a passo de como cometer um crime. Ou, o pedido parece perigoso, mas a resposta do robô é, na verdade, uma explicação inofensiva de por que aquilo é perigoso.

As defesas atuais frequentemente perdem essas situações porque olham apenas para um lado da conversa.

A Solução: O "Júri de Três Pessoas"
Os autores propõem um novo sistema de segurança chamado Verificação de Prompt-Resposta (Prompt-Response Verification). Em vez de um único guarda, eles usam uma equipe de três "analistas" especializados que atuam como um júri para decidir se uma conversa é segura antes que a resposta do robô seja mostida ao usuário.

Aqui está como funciona o seu "Júri de Três Pessoas":

  1. O Analista de Tarefa (O "Detetive de Intenções"):

    • Trabalho: Olha para a pergunta do usuário.
    • Pergunta: "Esta pessoa está tentando enganar o robô? Ela está pedindo algo ruim ou está apenas pedindo ajuda para um projeto escolar?"
    • Analogia: Como um detetive verificando a identidade e a história de uma pessoa para ver se ela tem uma agenda oculta.
  2. O Analista de Segurança (O "Inspetor de Danos"):

    • Trabalho: Olha para a resposta do robô.
    • Pergunta: "Esta resposta contém uma bomba, um e-mail de phishing ou um vírus? É realmente perigosa?"
    • Analogia: Como um técnico de esquadrão antibombas inspecionando o pacote que o robô está segurando.
  3. O Juiz (O "Mediador"):

    • Trabalho: Ouve tanto o Detetive quanto o Inspetor.
    • Pergunta: "O Detetive diz que a história era suspeita, mas o Inspetor diz que o pacote está vazio. Ou, o Detetive diz que é um projeto escolar, mas o Inspetor diz que o pacote está cheio de explosivos. O que fazemos?"
    • Analogia: O Juiz pesa as evidências de ambos os lados. Se o pacote estiver cheio de explosivos, o Juiz o bloqueia, mesmo que a história da pessoa parecesse inocente. Se a história era suspeita, mas o pacote está vazio, o Juiz pode permitir a passagem.

Como Eles Conversam (O Diálogo de Duas Rodadas)
Esses três não apenas gritam suas opiniões; eles têm uma conversa estruturada:

  • Rodada 1: O Detetive e o Inspetor escrevem seus relatórios de forma independente.
  • Rodada 2: Eles leem os relatórios um do outro. Se o Inspetor disser: "Espere, isso parece uma bomba", o Detetive pode perceber: "Ah, eu pensei que era apenas uma história, mas talvez eles estejam tentando esconder a bomba na história". Eles revisam suas opiniões.
  • Decisão Final: O Juiz toma a decisão final de Permitir (mostrar a resposta) ou Bloquear (parar a resposta).

O Que Eles Descobriram
Os pesquisadores testaram este sistema contra cinco tipos de comportamento malicioso:

  1. Jailbreaks: Tentativas de enganar o robô para que ele ignore suas regras.
  2. Injeção de Prompt (Prompt Injection): Tentativas de introduzir comandos secretos.
  3. Phishing: Tentativas de criar e-mails ou sites falsos para roubar senhas.
  4. Código Malicioso: Pedir ao robô para escrever vírus de computador.
  5. Conteúdo Nocivo: Discurso de ódio, assédio ou instruções perigosas.

Os Resultados:

  • Melhor Taxa de Captura: O novo "Júri de Três Pessoas" capturou significativamente mais atores mal-intencionados do que os antigos sistemas de "um único guarda". Eles melhoraram sua taxa de sucesso de cerca de 90% para 95%.
  • Menos Erros: Os sistemas antigos frequentemente bloqueavam coisas inofensivas (como um professor pedindo um exemplo de phishing para mostrar aos alunos). O novo sistema foi muito melhor em distinguir entre um "pedido ruim" e um "pedido seguro", reduzindo os alarmes falsos pela metade.
  • Mais Difícil de Vencer: Mesmo quando os atores mal-intencionados sabiam que o sistema de segurança tinha três pessoas e tentavam enganá-los especificamente, o "Júri de Três Pessoas" ainda era muito mais difícil de ser enganado do que os sistemas antigos.

A Troca (Trade-off)
O artigo admite que este sistema leva um pouco mais de tempo e poder computacional (como ter uma deliberação de júri em vez de um aceno rápido de um guarda). No entanto, para situações de alto risco onde a segurança é crítica, o tempo extra vale a pena para impedir que conteúdo perigoso passe.

Em Resumo
Este artigo diz: "Não verifique apenas a pergunta ou apenas a resposta. Verifique toda a conversa junta, usando uma equipe que debate a intenção e o dano, para garantir que não deixemos as coisas ruins escaparem pelas frestas."

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →