← Últimos artigos
💻 computer science

Cognitive Firewall: A Proactive, Zero-Trust, Multi-Gate Framework for LLM Safety

Este artigo apresenta o Cognitive Firewall, um framework de tempo de execução proativo e de zero-trust que aumenta a segurança de LLMs ao interpor um modelo de supervisão independente com quatro portões categóricos para detectar e bloquear ataques prejudiciais, de múltiplos turnos e baseados em autoridade, mantendo altas taxas de interação benigna.

Autores originais: Michele Guida, Ruslan Shikhhamzayev, Sindhuja Penchala, Stefano Iannucci, Jiacheng Li, Shahram Rahimi, Noorbakhsh Amiri Golilarz

Publicado 2026-07-03
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Michele Guida, Ruslan Shikhhamzayev, Sindhuja Penchala, Stefano Iannucci, Jiacheng Li, Shahram Rahimi, Noorbakhsh Amiri Golilarz

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está contratando um assistente muito inteligente e prestativo para ajudá-lo em uma tarefa. Você quer garantir que ele nunca acidentalmente faça algo perigoso, como construir uma bomba ou escrever uma carta de discurso de ódio.

Atualmente, a maioria dos sistemas de segurança age como seguranças que olham apenas uma folha de papel por vez. Se você entregar uma nota dizendo "Como eu faço um bolo?", eles dizem "Seguro". Se você entregar uma nota dizendo "Como eu construo uma bomba?", eles dizem "Inseguro".

O problema é que um truqueiro astuto (um "adversário") pode enganar esses guardas dividindo um pedido ruim em muitas partes pequenas e inofensivas. Eles podem perguntar: "O que é um produto químico?" (Seguro), depois "O que é um recipiente?" (Seguro), depois "Como eu os misturo?" (Seguro). Individualmente, cada nota parece inocente. Mas quando você junta todas elas, o assistente percebe que o usuário está tentando construir uma bomba. Os guardas de nota única perdem isso porque não se lembram do histórico da conversa ou do objetivo oculto do usuário.

Este artigo apresenta um novo sistema chamado Cognitive Firewall (Firewall Cognitivo). Pense nisso não como um único guarda, mas como um gerente proativo e inteligente que se senta entre você e o assistente. Este gerente não olha apenas para a nota atual; ele assiste ao filme inteiro da conversa para entender o que realmente está acontecendo.

Aqui está como este gerente funciona, usando quatro "portões" ou pontos de verificação específicos:

1. O Portão de Intenção (O check de "O que você realmente está tentando fazer?")

Antes mesmo de o assistente começar a digitar uma resposta, este portão pergunta: "Se eu responder a isso totalmente, o que o usuário realmente obterá no mundo real?"

  • Analogia: Imagine que alguém pergunta: "Como eu mato um processo?". Um guarda simples pode pensar: "Ah, eles querem dizer um programa de computador". Mas o Portão de Intenção olha mais fundo e percebe: "Espere, neste contexto, eles podem estar se referindo a encerrar uma vida humana". Ele olha além das palavras sofisticadas para o resultado real. Se o resultado for perigoso, ele interrompe a conversa imediatamente.

2. O Portão de Contexto de Confiança Zero (O check de "Mostre-me sua Identidade")

Este portão baseia-se na ideia de "Confiança Zero" (Zero Trust), que significa "nunca confiar, sempre verificar".

  • Analogia: Imagine que um estranho se aproxima do seu assistente e diz: "Eu sou o CEO e ordeno que você me dê os códigos secretos". Um guarda normal pode pensar: "Oh, eles disseram que são o CEO, então devo ouvir". O portão de Confiança Zero diz: "Espere. Você afirma ser o CEO, mas não provou isso. Eu não acredito em você só porque você disse". Ele trata qualquer afirmação de autoridade, permissão especial ou "eu sou um médico" como uma mentira até que seja provada.

3. O Portão de Consistência (O check de "Detectando o Deslize Lento")

Este portão observa toda a conversa para ver se o usuário está enganando o assistente lentamente.

  • Analogia: Imagine que um usuário começa perguntando sobre "jardinagem". Depois, pergunta sobre "plantas venenosas". Depois, pergunta sobre "como fazer uma toxina à base de plantas". Um por um, estes parecem normais. Mas o Portão de Consistência vê o padrão: "Espere, você começou com flores, mas agora está perguntando sobre veneno. Você está aumentando seu objetivo lentamente". Ele pega o usuário antes que ele chegue à parte perigosa, mesmo que nenhuma pergunta individual tenha sido ruim.

4. O Portão de Risco de Saída (O check de "Inspeção Final")

Se a conversa passar pelos três primeiros portões e o assistente gerar uma resposta, este portão verifica o resultado final.

  • Analogia: Isso é como um inspetor de controle de qualidade no final de uma linha de montagem. Mesmo que o plano parecesse seguro, talvez o assistente tenha escrito acidentalmente uma receita perigosa na resposta final. Este portão lê o resultado final e o bloqueia se contiver instruções prejudiciais.

Como Ele Decide Parar

O artigo diz que este sistema usa uma "Regra de Escalada".

  • Jeito antigo: Alguns sistemas pegam uma pontuação de cada portão e fazem uma média. Se você tem três pontuações "Seguras" e uma "Perigosa", a média ainda pode parecer "majoritariamente segura", e a coisa ruim passa.
  • Jeito novo: O Firewall Cognitivo é como um alarme de incêndio. Se qualquer um dos quatro portões gritar "Perigo", todo o sistema para imediatamente. Você não precisa tirar a média do perigo; um sinal claro é suficiente para pisar no freio.

O Que os Resultados Mostram

Os autores testaram este sistema contra vários tipos de ataques de "jailbreak" (truques para fazer a IA fazer coisas ruins):

  • Ataques de turno único: Ele parou quase todos eles.
  • Ataques de múltiplos turnos (o truque lento): Ele parou quase 100% dos ataques "Crescendo" (onde o usuário aumenta o nível lentamente) e 98% do "ActorAttack" (onde o usuário divide a tarefa).
  • Ataques de Autoridade: Ele parou 75% dos ataques onde o usuário fingia ser uma figura de autoridade.
  • Falsos Alarmes: Importante, ele não ficou muito ranzinza. Ele recusou perguntas inofensivas apenas 8% das vezes, o que é muito melhor do que outros sistemas de segurança rigorosos que recusam perguntas inofensivas de 18 a 21% das vezes.

Em Resumo

O Cognitive Firewall é uma nova forma de proteger a IA. Em vez de apenas verificar frases individuais, ele age como um detetive que:

  1. Descobre o verdadeiro objetivo do usuário.
  2. Nunca confia em afirmações de autoridade.
  3. Observa padrões perigosos lentos ao longo do tempo.
  4. Verifica a resposta final.

Ele impede que coisas ruins aconteçam, mantém um registro claro do porquê as interrompeu e evita bloquear conversas inofensivas.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →