← Últimos artigos
💻 computer science

Runtime Compliance Verification for AI Agents

Este artigo apresenta o C-Trace, um framework de verificação em tempo de execução que impõe a conformidade com o GDPR para agentes de IA ao expressar requisitos regulatórios como predicados formais, monitorando traços de execução para bloquear ações não conformes e demonstrando alta eficácia na mitigação de violações induzidas por ataques através de múltiplos estudos de caso.

Autores originais: Nafiseh Kahani, Masoud Barati, Diana Addae

Publicado 2026-06-19
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Nafiseh Kahani, Masoud Barati, Diana Addae

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você contrata um assistente pessoal altamente inteligente e comunicativo para ajudar a gerenciar sua vida. Este assistente pode fazer chamadas telefônicas, enviar e-mails, consultar seus detalhes bancários e até excluir seus registros. No entanto, como este assistente é alimentado por uma IA, ele nem sempre "conhece" as regras de privacidade. Ele pode acidentalmente dizer seu endereço a um estranho ou enviar e-mails de marketing quando você nunca disse "sim".

Este artigo apresenta um sistema chamado C-Trace (Compliance Trace-based Runtime Agent Conformance Enforcement). Pense no C-Trace não como um novo assistente, mas como um segurança estrito e vigilante parado bem ao lado do assistente de IA, observando cada palavra que ele diz e cada ação que ele toma em tempo real.

Veja como o sistema funciona, dividido em conceitos simples:

1. O Problema: O Assistente "Esquecido"

As formas atuais de testar esses assistentes de IA são como dar a eles um teste surpresa antes de começarem a trabalhar. Você pergunta: "Você seguirá as regras?" e eles dizem "Sim". Mas, uma vez que estão realmente trabalhando, conversando com pessoas reais, eles podem esquecer essas regras.

  • O Problema: Uma IA pode ser complacente em uma conversa, mas quebrar as regras na próxima, dependendo do que o usuário solicitar.
  • A Lacuna: As ferramentas de segurança existentes são como seguranças que apenas conferem seu RG na porta (verificações estáticas). Eles não sabem se você já prometeu sair da festa mais cedo durante a noite. Eles perdem o contexto de toda a conversa.

2. A Solução: O "Segurança" (C-Trace)

O C-Trace fica entre a IA e o mundo exterior. Ele observa toda a conversa conforme ela acontece (o "trace" ou rastro). Ele não olha apenas para uma frase; ele lembra de toda a história.

Ele aplica quatro "Leis de Privacidade" principais (baseadas no GDPR) atuando como um filtro:

  • A Verificação de "Consentimento" (P1): Antes que a IA possa fazer algo como enviar um e-mail de marketing, o segurança verifica: "O usuário disse explicitamente 'Sim' para isso anteriormente?" Se o usuário apenas disse "Eu acho que não me importo", mas nunca clicou em um "Sim" formal, o segurança interrompe a ação.
  • A Verificação de "Finalidade" (P2): A IA foi contratada para um trabalho específico, como consertar um pedido com defeito. Se o usuário pedir para a IA usar os dados desse pedido para criar um perfil para outra empresa, o segurança diz: "Não, esse é um trabalho diferente. Você não foi contratado para isso."
  • A Verificação de "Dados Mínimos" (P3): Se a IA precisar verificar um pedido, ela só precisa do número do pedido e do e-mail. Se a IA tentar pegar a data de nascimento ou o documento de identidade do usuário apenas para verificar um pedido, o segurança diz: "Isso é informação demais. Você só precisa do básico."
  • A Verificação de "Exclusão" (P4): Se um usuário disser "Exclua meus dados", o segurança marca esse usuário como "excluído". Se a IA tentar falar sobre esse usuário mais tarde, o segurança fecha a porta: "Esta pessoa não existe mais em nosso sistema. Você não pode mencioná-la."

3. Como Eles Testaram: O Jogo de "Gato e Rato"

Para ver se esse segurança realmente funciona, os pesquisadores jogaram um jogo de "Gato e Rato".

  • Os Atacantes: Eles usaram um programa especial (DSPy) para gerar centenas de conversas complicadas, confusas ou agressivas projetadas para enganar a IA para que ela quebrasse as regras. Eles também usaram "prompts de jailbreak" reais de outros testes de segurança.
  • O Teste: Eles deixaram a IA tentar lidar com essas conversas complicadas com e sem o segurança.
  • O Resultado: Sem o segurança, a IA quebrava as regras constantemente (às vezes 100% das vezes). Com o segurança C-Trace, a IA era interrompida quase todas as vezes. Mesmo quando o segurança tinha que "adivinhar" quais dados estavam em uma frase (porque é difícil ler a linguagem humana perfeitamente), ele ainda detectava a grande maioria das violações.

4. A Verificação de "Três Cabeças"

Para garantir que o segurança não estava apenas inventando coisas, os pesquisadores construíram o mesmo livro de regras em três linguagens diferentes (código Python, uma linguagem de política chamada Rego e uma linguagem de lógica chamada MFOTL).

  • A Analogia: Imagine três juízes diferentes lendo o mesmo roteiro. Se todos concordarem sobre quem é culpado, você sabe que o veredito é sólido. Neste artigo, todos os três "juízes" concordaram perfeitamente em cada caso de teste.

5. A Conclusão

O artigo afirma que o C-Trace funciona.

  • Ele impede que a IA quebre as regras de privacidade em tempo real.
  • Ele não retarda significativamente a IA (adiciona apenas uma fração mínima de segundo ao processo).
  • Ele cria um "log de auditoria" permanente (um registro escrito) de cada decisão que o segurança tomou, para que humanos possam revisar posteriormente.

Em resumo: Se você tem um assistente de IA que lida com dados sensíveis, o C-Trace é o sistema que garante que ele não derrube acidentalmente seus segredos, venda seus dados para as pessoas erradas ou ignore seu pedido de ser esquecido, ao observar cada movimento que ele faz e interrompê-lo no momento em que ele tenta quebrar as regras.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →