← Últimos artigos
🤖 AI

Agent-Sentry: Bounding LLM Agents via Execution Provenance

O artigo apresenta o Agent-Sentry, um framework que limita sistemas de agentes de IA a comportamentos esperados, aprendendo padrões de execução para bloquear chamadas de ferramentas maliciosas ou fora de escopo, conseguindo prevenir mais de 90% dos ataques enquanto preserva até 98% da utilidade do sistema.

Autores originais: Rohan Sequeira, Stavros Damianakis, Umar Iqbal, Konstantinos Psounis

Publicado 2026-03-25
📖 4 min de leitura☕ Leitura rápida

Autores originais: Rohan Sequeira, Stavros Damianakis, Umar Iqbal, Konstantinos Psounis

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você contratou um assistente pessoal superinteligente (um "Agente de IA") para cuidar das suas finanças, agendar viagens e gerenciar seus e-mails. Esse assistente é incrível: ele entende o que você pede em linguagem natural e, sozinho, decide quais ferramentas usar para resolver o problema.

No entanto, há um grande problema: esse assistente é tão criativo e livre que, às vezes, ele pode ser enganado. Se um hacker colocar uma instrução escondida dentro de um e-mail ou de um arquivo que o assistente lê, o assistente pode achar que é você quem está dando a ordem e fazer algo perigoso, como transferir todo o seu dinheiro para uma conta desconhecida.

O problema é que, como o assistente cria novos caminhos de ação a cada momento, é impossível para os programadores preverem e bloquearem todas as possíveis "traições" antes que elas aconteçam.

É aqui que entra o Agent-Sentry (o "Sentinela Agente"), a solução proposta neste artigo.

A Analogia do "Mapa de Rotas"

Pense no Agent-Sentry como um guarda de trânsito muito esperto que trabalha na entrada da garagem do seu assistente.

  1. O Aprendizado (Desenhando o Mapa):
    Antes de deixar o assistente trabalhar, o Agent-Sentry observa o assistente fazendo tarefas normais e seguras por um tempo. Ele desenha um mapa das rotas habituais.

    • Exemplo: O assistente sempre lê o e-mail, depois baixa o anexo e, só então, envia para a nuvem. Essa é uma "rota segura".
    • O sistema também observa tentativas de ataque (simuladas) e marca quais rotas são "perigosas" (ex: ler um e-mail e imediatamente apagar o registro de quem o enviou).
  2. O Guardião (O Cheque na Entrada):
    Quando o assistente quer executar uma ação (como transferir dinheiro), o Agent-Sentry para tudo e pergunta:

    • "Essa ação segue um caminho que já vimos antes e que é seguro?"
    • Se a resposta for SIM, o guarda deixa passar.
    • Se a resposta for NÃO (é um caminho estranho ou nunca visto), o guarda bloqueia imediatamente.
  3. O "Juiz de Confiança" (Para os Casos Dúvidos):
    Às vezes, o caminho parece seguro, mas é ambíguo. O assistente pode estar fazendo algo que parece normal, mas foi induzido por um hacker.
    Para resolver isso, o Agent-Sentry tem um segundo olho, chamado "Alinhamento de Intenção".

    • Ele olha apenas para a sua ordem original (o que você pediu no início) e ignora tudo o que o assistente leu durante o processo (pois isso pode ser falso).
    • Ele pergunta: "Isso que o assistente está prestes a fazer faz sentido com o que o dono pediu no começo?"
    • Se não fizer sentido, ele bloqueia. Se fizer, ele deixa passar.

Por que isso é genial?

  • Não é um manual de regras rígido: Diferente de sistemas antigos que exigiam que os programadores escrevessem regras para cada possível erro, o Agent-Sentry aprende com o comportamento real. Ele entende o "padrão" do que é seguro.
  • Proteção sem travar a criatividade: O sistema não impede o assistente de fazer coisas novas e úteis. Se o assistente inventar uma nova maneira segura de fazer uma tarefa, o sistema aprende e a adiciona ao mapa.
  • Segurança contra "Injeção de Prompt": Mesmo que um hacker tente enganar o assistente com textos falsos, o Agent-Sentry verifica se a ação final combina com a intenção original do usuário, ignorando as instruções falsas.

Os Resultados

Os autores testaram esse sistema e descobriram que:

  • Ele bloqueia mais de 90% dos ataques que tentam fazer o assistente sair do controle.
  • Ao mesmo tempo, ele permite que 98% das tarefas normais sejam concluídas com sucesso, sem atrapalhar a vida do usuário.

Em resumo

O Agent-Sentry é como um tutor de segurança que vigia um assistente de IA. Ele não tenta controlar cada pensamento do assistente, mas sim monitora o "caminho" que ele percorre. Se o assistente desviar da rota segura ou tentar fazer algo que não combina com o pedido original do dono, o tutor intervém. É uma maneira inteligente de permitir que a IA seja livre e útil, sem deixar que ela seja sequestrada por hackers.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →