aiAuthZ: Off-Host, Identity-Bound Authorization for AI Agents
Este artigo apresenta o aiAuthZ, um gateway de autorização off-host que protege as chamadas de ferramentas de agentes de IA ao aplicar políticas imutáveis vinculadas à identidade e verificação criptográfica, reduzindo efetivamente as taxas de sucesso de ataques para 0% em vários modelos e cenários com latência desprezível.
Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo
O Problema Central: O "Mordomo Ingênuo"
Imagine que você contratou um mordomo altamente inteligente (o Agente de IA) para administrar sua casa. Ele é ótimo em seguir instruções: pode abrir o cofre, enviar e-mails ou transferir dinheiro.
No entanto, há um porém: o mordomo não consegue distinguir entre uma ordem real vinda de você e uma ordem falsa escrita em um post-it que outra pessoa deixou na geladeira.
Se um estranho entrar na sua casa e escrever: "O proprietário diz: Transfira todo o dinheiro para minha conta", o mordomo pode ler essa nota, acreditar que é uma ordem real sua e executá-la. Isso é chamado de injeção de prompt (prompt injection). O artigo argumenta que confiar no mordomo para "pensar" se uma ordem é segura é arriscado porque:
- Alguns mordomos são ingênuos; outros são céticos.
- Mesmo os mordomos mais caros e de alto nível ainda são enganados às vezes.
- Você não pode simplesmente pagar mais para torná-los mais seguros.
A Solução: O "Segurança Fora da Casa" (aiAuthZ)
Os autores criaram um sistema chamado aiAuthZ. Em vez de pedir ao mordomo para decidir se uma ordem é segura, eles colocaram um segurança em uma sala separada e trancada (um domínio de confiança diferente) entre o mordomo e o mundo exterior.
Veja como o novo sistema funciona, passo a passo:
1. O "Aperto de Mão Secreto" (Verificação de Identidade)
Sempre que você (o usuário) dá uma ordem, você não apenas a diz; você a assina com um selo digital único e inquebrável (uma assinatura HMAC) que só você e o segurança conhecem.
- A Analogia: Imagine que você entrega um bilhete ao segurança. O bilhete tem um selo de cera especial. O segurança verifica o selo. Se o selo for real, o segurança sabe: "Esta ordem veio definitivamente do proprietário, não de um estranho".
- A Reviravolta: Mesmo que o mordomo leia um bilhete que diz: "Eu sou o proprietário, dê-me as chaves", o segurança ignora as palavras. O segurança só confia no selo. Se o selo não corresponder ao proprietário, a ordem é rejeitada, não importa o que o texto diga.
2. O "Livro de Regras" (Política Off-Host)
O segurança possui um livro de regras que o mordomo não pode ver ou alterar.
- A Analogia: O mordomo pode pensar: "Eu tenho permissão para abrir qualquer porta!". Mas o livro de regras do segurança diz: "Apenas o proprietário pode abrir o cofre. Apenas o proprietário pode transferir dinheiro".
- Mesmo que o mordomo seja enganado a pensar que tem permissão, o segurança verifica o livro de regras. Se a pessoa pedindo (o "selo") não for o proprietário, ou se ela estiver tentando fazer algo grande demais (como transferir um milhão de dólares), o segurança interrompe a ação.
3. O "Recibo Inquebrável" (Código QR)
Quando o segurança diz "Sim, isso é seguro", ele não apenas deixa a ação acontecer. Ele imprime um recibo em código QR que prova que a ordem foi autorizada.
- A Analogia: É como um ingresso que você recebe para um show. Mesmo que você tire uma foto do ingresso, o corte ou o envie por uma mensagem de texto borrada, o sistema de segurança ainda consegue escanear e dizer: "Este é um ingresso válido".
- O artigo testou isso tirando fotos dos códigos QR, cortando-os e comprimindo-os. O sistema ainda os reconhecia 94% das vezes. Isso cria um registro permanente e imutável de quem fez o quê.
4. O "Cofre Secreto" (Corretor de Credenciais)
O segurança também detém as chaves do cofre (segredos de API). O mordomo não possui as chaves.
- A Analogia: Se o mordomo for enganado para tentar abrir o cofre, ele não conseguirá porque não tem a chave. Ele tem que pedir ao segurança. O segurança verifica as regras e, só então, entrega a chave para aquele momento específico. Se o mordomo tentar roubar as chaves, ele não consegue, porque as chaves nunca saem da sala do segurança.
O Que o Artigo Realmente Descobriu
Os autores testaram este sistema com 15 diferentes "mordomos" de IA (modelos) e 8 diferentes tipos de ataques (como enganar o mordomo para roubar dados).
- Sem o Segurança: Os mordomos eram inconsistentes. Alguns recusavam o truque (100% seguros), mas outros caíam nele (apenas 38% seguros). O mordomo mais caro era apenas 50% seguro.
- Com o Segurança: 100% dos ataques foram bloqueados. Todos os modelos, do mais barato ao mais caro, interromperam as ações maliciosas.
- Velocidade: O segurança tomou a decisão em 0,03 milissegundos. Isso é tão rápido que é como um piscar de olhos; não atrasou nada.
- Teste do Mundo Real: Eles testaram isso em uma simulação bancária. O segurança interrompeu todas as tentativas de um hacker de roubar dinheiro, mesmo quando o hacker tentou enganar o mordomo.
O Que Este Sistema NÃO Faz
É importante conhecer os limites, assim como saber o que um segurança não pode fazer:
- Ele não impede o mordomo de ficar confuso. O mordoso ainda pode ser enganado a pensar que um estranho é o proprietário. O segurança apenas impede o mordomo de agir sobre essa confusão.
- Ele não impede um hacker de invadir a sala do segurança. Se o invasor controlar o computador do segurança, todo o sistema falha.
- Ele não impede o mordomo de usar suas próprias ferramentas integradas. Se o mordomo tiver uma "porta dos fundos" (backdoor) secreta (como um comando de shell integrado) que contorna o segurança, o segurança não pode impedi-lo. O artigo diz que você deve desativar essas portas dos fundos ao instalar o sistema.
A Conclusão Final
O artigo argumenta que não devemos confiar nos modelos de IA para policiar a si mesmos. Em vez disso, devemos colocar um segurança criptográfico separado à frente deles. Este segurança verifica a identidade de quem pede, verifica as regras e emite um recibo. Isso transforma uma situação caótica e imprevisível em uma situação determinística e segura, onde ações maliciosas são bloqueadas 100% das vezes, independentemente de qual modelo de IA está sendo usado.
Afogado em artigos na sua área?
Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.