PRISM: Generation-Time Detection and Mitigation of Secret Leakage in Multi-Agent LLM Pipelines
PRISM é um mecanismo de defesa em tempo real para sistemas de LLM multiagentes que mitiga o vazamento de segredos ao detectar dinâmicas de geração precoce, como colapso de entropia e concentração de logits, para intervir por token antes que informações sensíveis sejam totalmente reconstruídas, alcançando precisão perfeita e vazamento zero em um benchmark adversarial abrangente.
Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo
Imagine uma equipe de quatro robôs trabalhando juntos para resolver um problema complexo, como depurar um sistema de computador. Eles passam notas de um para o outro em um caderno compartilhado (o "contexto").
Aqui está o problema: se o primeiro robô pegar acidentalmente uma senha secreta de um arquivo e escrevê-la no caderno, o segundo robô pode vê-la, copiá-la para sua própria nota e passá-la ao terceiro. Mesmo que ninguém tenha a intenção de roubar a senha, o segredo é repassado ao longo da linha, amplificado e acaba, eventualmente, na mensagem final enviada ao usuário humano. O artigo chama isso de "Amplificação de Propagação". É como um jogo de "Telefone", mas, em vez de a mensagem ficar distorcida, ela fica perigosamente exposta.
As Velhas Maneiras de Parar Vazamentos
Os autores afirmam que os atuais guardas de segurança para essas equipes de robôs são como seguranças que só verificam as pessoas depois de que elas já saíram do clube.
- Escaneadores Estáticos: São como procurar por uma camisa vermelha específica. Se o segredo estiver escrito em uma fonte diferente ou escondido de maneira estranha, o escaneador o perde.
- Juízes LLM: São como contratar um segundo robô para ler a nota final e dizer: "Hmm, isso parece arriscado". Mas, no momento em que leem, o segredo já está fora e o dano está feito.
- Instruções de Prompt: É como dizer aos robôs: "Não falem sobre segredos!" Mas, se os robôs estiverem confusos ou enganados, eles esquecem a regra.
A Nova Solução: PRISM
O artigo apresenta o PRISM (Intervenção Preditiva de Risco para Monitoramento de Segredos). Em vez de esperar até que a nota esteja pronta, o PRISM age como um policial de trânsito parado bem ao lado da boca do robô enquanto ele está falando.
O PRISM não olha apenas o que o robô está dizendo; ele observa como o robô está pensando enquanto fala.
O Momento "Eureka": O Colapso da Entropia
A maior descoberta do artigo é um padrão específico na forma como os robôs pensam quando estão prestes a revelar um segredo.
- Pensamento Normal: Quando um robô está escrevendo uma história ou resolvendo um problema de matemática, ele tem muitas opções para a próxima palavra. É como uma pessoa vagando por uma floresta com muitos caminhos para escolher. Isso é chamado de "alta entropia" (muita incerteza).
- Pensamento Secreto: Quando um robô começa a reproduzir um segredo memorizado (como uma senha), ele para de vagar. Ele sabe exatamente qual deve ser a próxima letra. A "floresta" encolhe para um único caminho reto. O robô torna-se extremamente certo e sua "incerteza" colapsa.
O PRISM detecta essa mudança súbita de "vagar" para "certeza". Ele vê o cérebro do robô travando em um padrão específico antes mesmo que o segredo completo seja escrito.
Como o PRISM Funciona (O Sistema de Semáforo)
O PRISM atribui uma pontuação de risco a cada palavra que o robô está prestes a dizer, usando uma mistura de 16 pistas diferentes (como quão certo o robô está, a forma das palavras e quais ferramentas está usando). Ele usa um sistema de três cores:
- 🟢 Verde (Seguro): O robô está apenas conversando ou resolvendo um problema normal. Deixe-o falar.
- 🟡 Amarelo (Suspeito): O robô está ficando um pouco certo demais com um padrão que se parece com uma senha. O PRISM substitui gentilmente essa palavra por um marcador (como
[MASK]) para que o fluxo continue, mas o segredo permaneça oculto. - 🔴 Vermelho (Perigo): O robô está em uma via rápida para revelar um segredo completo. O PRISM freia imediatamente, parando o robô antes que o segredo seja concluído.
Os Resultados
Os autores testaram isso em uma simulação massiva com 2.000 tarefas diferentes e 13 maneiras distintas de enganar os robôs.
- Os Velhos Guardas: Mesmo os melhores métodos existentes permitiram que segredos vazassem em cerca de 15% dos casos.
- PRISM: Ele bloqueou 100% dos vazamentos. Ele não apenas pegou o segredo no final; ele pegou o robô enquanto ele tentava escrever o segredo.
- Velocidade: Foi incrivelmente rápido, adicionando quase nenhum atraso à conversa, ao contrário de outros métodos que exigiam que um segundo robô lesse tudo primeiro.
A Conclusão
O artigo argumenta que, em uma equipe de agentes de IA, os segredos não vazam apenas por causa de um prompt ruim; eles vazam por causa da estrutura da própria equipe. Uma vez que um segredo entra no caderno compartilhado, ele se espalha como um vírus. O PRISM é a primeira ferramenta que age como um sistema imunológico, identificando os primeiros sintomas da infecção (a certeza súbita do robô) e parando-a antes que o vírus se espalhe para a saída final.
Afogado em artigos na sua área?
Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.