A Multi-Agent Framework for Explainable Prompt Injection Detection in Large Language Models
Este artigo apresenta o PromptShield, um framework multiagente interpretável que combina análise semântica baseada em transformer com técnicas de XAI como SHAP e LIME para detectar e explicar eficazmente ataques de injeção de prompt em Grandes Modelos de Linguagem.