PRISM: Generation-Time Detection and Mitigation of Secret Leakage in Multi-Agent LLM Pipelines
PRISM est un mécanisme de défense en temps réel pour les systèmes LLM multi-agents qui atténue les fuites de secrets en détectant les dynamiques de génération précoce, telles que l'effondrement de l'entropie et la concentration des logits, pour intervenir au niveau de chaque token avant que les informations sensibles ne soient entièrement reconstruites, atteignant une précision parfaite et zéro fuite sur un ensemble de tests adversariaux complet.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Imaginez une équipe de quatre robots travaillant ensemble pour résoudre un problème complexe, comme le débogage d'un système informatique. Ils échangent des notes dans un cahier partagé (le « contexte »).
Voici le problème : si le premier robot récupère accidentellement un mot de passe secret depuis un fichier et l'écrit dans le cahier, le deuxième robot pourrait le voir, le copier dans sa propre note et le transmettre au troisième. Même si personne n'a intentionnellement voulu voler le mot de passe, le secret est transmis le long de la chaîne, amplifié, et finit par se retrouver dans le message final envoyé à l'utilisateur humain. L'article appelle cela la « Propagation Amplification ». C'est comme un jeu de « Téléphone arabe », mais au lieu que le message se déforme, il devient dangereusement exposé.
Les anciennes méthodes pour stopper les fuites
Les auteurs affirment que les gardes de sécurité actuels pour ces équipes de robots ressemblent à des videurs qui ne vérifient les gens qu'après qu'ils ont déjà quitté le club.
- Scanners statiques : C'est comme chercher un t-shirt rouge spécifique. Si le secret est écrit dans une police différente ou caché de manière étrange, le scanner le manque.
- Juges LLM : C'est comme embaucher un deuxième robot pour lire la note finale et dire : « Hmm, cela semble risqué. » Mais au moment où ils la lisent, le secret est déjà sorti et les dégâts sont faits.
- Instructions de prompt : C'est comme dire aux robots : « Ne parlez pas de secrets ! » Mais si les robots sont confus ou trompés, ils oublient la règle.
La nouvelle solution : PRISM
L'article présente PRISM (Intervention Prédictive des Risques pour la Surveillance des Secrets). Au lieu d'attendre que la note soit terminée, PRISM agit comme un agent de circulation debout juste à côté de la bouche du robot pendant qu'il parle.
PRISM ne regarde pas seulement ce que le robot dit ; il observe comment le robot pense pendant qu'il parle.
Le moment « Eureka » : l'effondrement de l'entropie
La plus grande découverte de l'article est un motif spécifique dans la façon dont les robots pensent lorsqu'ils sont sur le point de révéler un secret.
- Pensée normale : Lorsqu'un robot écrit une histoire ou résout un problème de mathématiques, il a de nombreuses options pour le mot suivant. C'est comme une personne se promenant dans une forêt avec de nombreux chemins à choisir. Cela s'appelle une « entropie élevée » (beaucoup d'incertitude).
- Pensée secrète : Lorsqu'un robot commence à reproduire un secret mémorisé (comme un mot de passe), il arrête de vagabonder. Il sait exactement quelle doit être la lettre suivante. La « forêt » se réduit à un seul chemin droit. Le robot devient extrêmement certain, et son « incertitude » s'effondre.
PRISM détecte ce changement soudain de « vagabondage » vers la « certitude ». Il voit le cerveau du robot se verrouiller sur un motif spécifique avant même que le secret complet ne soit écrit.
Comment PRISM fonctionne (le système de feux tricolores)
PRISM attribue un score de risque à chaque mot que le robot est sur le point de dire, en utilisant un mélange de 16 indices différents (comme le degré de certitude du robot, la forme des mots et les outils qu'il utilise). Il utilise un système à trois couleurs :
- 🟢 Vert (Sûr) : Le robot discute simplement ou résout un problème normal. Laissez-le parler.
- 🟡 Jaune (Suspect) : Le robot devient un peu trop certain d'un motif qui ressemble à un mot de passe. PRISM remplace doucement ce mot par un espace réservé (comme
[MASQUÉ]) afin que le flux continue mais que le secret reste caché. - 🔴 Rouge (Danger) : Le robot est sur une voie rapide vers la révélation d'un secret complet. PRISM appuie immédiatement sur le frein, arrêtant le robot avant que le secret ne soit terminé.
Les résultats
Les auteurs ont testé cela sur une simulation massive avec 2 000 tâches différentes et 13 façons différentes de tromper les robots.
- Les anciennes gardes : Même les meilleures méthodes existantes ont laissé fuiter des secrets dans environ 15 % des cas.
- PRISM : Il a bloqué 100 % des fuites. Il n'a pas seulement attrapé le secret à la fin ; il a attrapé le robot pendant qu'il tentait d'écrire le secret.
- Vitesse : C'était incroyablement rapide, ajoutant presque aucun délai à la conversation, contrairement à d'autres méthodes qui nécessitaient qu'un deuxième robot lise tout d'abord.
La conclusion
L'article soutient que dans une équipe d'agents IA, les secrets ne fuient pas seulement à cause d'un mauvais prompt ; ils fuient à cause de la structure de l'équipe elle-même. Une fois qu'un secret entre dans le cahier partagé, il se propage comme un virus. PRISM est le premier outil qui agit comme un système immunitaire, repérant les premiers symptômes de l'infection (la certitude soudaine du robot) et l'arrêtant avant que le virus ne se propage à la sortie finale.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.