Instruction Bleed: Cross-Module Interference in Prompt-Composed Agentic Systems
Cet article identifie et formalise la « fuite comportementale compositionnelle » (CBL), un mode de défaillance subtil dans les systèmes agentiques à prompts composés où l'édition d'un module de prompt modifie silencieusement le comportement des autres en raison de la non-isolation architecturale dans l'auto-attention des transformers, démontrant par des essais empiriques que cette interférence, bien que souvent sous le seuil de détection pour des décisions individuelles, pose un risque de cumul significatif dans les déploiements à grande échelle.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Imaginez que vous construisez un robot assistant en collant ensemble différents manuels d'instructions. Vous avez une page pour « Comment être poli », une autre pour « Comment recruter des employés », et une troisième pour « Comment écrire du code ». Vous collez tout cela pour former un seul document géant et le donnez au robot (une IA) pour qu'il le lise.
La grande hypothèse que tout le monde fait est la suivante : « Si je modifie la page "Comment être poli", cela ne modifiera pas accidentellement la façon dont le robot effectue la tâche de "Recrutement". »
Ce document affirme : Cette hypothèse est fausse.
Voici la décomposition de ce que les chercheurs ont découvert, en utilisant des analogies simples :
1. Le problème : « La fuite d'instructions »
Les chercheurs appellent ce phénomène « Instruction Bleed » (ou fuite comportementale compositionnelle).
Imaginez le cerveau de l'IA comme une immense pièce ouverte où toutes les pages d'instructions sont étalées sur le sol. Dans un programme informatique normal, si vous modifiez une règle dans la section « Cuisine », la section « Garage » reste exactement la même car elles sont dans des pièces séparées.
Mais avec l'IA, la « pièce » est un seul grand espace ouvert. L'IA lit tout à la fois, connectant chaque mot à tous les autres. Les chercheurs ont découvert que si vous éditez discrètement une page qui ne devrait pas compter (comme ajouter une recette aléatoire dans le manuel de « Recrutement »), cela peut modifier silencieusement la façon dont l'IA évalue les candidats.
L'analogie : Imaginez que vous écrivez une histoire. Si vous ajoutez soudainement un paragraphe sur des « piments épicés » au milieu d'un chapitre sur les « réparations automobiles », l'IA pourrait inconsciemment commencer à penser que la réparation automobile doit être « épicée » ou « chaude », même si vous ne lui avez pas dit. Le sens « fuit » d'une section à l'autre.
2. L'expérience : Le robot d'entretien d'embauche
Pour prouver cela, les chercheurs ont construit un test spécifique utilisant un agent d'IA réel conçu pour évaluer des candidatures.
- La configuration : Ils avaient un module « focal » (la partie qui évalue à quel point un CV correspond à un emploi).
- Le tour de passe-passe : Ils ont pris un module totalement sans rapport (un ensemble de règles pour évaluer des recettes) et y ont apporté trois types de modifications :
- Volume : Rendre simplement la section des recettes plus longue.
- Contenu : Ajouter une description de personnage étrange et non pertinente dans les règles de la recette.
- Forme : Changer la police, les emojis ou les titres dans la section de la recette sans changer les mots.
Le résultat :
- Changer la longueur ou le format (emojis/titres) n'a pas vraiment modifié les scores de recrutement.
- MAIS, changer le contenu (ajouter cette description de personnage étrange) a provoqué un changement systématique dans la façon dont l'IA évaluait les candidats.
Les scores ont légèrement dévié, mais de manière constante. L'IA n'a pas commencé à rejeter tout le monde ou à embaucher tout le monde ; elle a simplement donné des scores légèrement différents.
3. Pourquoi cela importe : Le « Dérive Silencieuse »
La partie la plus effrayante de cette découverte est que personne ne l'a remarqué.
- L'effet « Sous le seuil » : L'IA n'a pas commis d'erreur énorme ou évidente (comme embaucher un clown pour un poste de chirurgien). Elle a simplement décalé les scores de manière infime.
- La métaphore : Imaginez une balance censée peser des pommes. Si vous posez un livre lourd de l'autre côté de la pièce (l'instruction sans rapport), la balance ne se casse pas, mais elle commence à peser chaque pomme 0,5 livre de plus. Vous ne verriez pas une seule pomme « exploser » ou disparaître, mais si vous pesez 1 000 pommes, votre inventaire total sera faux.
- Le risque : Dans la vie réelle, si une IA est utilisée pour classer des milliers de candidats, ces dérives infimes et silencieuses pourraient changer qui obtient un entretien et qui est rejeté, même si l'IA semble fonctionner parfaitement.
4. Pourquoi cela arrive-t-il ?
Le document explique que l'architecture de l'IA (appelée « Transformer ») est conçue pour regarder l'intégralité du document à la fois. Elle n'a pas de « murs » entre les différents modules d'instructions.
- La réalité du « Sans murs » : Même si vous mettez une ligne d'étoiles (
***) ou un titre comme### Règles de Recrutementdans le texte, l'IA ne traite pas cela comme une frontière stricte. Pour l'IA, tout n'est qu'un seul grand flux de mots. - Le problème de « Mémoire » : L'IA possède une « mémoire de travail » limitée. Lorsque vous ajoutez du texte (même du texte non pertinent), cela encombre l'espace nécessaire pour se concentrer parfaitement sur la tâche d'origine.
5. Ce que les chercheurs proposent
Le document ne se contente pas de pointer le problème ; il propose une nouvelle façon de tester.
- Le nouveau test : Avant de lancer un système d'IA, vous ne devez pas seulement vérifier s'il fonctionne. Vous devez vérifier si le changement d'une partie des instructions casse une autre partie.
- Le test de « Régression » : Ils suggèrent que chaque fois qu'un développeur ajoute un nouveau module d'instruction, il doit tester à nouveau les anciens modules pour s'assurer que le nouvel ajout n'a pas provoqué de « fuite ».
Résumé
Ce document révèle que lorsque nous construisons des agents d'IA en assemblant des instructions textuelles, nous construisons sur des bases fragiles. Modifier une partie des instructions peut modifier subtilement et silencieusement la façon dont l'IA se comporte dans d'autres parties, même si les changements semblent sans rapport. C'est une « dérive silencieuse » que les méthodes de test actuelles ne détectent pas, mais qui pourrait avoir des conséquences réelles sur des décisions comme l'embauche ou le crédit. Les auteurs fournissent une nouvelle liste de contrôle pour attraper ces fuites invisibles avant qu'elles ne causent des problèmes.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.