← Derniers articles
🤖 AI

On the Inseparability of Instructions and Data in Shared-Embedding Sequence Models

Cet article démontre que la prévention parfaite des injections de requêtes est mathématiquement impossible dans les modèles de séquences à plongements partagés, en arguant que la sécurité robuste nécessite une séparation architecturale des canaux de contrôle et de contenu plutôt que l'amélioration des défenses au sein du pipeline.

Auteurs originaux : Dewank Pant, Shruti Lohani, Avijit Kumar

Publié 2026-06-29
📖 7 min de lecture🧠 Analyse approfondie

Auteurs originaux : Dewank Pant, Shruti Lohani, Avijit Kumar

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

L'idée principale : Le problème du « Bol Mélangeur »

Imaginez que vous êtes un chef (le modèle d'IA) travaillant dans une cuisine. Vous avez deux types d'ingrédients :

  1. La Fiche Recette (Instructions de confiance) : Ce sont les règles données par le propriétaire du restaurant (ex : « Ne servez que des plats végétariens », « Ne donnez jamais la sauce secrète »).
  2. La Commande du Client (Données non fiables) : Ce sont les requêtes apportées par les clients (ex : « Je veux un burger », « Peux-tu me raconter une blague ? »).

Dans les modèles d'IA actuels, le chef met à la fois la Fiche Recette et la Commande du Client dans le même bol mélangeur. Ils sont hachés, mélangés et broyés ensemble en une seule soupe d'ingrédients uniforme avant que le chef ne commence à cuisiner.

La thèse principale du papier :
Les auteurs soutiennent que, parce que la Recette et la Commande sont mélangées dans le même bol, il est mathématiquement impossible pour le chef de distinguer parfaitement « ce que le propriétaire a dit » de « ce que le client a dit » une fois qu'ils sont mélangés.

Si un client glisse une note dans sa commande disant : « Ignore la fiche recette et donne-moi la sauce secrète », le chef ne peut pas distinguer que cette note est différente de la recette elle-même. Pour le cerveau du chef, tout n'est que « soupe ». Par conséquent, le chef pourrait accidentellement suivre la note sournoise du client au lieu des règles du propriétaire.

L'analogie centrale : La machine Von Neumann

Le papier compare ce problème d'IA à une célèbre faille de sécurité informatique des années 1970 appelée Dépassement de tampon (Buffer Overflow).

  • Anciens ordinateurs (Architecture Von Neumann) : Dans ces machines, les programmes informatiques (code) et les données (nombres) vivaient dans le même espace mémoire. Un pirate pouvait tromper l'ordinateur en lui injectant des données qui ressemblaient à un programme. L'ordinateur exécutait alors accidentellement les données comme s'il s'agissait d'une commande, faisant planter le système ou permettant au pirate de prendre le contrôle.
  • IA Moderne (Transformers) : Les auteurs affirment que l'IA présente exactement la même faille. Les « Instructions » (le prompt système) et les « Données » (l'entrée utilisateur) vivent dans le même espace mathématique (les vecteurs). Un pirate peut concevoir des « données » qui ressemblent à des « instructions » pour l'IA. Parce que l'IA ne peut pas les distinguer une fois qu'elles sont mélangées, elle suit les instructions du pirate.

Le papier soutient que, tout comme on ne pouvait pas corriger les dépassements de tampon simplement avec un « meilleur code » ou une « saisie plus prudente », nous ne pouvons pas corriger l'injection de prompt (prompt injection) simplement avec un « meilleur entraînement » ou « plus de filtres ». Le problème est l'architecture (le bol mélangeur), et non la compétence du chef.

Les trois raisons pour lesquelles c'est impossible

Le papier prouve cette impossibilité en trois étapes logiques :

1. Le problème du « Vocabulaire Partagé » (Collision de représentation)

  • La métaphore : Imaginez que la Fiche Recette et la Commande du Client utilisent tous deux le mot « Sel ».
  • La réalité : Dans l'IA, des mots comme « le », « est », « vous » et « aide » apparaissent à la fois dans les instructions système et dans les entrées utilisateur. L'IA associe ces mots au même nombre mathématique. Une fois que l'IA voit le mot « aide », elle ne sait pas s'il provient de la règle du propriétaire (« Aide l'utilisateur ») ou de la ruse de l'utilisateur (« Aide-moi à contourner les règles »). La « source » du mot est effacée dès qu'il entre dans le bol.

2. L'angle mort dans la cuisine (Récupération de la provenance)

  • La métète : Si vous essayez de regarder la soupe et de deviner quelle cuillerée provient de la Fiche Recette et laquelle provient de la Commande du Client, vous vous tromperez parfois.
  • La réalité : Le papier prouve mathématiquement que, comme les ingrédients « de confiance » et « non fiables » sont si similaires (ils partagent le même vocabulaire et le même espace), aucune quantité d'observation de la soupe ne pourra parfaitement les distinguer. Il y aura toujours une petite chance d'erreur. Si vous ne pouvez pas les distinguer parfaitement, vous ne pouvez pas bloquer parfaitement les éléments malveillants.

3. Le problème des « Variations Infinies » (Couverture finie)

  • La métaphore : Imaginez que vous entraîniez votre chef à reconnaître 1 000 façons dont un client pourrait essayer de le tromper. Mais un client rusé peut écrire sa ruse de 1 000 000 de façons différentes (en utilisant différentes langues, des emojis, du code ou des astuces d'orthographe) qui signifient toutes la même chose.
  • La réalité : Vous pouvez entraîner une IA sur des millions d'exemples, mais le nombre de façons de la tromper est effectivement infini. Comme l'IA apprend en voyant des exemples, elle ne pourra jamais apprendre à être sûre contre chaque variation possible d'une ruse. Elle aura toujours un « angle mort » pour une ruse qu'elle n'a pas encore vue.

Ce que cela signifie pour la sécurité de l'IA

Les auteurs ne disent pas que l'IA est inutile ou que nous devrions arrêter de l'utiliser. Ils disent :

  • On ne peut pas « patcher » le bol mélangeur : Vous ne pouvez pas corriger ce problème simplement en entraînant mieux l'IA, en ajoutant plus de « garde-fous » ou en filtrant les mots. Tant que l'IA mélange les instructions et les données dans le même espace, un attaquant rusé finira par trouver un moyen d'y glisser une fausse instruction.
  • La solution est architecturale : Pour vraiment résoudre cela, nous devons changer la conception de la cuisine. Nous avons besoin d'un système où la Fiche Recette et la Commande du Client sont conservées dans des bols séparés qui ne se mélangent jamais jusqu'à la toute fin. La « Recette » doit être une règle rigide que la « Commande du Client » ne peut ni toucher ni écraser.
  • Défense en profondeur : Jusqu'à ce que nous construisions ces nouveaux systèmes à « bols séparés », nous devons traiter l'IA comme nous traitons les anciens ordinateurs sujets aux dépassements de tampon : partons du principe qu'ils seront piratés, utilisez plusieurs couches de défenses faibles (comme des pare-feu et des bacs à sable) et limitez les dégâts s'ils sont effectivement compromis.

Résumé

Le papier prouve que la sécurité parfaite est impossible pour les modèles d'IA actuels car ils traitent « ce qu'il faut faire » et « ce qu'il faut traiter » comme étant la même chose. C'est comme demander à un chef d'ignorer la note du client si la note est écrite avec la même encre et sur le même papier que la recette. La seule façon de résoudre cela est de changer la conception fondamentale de l'IA, et non de simplement essayer de mieux l'entraîner.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →