Privacy from Symmetry: Orthogonally Equivariant Transformers for LLM Inference
Cet article propose ConjFormer, une architecture de transformateur orthogonalement équivariante qui permet l'inférence de LLM respectueuse de la vie privée en permettant aux clients de transmettre des états cachés secrètement rotés à un serveur, empêchant ainsi efficacement les attaques par récupération de jetons tout en maintenant une dégradation minimale des performances.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Imaginez que vous vouliez poser une question à une IA super intelligente (un grand modèle de langage) concernant vos dossiers médicaux privés. Le problème est que l'IA vit sur un serveur puissant très loin de chez vous, et vous ne voulez pas envoyer votre texte brut là-bas car le propriétaire du serveur pourrait y jeter un coup d'œil.
Habituellement, les gens essaient de diviser le travail : vous effectuez la première partie de la réflexion sur votre téléphone, puis vous envoyez uniquement les « pensées » (des nombres cachés) au serveur pour qu'il termine le travail. Mais il y a un piège : ces « pensées » sont comme un code secret qui peut être déchiffré. Si le serveur possède un dictionnaire public de ce à quoi ressemblent les mots sous forme de nombres, il peut faire correspondre vos « pensées » au dictionnaire et deviner exactement ce que vous avez tapé.
La solution du papier : Le « Rotateur Magique »
Ce papier présente un nouveau système appelé CONJFORMER. Voyez cela comme un bouclier de confidentialité magique qui utilise la géométrie plutôt qu'un chiffrement lourd.
Voici comment cela fonctionne, en utilisant une analogie simple :
1. Le problème : Le « Verre Transparent »
Imaginez que vos données sont une sculpture posée sur une table. Le serveur possède un catalogue de toutes les sculptures possibles. Si vous envoyez la sculpture au serveur, celui-ci peut simplement la regarder, la comparer à son catalogue et dire : « Ah, c'est une image de chat ! ». Même si vous envoyez la sculpture sous une lumière légèrement différente, la forme reste la même, et il peut donc la reconnaître.
2. La solution : Le « Tournement Secret »
Les auteurs proposent qu'avant d'envoyer votre sculpture, vous la placiez sur un plateau tournant et que vous la fassiez pivoter de 90 degrés (ou n'importe quel angle aléatoire) en utilisant une clé secrète que vous seul connaissez.
- Vous : Faites pivoter la sculpture.
- Le Serveur : Reçoit la sculpture pivotée. Il ne sait plus quel sens est « le haut ».
- La Magie : L'IA du serveur est construite d'une manière spéciale (en utilisant une nouvelle architecture appelée CONJFORMER) qui lui permet de résoudre le puzzle exactement de la même manière, même si la sculpture est à l'envers ou sur le côté. Elle n'a pas besoin de connaître l'orientation d'origine pour faire son travail.
3. Le « Changement Architectural » (La Recette Secrète)
Pour que cela fonctionne, l'IA du serveur doit être construite différemment. Les modèles d'IA standards sont comme des robots rigides ; si vous inclinez leur vue, ils sont confus.
Les auteurs ont modifié le « cerveau » de l'IA (l'architecture Transformer) en :
- Modifiant la « Normalisation » : Ils ont ajusté une petite partie des mathématiques (en remplaant une règle complexe par une règle scalaire simple) afin que l'IA ne se soucie pas de la direction des données.
- Pivotant les Poids : Tout comme vous avez pivoté l'entrée, les « règles » internes du serveur (les poids) sont mathématiquement pivotées pour correspondre.
Le Résultat : Le serveur effectue le calcul dans un « monde pivoté ». Il ne voit jamais vos données sous leur forme originale. Il ne voit que la version pivotée.
4. Le serveur peut-il tricher ? (Les Attaques)
Le papier teste si un serveur sournois peut deviner le pivot secret et « dé-pivoter » les données.
- Ancienne Attaque (Plus Proche Voisin) : Avant, le serveur se contentait de faire correspondre les formes. Maintenant, cela est impossible car les formes tournent.
- Nouvelle Attaque (Alignement des Poids) : Le serveur essaie de deviner le pivot en regardant les « règles » (poids) qu'il a reçues. C'est comme essayer de deviner comment un puzzle a été pivoté en regardant l'image sur la boîte.
- Le Résultat : Le papier montre que si vous entraînez le modèle sur vos données privées (fine-tuning), la capacité du serveur à deviner le pivot passe d'une très bonne performance (récupération de plus de 35 % de vos mots) à une performance presque aléatoire (récupération de seulement 1,3 %).
5. Le Compromis
Cela rend-il l'IA moins intelligente ?
- Très légèrement. Le papier a testé cela sur des modèles comme GPT-2 et Llama. Après les changements, la performance de l'IA (mesurée par la « perplexité », ou à quel point elle est confuse) a chuté d'un montant infime (moins de 0,4 % à 2 %).
- Pas de Bruit : Contrairement à d'autres méthodes de confidentialité qui ajoutent du « bruit » ou des « interférences » aux données (ce qui donne l'impression que l'IA parle avec une voix enrouée), cette méthode garde les données propres ; elle les fait simplement pivoter.
Résumé
CONJFORMER est un moyen de laisser une IA distante terminer vos tâches privées sans jamais voir vos données brutes. Il y parvient en :
- Pivotant vos données avec une clé secrète avant l'envoi.
- Réadaptant l'IA pour qu'elle puisse fonctionner parfaitement sur les données pivotées sans jamais avoir besoin de les « dé-pivoter ».
- Brisant la capacité du serveur à simplement chercher vos mots dans un dictionnaire, le forçant à résoudre un puzzle mathématique beaucoup plus difficile qu'il ne peut craquer une fois que vous avez entraîné le modèle sur vos données spécifiques.
C'est une défense pratique qui repose sur la symétrie (l'idée que les mathématiques fonctionnent de la même manière quelle que soit la direction) plutôt que sur un chiffrement lourd et lent.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.