← Derniers articles
💬 NLP

Extracting Training Data from Diffusion Language Models via Infilling

Ce papier introduit l'extraction par remplissage pour démontrer que les modèles de langage par diffusion sont nettement plus vulnérables à la mémorisation des données d'entraînement que les modèles autoregressifs, car leurs capacités de débruitage bidirectionnel permettent à des adversaires d'extraire jusqu'à trois fois plus de séquences mot à mot, y compris des informations d'identification personnelle masquées, en utilisant des masques conditionnés par les bords.

Auteurs originaux : Yihan Wang, N. Asokan

Publié 2026-05-26
📖 6 min de lecture🧠 Analyse approfondie

Auteurs originaux : Yihan Wang, N. Asokan

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous avez un assistant bibliothécaire géant et ultra-intelligent (un Modèle de Langage à Grande Échelle) qui a lu des millions de livres, d'e-mails et de documents. Vous voulez savoir : Si quelqu'un demande à cet assistant de répéter une phrase spécifique de sa mémoire, quelle est la probabilité qu'il laisse échapper le secret ?

Pendant longtemps, les chercheurs n'ont testé cela qu'en demandant à l'assistant de « compléter la phrase » en partant du tout début. C'est comme montrer à quelqu'un la première moitié d'une histoire et lui demander de deviner le reste. Cela fonctionne bien pour les modèles d'IA standards qui lisent de gauche à droite, comme un humain qui lit un livre.

Mais cet article introduit un nouveau type d'IA appelé Modèle de Langage par Diffusion (DLM). Considérez un DLM non pas comme un lecteur, mais comme un restaurateur de tableaux endommagés. Si vous prenez un chef-d'œuvre et recouvrez des parties aléatoires de peinture blanche (masques), le travail du DLM est d'examiner l'ensemble du tableau — ce qui est à gauche, ce qui est à droite et ce qui est au milieu — et de deviner ce que les parties cachées devraient être.

Les auteurs de cet article disent : « Hé, nous avons testé ces restaurateurs de tableaux de la mauvaise façon ! »

Voici la décomposition de leurs découvertes en utilisant des analogies simples :

1. L'Ancienne Méthode vs La Nouvelle Méthode

  • L'Ancienne Méthode (Conditionnée par le Préfixe) : Imaginez que vous montriez au restaurateur uniquement le bord gauche d'un tableau et que vous demandiez : « Qu'est-ce qui vient ensuite ? » L'article a révélé que si vous ne faites que cela, le DLM semble assez sûr. Il ne fuite pas beaucoup d'informations secrètes.
  • La Nouvelle Méthode (Extraction par Remplissage) : Les auteurs ont réalisé que, comme les DLM peuvent examiner les deux côtés d'un trou, un attaquant malin pourrait masquer le milieu d'une phrase et demander : « Remplissez le blanc. » Ou, ils pourraient masquer les extrémités et demander : « Qu'y a-t-il au milieu ? »
    • L'Analogie : C'est comme jouer à un jeu de « Mad Libs ». Si vous donnez à l'IA le début et la fin d'une phrase, elle pourrait être capable de deviner parfaitement le mot du milieu, même si elle n'aurait pas pu deviner la fin si vous ne lui aviez donné que le début.

2. La Grande Découverte : « L'Arête » est la Zone de Danger

Les chercheurs ont testé différentes façons de cacher des parties du texte (masques). Ils ont découvert que la façon dont vous cachez le texte compte plus que vous ne le pensez.

  • L'Effet « Arête » : Si vous révélez le tout début et la toute fin d'une phrase (en cachant le milieu), le DLM est trois fois plus susceptible de fuiter les mots exacts que si vous ne révéliez que le début.
  • Pourquoi ? Parce que le DLM utilise des indices des deux côtés pour reconstruire le milieu. C'est comme si deux personnes chuchotaient le début et la fin d'un secret à une troisième personne ; elles peuvent déduire tout le secret beaucoup plus facilement que si une seule personne chuchotait le début.

3. Le Scénario du « Document Caviardé »

L'article examine un scénario effrayant très réaliste :

  • Imaginez qu'une entreprise entraîne une IA sur des e-mails privés, puis noircit (caviarde) tous les numéros de téléphone et les noms avant de publier les données ou le modèle.
  • L'Attaque : Un pirate informatique prend le modèle et dit : « J'ai l'e-mail avec le nom noirci. Veuillez remplir le blanc. »
  • Le Résultat : Même si l'IA a été entraînée sur des données caviardées, le « restaurateur de tableaux » (DLM) est si bon pour examiner le contexte environnant qu'il peut souvent deviner le nom ou le numéro noirci mieux qu'une IA standard de « lecture de livre » ne le pourrait.
  • La Conclusion : Le fait de noircir les informations sensibles dans les données d'entraînement ne signifie pas que l'IA ne s'en souviendra pas. En fait, pour ce type d'IA, il pourrait être plus facile de deviner le secret si vous lui donnez le contexte des deux côtés.

4. Réglage des Paramètres de « Restauration »

Les chercheurs ont également découvert que les paramètres utilisés pour « restaurer » le texte (comme le nombre d'étapes que l'IA prend pour deviner) modifient la quantité d'informations qu'elle fuite.

  • Lent et Régulier : Si vous faites en sorte que l'IA prenne de nombreuses petites étapes prudentes pour remplir les blancs, elle fuite plus d'informations secrètes.
  • Rapide et Négligent : Si vous la faites deviner rapidement, elle fuite moins.
  • La Leçon : Les « boutons » que vous tournez pour rendre l'IA plus rapide ou plus intelligente contrôlent également la quantité de ce dont elle se souvient. Vous ne pouvez pas simplement tourner un bouton pour la vitesse sans affecter la sécurité.

5. Le Fine-Tuning Ne Résout Pas le Problème

Enfin, ils se sont demandé : « Si nous enseignons à l'IA d'être un chatbot poli plus tard (un processus appelé SFT), oublie-t-elle les secrets ? »

  • La Réponse : Non. C'est comme essayer d'enseigner à un perroquet d'arrêter de dire un mot grossier en lui apprenant de nouveaux mots. Le perroquet pourrait arrêter de le dire parfois, mais si vous posez la bonne question (en utilisant l'astuce de « l'arête »), il crachera toujours l'ancien secret. La mémoire est toujours là ; elle a juste été réorganisée.

Résumé

Cet article nous met en garde : Les Modèles de Langage par Diffusion sont comme des restaurateurs de tableaux, pas seulement des lecteurs de livres. Si vous ne les testez qu'en leur demandant de compléter une phrase depuis le début, vous pensez qu'ils sont sûrs. Mais si vous les testez en leur demandant de remplir le milieu d'une phrase (en utilisant des indices des deux côtés), ils sont beaucoup plus susceptibles de fuiter des informations privées, même si ces informations ont été caviardées de leurs données d'entraînement.

La conclusion principale : Nous devons cesser de tester ces modèles avec un seul œil ouvert (en regardant de gauche à droite) et commencer à les tester avec les deux yeux ouverts (en examinant l'ensemble du tableau), sinon nous sous-estimerons considérablement la quantité de données privées qu'ils conservent.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →