Position: The Term "Machine Unlearning" Is Overused in LLMs
Ce document de position soutient que le terme « machine unlearning » est actuellement surutilisé dans la recherche sur les LLM pour décrire des tâches diverses telles que le refus ou la suppression, et appelle à réserver ce terme strictement à la suppression définie par le jeu de données avec des garanties d'équivalence de réentraînement afin d'éviter des évaluations trompeuses et d'assurer une terminologie appropriée pour différents objectifs.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
L'idée principale : L'« oubli » est mal utilisé
Imaginez que vous avez un étudiant qui a étudié une bibliothèque massive de livres pour devenir un expert. Maintenant, imaginez que l'un de ces livres a été volé, ou que l'auteur exige qu'il soit retiré de l'esprit de l'étudiant.
L'article soutient que les chercheurs utilisent le terme « Machine Unlearning » (ou désapprentissage machine) de manière trop imprécise. Ils appellent beaucoup de choses différentes « unlearning », mais ils font en réalité des tâches très différentes.
Les auteurs affirment que nous devons cesser de faire cette confusion. Nous devons réserver le terme strict de « Machine Unlearning » pour un travail spécifique et très difficile, et utiliser des noms différents pour les autres tâches, plus faciles.
1. La définition stricte : « La Gomme »
Ce que cela signifie réellement :
Le véritable « Machine Unlearning » est comme utiliser une gomme magique sur une peinture. Vous voulez retirer un ensemble spécifique de coups de pinceau (l'ensemble à oublier) si parfaitement que la peinture semble exactement la même que si l'artiste n'avait jamais peint ces coups de pinceau à l'origine.
- Le standard d'excellence : Pour prouver que vous avez bien fait votre travail, vous devez comparer votre peinture « effacée » à une nouvelle peinture réalisée par un artiste qui a commencé de zéro avec les livres restants, sans jamais avoir vu le livre volé.
- L'objectif : Les deux peintures doivent être indiscernables. Si l'étudiant est toujours capable de résoudre un problème de mathématiques qu'il a appris uniquement grâce au livre volé, alors il n'a pas vraiment « oublié », même s'il refuse de répondre à la question spécifique à son sujet.
2. La confusion : Ce que les gens font réellement
Actuellement, de nombreux chercheurs disent qu'ils font de l'« unlearning » alors qu'ils font en réalité l'une de ces autres choses :
- Le « Refus » (Le chien de garde) : Le modèle est entraîné pour dire « Je ne sais pas » ou « Je ne peux pas répondre à cela » lorsqu'on l'interroge sur le sujet interdit.
- Analogie : C'est comme un chien de garde qui aboie et vous empêche d'entrer dans la pièce. Le chien sait toujours que la pièce existe, mais il ne vous laisse pas entrer. Le chien n'a pas oublié la pièce ; il a juste été entraîné pour vous bloquer.
- La « Suppression » (Le bouton Muet) : Le modèle est ajusté pour qu'il soit très peu probable qu'il prononce les mots spécifiques associés au sujet interdit.
- Analogie : C'est comme mettre un bouton de sourdine sur un mot spécifique. Le mot est toujours dans le dictionnaire, mais l'orateur est entraîné à l'ignorer.
- L'« Édition » (La Réécriture) : On apprend au modèle un nouveau fait pour remplacer l'ancien.
- Analogie : Au lieu d'effacer le souvenir de « Paris est la capitale de la France », vous le remplacez par « Londres est la capitale ». L'ancien souvenir peut encore être là, simplement enfoui sous un nouveau.
Le Problème : Les chercheurs prétendent souvent avoir « oublié » quelque chose parce que le modèle ne répond plus aux questions (le Chien de Garde a aboyé). Mais les auteurs disent que c'est un tour de passe-passe. Le modèle pourrait encore connaître l'information au fond de lui ; il fait simplement semblant de ne pas savoir.
3. Le danger caché : Les « Capacités Dérivées »
C'est la partie la plus critique de l'article. Parfois, apprendre une chose spécifique vous donne un superpouvoir qui va au-delà de ce simple fait.
- L'analogie : Imaginez qu'un étudiant apprenne à résoudre un type spécifique de problème mathématique en utilisant un manuel volé. Même si vous lui faites « oublier » les réponses spécifiques du livre, il se peut qu'il ait tout de même appris la logique ou la capacité de raisonnement en lisant ce livre.
- Le risque : Si vous vérifiez simplement s'il peut réciter les réponses (Échec de l'Output), il pourrait échouer au test. Mais si vous lui posez un nouveau problème de mathématiques utilisant la même logique, il pourrait encore le résoudre parfaitement.
- Le point de l'article : Le véritable « unlearning » signifie supprimer ce superpouvoir aussi. Si le livre volé lui a donné une compétence, et que vous lui faites « oublier », il devrait perdre cette compétence, même si cela le rend légèrement moins bon en mathématiques de manière générale. S'il conserve la compétence, il n'a pas vraiment oublié l'influence de ce livre.
4. Pourquoi les tests actuels échouent
L'article souligne que la plupart des tests actuels sont comme des QCM (Questions à Choix Multiples).
- Test actuel : « Le modèle peut-il répondre à la Question A ? » Si le modèle dit « Je ne sais pas », le test conclut : « Super ! Tu as oublié ! »
- La faille : Cela teste seulement si le modèle cache la réponse. Cela ne teste pas si le modèle a supprimé la connaissance.
- La solution : Nous devons comparer le modèle « désappris » à un modèle « réentraîné » (celui qui n'a jamais vu les mauvaises données). Si le modèle désappris est toujours meilleur que le modèle réentraîné pour une tâche spécifique, cela signifie que les « mauvaises données » l'influencent encore.
5. La solution des auteurs : Un nouveau code de conduite
Les auteurs proposent trois changements principaux pour corriger ce désordre :
Cesser d'utiliser « Unlearning » comme un terme générique.
- Si vous faites simplement en sorte que le modèle refuse de répondre, appelez cela du « Refus » ou de la « Suppression ».
- Si vous supprimez réellement l'influence de l'entraînement pour correspondre à un modèle réentraîné, alors appelez cela du « Machine Unlearning ».
Utiliser un « Modèle de Référence » pour la comparaison.
- Vous ne pouvez pas simplement dire « Le modèle a oublié ». Vous devez dire : « Le modèle se comporte exactement comme un modèle qui a été entraîné sans ces données ».
- (Les auteurs admettent que réentraîner de gros modèles est coûteux, mais ils disent que nous devons utiliser le meilleur proxy possible ou admettre que nous ne faisons pas du vrai unlearning).
Tester les « Superpouvoirs » (Capacités Dérivées).
- Ne posez pas seulement au modèle les questions sur lesquelles il a été entraîné. Posez-lui de nouvelles questions qui nécessitent les compétences qu'il aurait pu apprendre des mauvaises données. S'il est toujours capable de réaliser ces nouvelles tâches, l'unlearning a échoué.
Résumé
L'article est un plaidoyer pour l'honnêteté scientifique.
- Ne pas appeler un « Refus » (dire « Je ne sais pas ») un « Unlearning » (effacer la mémoire).
- Ne pas penser que parce qu'un modèle ne répond pas à une question, il a oublié la connaissance. Il joue peut-être simplement à cache-cache.
- Comparer vos résultats à un modèle qui n'a jamais vu les mauvaises données dès le départ.
- Vérifier si le modèle possède toujours les « superpouvoirs » qu'il a obtenus grâce aux mauvaises données.
Si nous ne corrigeons pas cette terminologie, nous pourrions croire que nous sommes en sécurité et conformes, alors que nous ne faisons que cacher la vérité.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.