Unforgettable Generalization in Language Models
Cet article étudie comment les modèles de langage se comportent lorsqu'ils « désapprennent » des compétences via un ajustement fin sur des étiquettes aléatoires, révélant que la généralisation de l'oubli est hautement imprévisible et dépendante de la tâche, échouant souvent à s'étendre au-delà d'exemples d'entraînement spécifiques malgré des sorties superficiellement aléatoires, tandis que les capacités sous-jacentes à la tâche restent intactes comme en témoigne le succès du sondage linéaire.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Imaginez que vous avez un ami robot super intelligent qui a lu presque tout sur Internet. Il peut écrire des poèmes, résoudre des problèmes mathématiques et vous expliquer pourquoi le ciel est bleu. Mais parfois, ce robot apprend des choses que vous ne voulez pas qu'il sache, ou il devient trop doué pour une astuce spécifique que vous voulez lui "désapprendre". C'est le monde de l'« oubli machine » (machine unlearning), une branche de la recherche en intelligence artificielle qui pose une question délicate : peut-on faire oublier véritablement quelque chose à un robot ?
Pour comprendre l'expérience, vous devez savoir deux choses. Premièrement, ces robots (appelés Grands Modèles de Langage) sont entraînés en lisant des tonnes de textes, puis sont « affinés » (fine-tuned) sur des exemples spécifiques pour devenir meilleurs dans une tâche, comme répondre à des questions scientifiques. Deuxèmement, une méthode courante pour tenter de leur faire oublier consiste à leur montrer à nouveau les mêmes questions, mais avec des réponses complètement brouillées ou inventées. L'idée est que si vous confondez suffisamment le robot avec de mauvaises réponses, il finira par abandonner totalement ce sujet. Le grand mystère que les chercheurs traquent est le suivant : cette confusion se propage-t-elle ? Si vous confondez le robot sur une question spécifique, va-t-il oublier comment répondre à toutes les questions similaires, ou va-t-il simplement être confus pour cet exemple précis ?
La Grande Expérience de l'« Anti-Entraînement »
Dans cet article, les chercheurs Eric Zhang, Leshem Choshen et Jacob Andreas du MIT ont décidé de jouer au jeu de l'« oubli » avec un modèle de langage géant appelé Llama2. Ils ont traité le modèle comme un étudiant qui venait de réussir un examen avec brio, puis ils ont tenté de lui faire oublier la matière en le ré-enseignant avec des réponses aléatoires et absurdes. Ils voulaient voir si l'étudiant oublierait toute la matière ou seulement les exercices d'entraînement spécifiques qui lui avaient été montrés.
La Grande Surprise : Cela Dépend du Sujet
Les chercheurs ont testé cela sur 21 types de tâches différents, allant du « sens commun physique » (comme déterminer quel objet est le plus lourd) à l'« entailment » (décider si une phrase découle logiquement d'une autre). Les résultats ont été sauvages et imprévisibles.
Parfois, l'oubli fonctionnait parfaitement. S'ils tentaient de faire oublier au modèle la classification par entailment (un puzzle logique sur des phrases), le modèle devenait vide de sens. Il commençait à donner des réponses aléatoires et inutiles à de nouvelles questions qu'il n'avait jamais vues auparavant. C'était comme si le robot avait perdu la capacité de réaliser ce type de logique spécifique entièrement.
Mais d'autres fois, l'oubli était un échec total. Lorsque les chercheurs tentaient de faire oublier au modèle le sens commun physique (comme le fonctionnement de la gravité) ou des questions scientifiques, le modèle se montrait têtu. Même après avoir été entraîné sur des réponses fausses et aléatoires, il répondait encore correctement à de nouvelles questions scientifiques ! C'était comme un étudiant à qui l'on aurait forcé la mémoire avec de mauvaises réponses pour un examen d'entraînement spécifique, mais qui, lors du véritable examen, connaissait toujours les bonnes réponses. Le modèle semblait avoir oublié les exemples spécifiques sur lesquels il avait été entraîné, mais il conservait ses connaissances générales intactes.
Ce N'est Pas une Question de Difficulté
Vous pourriez penser que le modèle n'oublie que les choses faciles et se souvient des choses difficiles. Les chercheurs ont vérifié cela, et il s'avère que ce n'est pas le cas. Ils ont découvert que la difficulté de la tâche ne permettait pas de prédire si le modèle oublierait ou non. Par exemple, le modèle était en fait meilleur pour se souvenir des réponses des questions de l'ARC Challenge que de celles de l'ARC Easy, même si les deux étaient des questions de science. La difficulté de la question n'importait pas ; c'était le type de question qui comptait.
Les Indices Secrets : Confiance et Variabilité du « Cerveau »
Alors, qu'est-ce qui rend une compétence facile ou difficile à oublier ? Les chercheurs ont trouvé deux indices cachés dans le « cerveau » du modèle (ses représentations de données internes) :
- La Confiance : Si le modèle était déjà très incertain quant à la réponse avant le début de l'expérience d'oubli, il était plus facile de le faire oublier. Si le modèle était confiant, il s'accrochait plus fermement.
- La Variabilité du Cerveau : C'est un peu comme observer à quel point les pensées du modèle oscillent. Si les « pensées » internes du modèle (représentations) pour une tâche étaient éparpillées (variabilité élevée), il était plus difficile de les effacer. Si les pensées étaient très cohérentes et similaires (faible variabilité), le modèle était plus facile à « désapprendre ».
L'Oubli « Superficiel »
Voici la partie la plus déroutante. Même quand le modèle semblait avoir réussi à oublier une compétence — donnant des réponses aléatoires à tout le monde — les chercheurs ont découvert que l'information n'était pas réellement partie. Ils ont construit un outil simple appelé « sonde linéaire » (imaginez un petit détecteur spécialisé) et ont observé les ondes cérébrales internes du modèle.
Étonnamment, ce détecteur pouvait encore lire les bonnes réponses parfaitement, même si le modèle lui-même agissait comme s'il ne savait rien. C'est comme un étudiant qui prétend être confus et donne des réponses aléatoires en classe, mais si vous regardez ses notes, les bonnes réponses y sont encore écrites en parfaite écriture. L'« oubli » n'était qu'un acte de surface ; la connaissance profonde était toujours là, attendant d'être trouvée.
Le Mot de la Fin
L'article conclut que tenter de faire oublier des compétences spécifiques à une IA en la ré-entraînant simplement sur des réponses aléatoires est un pari. Cela fonctionne pour certaines tâches (comme les puzzles logiques), mais échoue pour d'autres (comme la science et le sens commun). De plus, même quand cela semble fonctionner, l'information n'est pas réellement supprimée ; elle est juste cachée derrière une couche de confusion. Les chercheurs suggèrent que nous devons bien mieux comprendre comment ces modèles apprennent et stockent l'information avant de pouvoir faire oublier de manière fiable ce que nous ne voulons pas qu'ils sachent.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.