← Derniers articles
🔬 condensed matter

Natural Ungrokking: Asymmetric Control of Which Rules Survive Pretraining

Cet article introduit le « dé-grokking naturel », un phénomène par lequel les modèles de langage apprennent spontanément puis oublient brusquement des règles spécifiques durant le pré-entraînement parce que la fréquence des preuves soutenant une règle dans le corpus d'entraînement détermine sa survie, un processus caractérisé par un contrôle asymétrique où détruire une règle est facile mais la restaurer est impossible.

Auteurs originaux : Juliana Li, Diya Sreedhar

Publié 2026-06-25
📖 6 min de lecture🧠 Analyse approfondie

Auteurs originaux : Juliana Li, Diya Sreedhar

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

L'idée principale : Apprendre une règle, puis l'oublier

Imaginez que vous enseignez à un très jeune enfant (le modèle d'IA) comment parler en lui lisant une bibliothèque massive de livres (les données d'entraînement).

Au milieu de ce processus, l'enfant comprend soudainement une règle de grammaire spécifique : « Si une phrase mentionne le nom d'une fille (comme "Sue"), le pronom suivant doit être "elle" ». L'enfant devient très doué pour cela. Si vous lui demandez : « Sue a pleuré parce que... », il répondra avec assurance « elle ».

Mais ensuite, quelque chose d'étrange se produit. Tandis que l'enfant continue de lire des livres, il oublie complètement cette règle. À la fin de l'entraînement, si vous posez la même question, il devine « il » (ce qui est ce que la foule en général dit, même si c'est faux pour une fille).

Le papier appelle cela le « Natural Ungrokking » (le dé-compréhension naturelle). C'est l'opposé du « Grokking » (où un modèle comprend soudainement quelque chose). Ici, le modèle apprend une règle, l'utilise pendant un certain temps, puis l'abandonne silencieusement, même si les livres qu'il lit contiennent toujours la règle.

Le mystère : Pourquoi a-t-il oublié ?

Habituellement, lorsqu'un modèle informatique oublie quelque chose, c'est parce que les données ont changé ou ont disparu. Mais dans cette expérience, les données n'ont jamais changé. La règle était toujours présente dans les livres tout au long du processus.

Les chercheurs ont découvert que le facteur décisif est la fréquence (la fréquence à laquelle quelque chose se produit).

  • La Règle : « Sue » \rightarrow « elle ».
  • Le Compétiteur : Une habitude générale dans le langage où les gens utilisent souvent « il » comme réponse par défaut.

Dans la bibliothèque spécifique que le modèle lisait, l'habitude du « il » apparaissait beaucoup plus souvent que la règle « Sue \rightarrow elle ». Même si la règle était là, l'habitude du « il » était si forte et fréquente qu'elle a étouffé la règle. Le modèle n'a pas « effacé » la règle ; il a simplement arrêté de l'écouter parce que l'habitude du « il » gagnait la compétition.

L'expérience : Une rue à sens unique

Les chercheurs voulaient voir s'ils pouvaient contrôler cela. Ils ont traité les données d'entraînement comme un cadran qu'ils pouvaient tourner.

1. Le bouton « Kill » (Facile à détruire)
Ils ont pris une bibliothèque où la règle était forte et ont commencé à inverser les données. Ils ont transformé chaque instance de « Sue... elle » en « Sue... il ».

  • Résultat : Plus ils inversaient les données, plus le modèle oubliait la règle rapidement. C'était une glissade fluide et prévisible de « parfait » vers « zéro ».
  • Analogie : Si vous dites constamment à un élève : « Non, la réponse est X », même quand le livre dit « Y », l'élève finira par ne plus croire le livre et commencera à vous croire.

2. Le bouton « Rescue » (Impossible à restaurer)
Ensuite, ils ont tenté l'inverse. Ils ont pris un modèle qui avait déjà oublié la règle (parce qu'il lisait la bibliothèque riche en « il ») et ont tenté de le « sauver ». Ils ont injecté des quantités massives d'exemples « Sue... elle » dans les données — 300 fois plus que ce qui était nécessaire pour maintenir la règle en vie au départ.

  • Résultat : Rien ne s'est passé. Le modèle a toujours oublié la règle.
  • L'analogie : Imaginez un élève qui a déjà appris que « 2+2=5 » parce que son professeur le lui a dit pendant un an. Si vous lui donnez soudainement une pile de 1 000 manuels scolaires disant « 2+2=4 », il sera peut-être confus, mais il n'apprendra pas l'habitude « 2+2=5 ». Le mal est fait ; la « voie » dans son cerveau a été pavée par ailleurs.

Le « Pourquoi » : C'est un déplacement, pas une effacement

Les chercheurs ont regardé à l'intérieur du « cerveau » du modèle (ses mathématiques internes) pour voir ce qui se passait.

  • Ils ont découvert que le modèle n'avait pas perdu la capacité de comprendre la structure de la phrase. Il savait toujours comment traiter les mots.
  • Au lieu de cela, la confiance interne a basculé. Le « vote » interne du modèle pour « elle » a été surclassé par un « vote » plus fort pour « il ».
  • C'est comme un tribunal. La preuve pour « elle » était toujours là, mais la preuve pour « il » est devenue si bruyante que le juge (le modèle) a cessé d'écouter le témoin de « elle ».

Ce qu'il faut retenir

Ce papier nous enseigne trois choses principales sur la façon dont l'IA apprend :

  1. Les compétences acquises en cours d'entraînement sont fragiles : Ce n'est pas parce qu'un modèle apprend une règle à la moitié de son entraînement qu'il la conservera.
  2. La fréquence règne en maître : Si une règle est rare dans les données, elle sera probablement écrasée par un motif concurrent plus commun, même si la règle est toujours présente.
  3. On peut le briser facilement, mais on ne peut pas le réparer facilement : Une fois qu'un modèle a « dé-compris » une règle à cause du mélange de données, simplement réinjecter la règle plus tard ne fonctionne souvent pas. L'oubli est permanent pour ce cycle d'entraînement spécifique.

En bref : Les modèles d'IA sont comme des étudiants qui écoutent la voix la plus forte dans la pièce. Si la « mauvaise » voix est plus forte que la « bonne » règle, l'étudiant apprend la mauvaise chose. Et une fois qu'ils ont appris la mauvaise chose, leur crier la bonne règle plus tard ne sert souvent à rien.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →