← Derniers articles
💬 NLP

Sharpness-Aware Pretraining Mitigates Catastrophic Forgetting

Ce papier démontre que biaiser l'optimisation du préentraînement vers des minima plus plats, grâce à des méthodes telles que la minimisation de la netteté (Sharpness-Aware Minimization), des taux d'apprentissage élevés ou des périodes d'atténuation raccourcies, atténue considérablement l'oubli catastrophique et améliore les performances en aval à travers diverses tailles de modèles et tâches post-entraînement.

Auteurs originaux : Ishaan Watts, Catherine Li, Sachin Goyal, Jacob Mitchell Springer, Aditi Raghunathan

Publié 2026-05-06
📖 4 min de lecture☕ Lecture pause café

Auteurs originaux : Ishaan Watts, Catherine Li, Sachin Goyal, Jacob Mitchell Springer, Aditi Raghunathan

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous formiez un chef étoilé (le modèle d'IA) en le faisant goûter à des millions de plats différents (pré-entraînement). L'objectif est de faire de lui le meilleur chef possible avant de l'envoyer travailler dans une cuisine de restaurant spécifique (post-entraînement/affinage).

Pendant longtemps, les chercheurs ont pensé que la seule chose qui comptait était de faire goûter au chef le meilleur pendant cette phase de formation initiale. Ils supposaient que si le chef commençait comme un « généraliste » parfait, il deviendrait automatiquement un grand spécialiste plus tard, peu importe les changements survenant dans la cuisine.

Le Problème : Le Chef « Rigide »
Ce papier soutient que cette hypothèse est fausse. Il s'avère que certains chefs sont formés à être si rigoureusement parfaits dans le goût général qu'ils se brisent facilement lorsqu'on leur demande de faire quelque chose de nouveau.

Pensez-y comme à une balle posée dans une vallée.

  • L'Approche Standard (AdamW) : Cela entraîne le chef à s'asseoir dans une vallée très profonde, étroite et pointue. Il est très bon pour rester exactement là où il est. Mais si vous le poussez légèrement (comme lui demander d'apprendre une nouvelle recette ou de comprimer sa mémoire pour qu'elle tienne dans une poche plus petite), il roule immédiatement hors de la vallée. Il « oublie » tout ce qu'il savait.
  • La Solution du Papier (Sensible à la Pointe) : Cela entraîne le chef à s'asseoir dans une vallée large et plate. Il n'est peut-être pas au point le plus profond de la vallée, mais il est entouré de terrain plat. Si vous le poussez, il ne tombe pas ; il roule juste un peu et reste en sécurité. Il est « robuste ».

Ce que les Chercheurs Ont Fait
L'équipe a testé trois façons d'entraîner ces chefs de « vallée plate » plutôt que des chefs de « vallée pointue » :

  1. La Méthode « Secousse » (SAM) : Ils ont utilisé une technique spéciale appelée Minimisation Sensible à la Pointe. Imaginez que pendant que le chef apprend, vous secouez doucement la table. Si le chef peut toujours goûter correctement la nourriture pendant que la table tremble, il apprend à être stable. Cela force le modèle à trouver ces vallées larges et plates.
  2. La Méthode « Voie Rapide » (Taux d'Apprentissage Élevés) : Ils ont fait apprendre au chef plus vite et plus agressivement au début. C'est comme courir une course ; si vous courez assez vite, vous évitez naturellement de rester coincé dans de petits trous profonds sur la route.
  3. La Méthode « Arrêt Rapide » (Recuit Plus Court) : Habituellement, l'entraînement se termine en ralentissant lentement le chef. Les chercheurs ont constaté que d'arrêter ce ralentissement tôt (en maintenant le rythme plus longtemps) aidait le chef à rester dans cette zone stable et plate.

Les Résultats
Ils ont testé cela sur des modèles de différentes tailles (du petit au moyen-grand) et ont constaté :

  • Moins d'Oubli : Lorsque ces modèles de « vallée plate » ont ensuite été invités à apprendre des tâches spécifiques (comme les mathématiques ou la programmation) ou que leur mémoire a été compressée (quantification) pour fonctionner plus vite, ils ont oublié beaucoup moins de leurs connaissances originales.
  • Le « Hack » « Mi-Entraînement » : Vous n'avez pas besoin d'utiliser cette méthode spéciale de « secousse » pendant tout le processus d'entraînement, ce qui est coûteux. Ils ont constaté que l'utiliser seulement pour les 10 % derniers de l'entraînement (la phase de « recuit ») apportait presque tous les avantages pour une fraction minuscule du coût.
  • Preuve du Monde Réel : Ils ont testé cela sur un grand modèle de 1 milliard de paramètres (OLMo-2-1B). Même si le modèle entraîné avec cette méthode commençait légèrement « plus faible » sur les tâches générales, il est devenu 31 % meilleur pour se souvenir de ses compétences après avoir appris les mathématiques, et 40 % meilleur pour conserver ses compétences après avoir été compressé pour l'efficacité.

La Grande Conclusion
Le papier conclut que nous ne devrions pas seulement entraîner l'IA à être la « meilleure » au départ. Nous devrions l'entraîner à être flexible et stable afin qu'elle ne se brise pas lorsque nous changeons son environnement plus tard.

C'est la différence entre entraîner un gymnaste à maintenir une pose parfaite et rigide (qui se brise si le sol penche) et l'entraîner à avoir un centre de gravité fort et équilibré (qui lui permet de s'adapter à n'importe quel nouveau mouvement sans tomber). En nous concentrant sur cet « équilibre » (platitude) plutôt que simplement sur la « perfection » (pointe), nous obtenons des modèles d'IA beaucoup meilleurs pour apprendre de nouvelles choses sans oublier les anciennes.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →