← Derniers articles
🤖 machine learning

Beyond Reasoning Gains: Mitigating General-Capability Forgetting in Large Reasoning Models

Cet article présente RECAP, une stratégie de relecture de bout en bout avec un repondérage dynamique des objectifs qui atténue efficacement l'oubli des capacités générales dans les grands modèles de raisonnement entraînés par apprentissage par renforcement, tout en améliorant simultanément les performances de raisonnement grâce à des compromis de récompense flexibles.

Auteurs originaux : Hoang Phan, Xianjun Yang, Yuanshun Yao, Jingyu Zhang, Shengjie Bi, Xiaocheng Tang, Madian Khabsa, Lijuan Liu, Deren Lei

Publié 2026-06-19
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Hoang Phan, Xianjun Yang, Yuanshun Yao, Jingyu Zhang, Shengjie Bi, Xiaocheng Tang, Madian Khabsa, Lijuan Liu, Deren Lei

Article original placé dans le domaine public sous CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Le gros problème : Le piège du « Spécialiste »

Imaginez que vous engagiez un chef cuisinier brillant et polyvalent, capable de tout cuisiner : il peut préparer un gâteau parfait, couper des légumes avec précision et même réparer un robinet qui fuit dans la cuisine (une métaphore pour la capacité d'un modèle à gérer les mathématiques, la vision et la culture générale).

Ensuite, vous décidez de former ce chef spécifiquement pour gagner un concours de dégustation de tartes à enjeux élevés. Vous le placez dans une pièce avec uniquement des recettes de tartes et des règles strictes sur la façon de tenir sa fourchette.

Que se passe-t-il ?
Après quelques semaines d'entraînement intensif, le chef devient un dégustateur de tartes de classe mondiale. Il suit parfaitement les règles de la fourchette. Cependant, parce qu'il a passé tout son temps à pratiquer la tarte, il commence à oublier comment couper des légumes ou réparer un robinet. Si vous lui demandez de couper un oignon, il pourrait rester de marbre ou essayer de le manger entier.

Dans le monde de l'IA, c'est exactement ce qui se passe. Les chercheurs utilisent une technique appelée RLVR (Apprentissage par renforcement avec récompenses vérifiables) pour apprendre aux grands modèles de langage (LLM) comment « raisonner » (résoudre des problèmes mathématiques, suivre une logique complexe). Bien que les modèles deviennent incroyables en raisonnement, ils commencent à oublier leurs autres compétences, comme reconnaître des objets sur une image, lire du texte dans une image ou rester sûrs et honnêtes.

La solution du papier : « RECAP »

Les auteurs proposent une nouvelle méthode appelée RECAP (Replay-Enhanced CApability Preservation). Voyez RECAP comme un programme d'entraînement intelligent pour ce chef.

Au lieu de simplement nourrir le chef de recettes de tartes toute la journée, RECAP fait deux choses :

  1. Rejoue les bases : Il ramène occasionnellement les anciennes recettes de « découpe de légumes » et de « réparation de robinet » pour que le chef ne les oublie pas.
  2. Pondération dynamique : Il agit comme un coach intelligent qui observe les progrès du chef en temps réel.

Comment fonctionne le « Coach Intelligent » (L'analogie)

Imaginez que le chef s'entraîne sur trois choses à la fois :

  • La règle de la fourchette (Format) : Comment tenir la fourchette.
  • Le Goût (Précision) : Est-ce que la tarte est bonne ?
  • Le Nettoyage (Compétences générales) : Garder la cuisine propre.

Dans une session d'entraînement normale, le coach pourrait dire : « Pratique les trois de manière égale ! ». Mais c'est inefficace.

  • La règle de la fourchette est facile. Le chef la maîtrise en 5 minutes. Si le coach continue de le faire pratiquer pendant une heure, c'est une perte de temps.
  • Le Goût est difficile. Le chef éprouve des difficultés.
  • Le Nettoyage devient désordonné parce que le chef est distrait.

Le coach de RECAP analyse les données et dit :

« Hé, le chef a déjà maîtrisé la règle de la fourchette. Arrêtons de nous concentrer dessus (diminuez le poids). Passons plus de temps sur le Goût et le Nettoyage, car ce sont les points où il rencontre encore des difficultés ou bien l'instabilité. »

RECAP détecte automatiquement quelles compétences sont « saturées » (déjà apprises) et lesquelles sont « volatiles » (en difficulté ou changeant rapidement). Il déplace l'attention de l'entraînement vers les compétences en difficulté afin que le modèle ne sur-apprenne pas les choses faciles tout en oubliant les choses difficiles.

Ce qu'ils ont trouvé (Les résultats)

Les chercheurs ont testé cela sur des modèles d'IA puissants (spécifiquement la famille Qwen2.5-VL). Voici ce qu'ils ont découvert :

  1. L'oubli est réel : Lorsqu'ils ont entraîné les modèles uniquement sur des tâches de raisonnement, les modèles sont devenus meilleurs en mathématiques mais sont devenus nettement moins performants pour des tâches comme la lecture de texte dans des images ou la reconnaissance d'objis.
  2. RECAP sauve la mise : En utilisant leur programme dynamique, les modèles ont maintenu un haut niveau de raisonnement (et l'ont même parfois amélioré) mais n'ont pas perdu leurs compétences générales. En fait, ils ont souvent obtenu de meilleurs résultats sur les tâches générales que les modèles entraînés avec les méthodes standards.
  3. Efficacité : Les modèles entraînés avec RECAP ne sont pas seulement devenus plus intelligents ; ils sont aussi devenus plus efficaces. Ils ont commencé à donner des réponses plus courtes et directes au lieu de discourir longuement, car le système a cessé de les forcer à « réfléchir » (écrire de longues chaînes de texte) pour des tâches qui n'en avaient pas besoin.

Ce qu'il faut retenir

Le papier soutient que nous ne devrions pas simplement forcer les modèles d'IA à devenir des « machines à raisonner » en ignorant tout le reste. Si nous le faisons, ils deviennent des spécialistes d'un seul tour et oublient comment être utiles dans le monde réel.

RECAP est un outil simple, une sorte de module complémentaire, qui agit comme un régime équilibré pour l'entraînement de l'IA. Il garantit que, pendant que le modèle apprend à résoudre des énigmes complexes, il n'oublie pas comment voir, lire et comprendre le monde qui l'entoure. Il s'agit de garder l'IA polyvalente tout en faisant d'elle un génie dans son domaine.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →