← Derniers articles
🤖 machine learning

Verifier-Induced Support Reshaping in On-Policy Optimization

Cet article révèle que l'apprentissage par renforcement on-policy avec des récompenses vérifiables (RLVR) peut améliorer la performance immédiate des tâches tout en provoquant par inadvertance un « remodelage du support induit par le vérificateur », où la politique rétrécit sa distribution de sortie pour rendre les trajectoires réussies pour des objectifs futurs trop rares pour être échantillonnées, compromettant ainsi la capacité d'entraînement à long terme et la capacité conjointe.

Auteurs originaux : Shaohang Wei, Zikun Su, Feifan Song, Wen Luo, Wei Li, Guangyue Peng, Houfeng Wang

Publié 2026-08-04
📖 7 min de lecture🧠 Analyse approfondie

Auteurs originaux : Shaohang Wei, Zikun Su, Feifan Song, Wen Luo, Wei Li, Guangyue Peng, Houfeng Wang

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous enseigniez à un robot super intelligent comment devenir un assistant utile. Vous ne voulez pas seulement qu'il connaisse des faits ; vous voulez qu'il suive des règles, résolve des problèmes mathématiques complexes et écrive du code. Pour ce faire, les scientifiques utilisent une méthode appelée « apprentissage par renforcement », qui est comme un jeu où le robot essaie différentes réponses, reçoit un score de la part d'un « vérificateur » (un juge strict) et apprend à répéter les mouvements qui ont obtenu un score élevé. Le grand espoir est que nous puissions enseigner au robot une compétence après l'autre — d'abord les mathématiques, puis l'écriture, puis le codage — sans qu'il n'oublie ce qu'il sait déjà ou qu'il ne s'embrouille. C'est le rêve de l'« apprentissage continu » : construire un robot qui s'améliore de plus en plus dans tout, étape par étape. Mais et si l'acte même d'enseigner au robot comment être parfait dans une chose finissait par verrouiller la porte de l'apprentissage de la suivante ? Et si le robot apprenait à être si bon pour suivre des instructions qu'il oubliait comment réfléchir étape par étape, ou vice versa ?

Ce document étudie un problème sournois appelé « remodelage du support induit par le vérificateur » (verifier-induced support reshaping). Les chercheurs ont découvert que lorsqu'on entraîne une IA à être excellente dans une tâche spécifique à l'aide d'un juge strict, l'IA ne se contente pas de s'améliorer dans cette tâche ; elle change réellement sa personnalité d'une manière qui rend l'apprentissage d'autres tâches beaucoup plus difficile plus tard. C'est comme si vous entraîniez un chien à s'asseoir uniquement quand vous dites « Assis », et qu'en faisant cela, vous lui aviez accidentellement appris que « Assis » est le seul mot qui compte. Plus tard, quand vous essaierez de lui apprendre à « Rester », il pourrait être confus parce que son cerveau a été remodelé pour ignorer tout le reste. L'article montre qu'il ne s'agit pas seulement de l'oubli des anciennes astuces (un problème connu sous le nom d'« oubli catastrophique ») ; il s'agit du fait que l'IA rend les réponses de type « correct » si rares que le processus d'apprentissage ne peut plus les trouver. Même si le robot possède toujours la capacité de résoudre un problème mathématique, il pourrait cesser d'essayer de le résoudre de la bonne manière parce qu'il s'est habitué à un style de réponse différent.

Les chercheurs ont testé cela en entraînant deux types de modèles d'IA sur deux tâches très différentes : résoudre des problèmes mathématiques et suivre des instructions d'écriture strictes (comme « écrivez exactement 50 mots » ou « utilisez des puces »). Ils ont entraîné un groupe pour être des génies des mathématiques et un autre pour être des pros du respect des instructions. Ensuite, ils ont inversé les juges pour voir ce qui se passerait.

Voici ce qu'ils ont découvert :

Le piège Mathématiques-vers-Instructions
Lorsqu'ils ont d'abord entraîné l'IA pour être un génie des mathématiques, celle-ci est devenue meilleure pour suivre les instructions en moyenne. Cependant, quelque chose d'étrange s'est produit : l'IA est devenue très « polarisée ». Elle réussissait soit parfaitement l'instruction, soit la ratait complètement, avec très peu de tentatives de « juste milieu ». Auparavant, l'IA pouvait essayer de nombreuses façons de répondre, certaines étant proches de la solution. Après l'entraînement mathématique, elle a cessé d'essayer ces chemins intermédiaires. Cela signifie que si vous essayiez de générer de nombreuses réponses (comme demander à l'IA d'essayer 32 fois), vous auriez moins de chances de trouver une seule réponse réussie pour la tâche d'instruction. L'entraînement mathématique avait tellement réduit le champ de vision de l'IA qu'elle a cessé d'explorer le « support » (la variété des tentatives) nécessaire pour apprendre de nouvelles astuces de suivi d'instructions.

Le piège Instructions-vers-Mathématiques
L'inverse était encore plus intéressant. Lorsqu'ils ont d'abord entraîné l'IA à suivre des instructions, elle a commencé à changer sa façon de répondre aux problèmes mathématiques. Au lieu de montrer son raisonnement étape par étape (comme « D'abord, j'ajoute 2 et 2... »), l'IA a commencé à sauter directement à la réponse (« La réponse est 4 »). Les chercheurs appellent cela un passage du « Raisonnement Délibéré par Initiation » (DRI - Deliberate Reasoning Initiation) à une « Initiation par Réponse Directe » (DAI - Direct Answer Initiation).
Ce changement était crucial. En commençant à sauter les étapes, l'IA rendait la recherche de la bonne réponse beaucoup plus difficile, même si l'IA connaissait toujours les mathématiques. En fait, plus l'IA sautait vers des réponses directes, plus son taux de réussite diminuait lorsque l'on tentait de générer plusieurs tentatives. Le « support » pour trouver la bonne réponse mathématique s'était réduit.

Le secret du « Premier Token »
Les chercheurs ont creusé plus loin pour comprendre pourquoi cela se produisait. Ils ont découvert que le changement ne concernait pas l'oubli par l'IA de la façon de faire des mathématiques plus loin dans la phrase. Le changement se produisait dès le tout premier mot tapé par l'IA !
Il s'avère que le « juge » (vérificateur) pour les mathématiques encourage l'IA à commencer par des mots comme « D'accord » ou « Voyons procéder par étapes », tandis que le juge pour les instructions encourage à commencer par « Réponse » ou « Voici ». Une fois que l'IA a appris à commencer par « Réponse », elle se retrouve verrouillée sur un chemin où elle saute les étapes de raisonnement. Les chercheurs ont prouvé cela en forçant l'IA à commencer par les mots de « mathématiques » même lorsqu'elle avait été entraînée à suivre des instructions. En faisant cela, la capacité de l'IA à trouver des solutions mathématiques s'est miraculeusement améliorée. Cela suggère que l'IA n'a pas perdu son « cerveau mathématique » ; elle est juste restée coincée dans une mauvaise habitude de « premier mouvement ».

Peut-on réparer cela ?
L'équipe a tenté de corriger ce problème. Ils ont essayé de « pré-entraîner » l'IA pour qu'elle commence toujours par les bons mots (un « DRI prior »), mais cela n'a fait que retarder le problème ; l'IA a fini par basculer vers le style de réponse directe. Ils ont également essayé une technique de « distillation on-policy », où une IA étudiante tente de copier une IA enseignante. Mais cela n'a fonctionné que s'ils choisissaient l'enseignante très soigneusement ; si l'enseignante avait déjà appris la « mauvaise » habitude, l'étudiante la copiait aussi.

L'essentiel à retenir
L'article conclut que le simple fait de rendre une IA meilleure dans une tâche ne garantit pas qu'elle sera prête à apprendre la suivante. En fait, les progrès dans un domaine peuvent parfois rendre l'espace de recherche de l'autre domaine si étroit que l'IA ne peut plus trouver les bonnes réponses. Les gains en mathématiques ou en suivi d'instructions ne se traduisent pas toujours par des réponses qui sont à la fois correctes et respectent les règles. C'est un avertissement pour les développeurs d'IA : le fait qu'un modèle obtienne un score élevé à un test aujourd'hui ne signifie pas qu'il n'a pas verrouillé la porte de son apprentissage futur. Pour garder une IA flexible, nous devons nous assurer qu'elle conserve une grande variété de « premiers mouvements » disponibles, et pas seulement ceux qui obtiennent des scores élevés pour l'instant.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →