← Derniers articles
🤖 machine learning

ReCo: Reweighting GRPO Against Distributional Concentration

L'article présente ReCo, une méthode de repondération qui atténue la tendance de GRPO à se concentrer sur les réponses et les jetons à haute probabilité en normalisant les contributions des réponses et en remplaçant les rapports d'importance par une mise à l'échelle basée sur la variance, améliorant ainsi la performance Pass@k sur les benchmarks de raisonnement mathématique sans sacrifier la précision pour de petits k.

Auteurs originaux : Junoh Park, Junseo Hwang, Wonguk Cho, Taesup Kim

Publié 2026-07-30
📖 6 min de lecture🧠 Analyse approfondie

Auteurs originaux : Junoh Park, Junseo Hwang, Wonguk Cho, Taesup Kim

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez un monde où les ordinateurs ne se contentent pas de discuter, mais sont capables de réellement réfléchir à des énigmes complexes comme des problèmes mathématiques ou des défis de programmation. C'est la frontière de l'intelligence artificielle, et plus précisément un domaine appelé l'apprentissage par renforcement. Voyez cela comme l'entraînement d'un chien : vous ne lui dites pas simplement quoi faire ; vous le laissez essayer, et s'il s'assoit, vous lui donnez une friandise. S'il saute sur le canapé, vous ne lui en donnez pas. Avec le temps, le chien apprend à s'asseoir parce qu'il veut la friandise. Dans le monde de l'IA, nous donnons une « récompense » lorsque l'ordinateur résout un problème correctement.

Une méthode populaire pour entraîner ces « chiens » de l'IA s'appelle l'Optimisation de Politique Relative au Groupe, ou GRPO (Group Relative Policy Optimization). Imaginez que vous demandiez à l'IA de résoudre un problème mathématique dix fois. Elle génère dix réponses différentes. GRPO examine les dix, voit lesquelles ont reçu la « friandise » (étaient correctes) et pousse l'IA à ressembler davantage à celles qui ont réussi. C'est une astuce ingénieuse qui a considérablement amélioré le raisonnement de l'IA. Mais il y a un piège : parfois, dans son empressement à obtenir la friandise, l'IA devient trop confiante et cesse de tester de nouvelles choses. Elle commence à répéter les mêmes quelques astuces encore et encore, ignorant d'autres méthodes astucieuses pour résoudre le problème qui pourraient fonctionner tout aussi bien.

C'est le casse-tête que une équipe de chercheurs de l'Université Nationale de Séoul a décidé de résoudre. Ils ont remarqué que si la GRPO rend l'IA plus intelligente pour résoudre des problèmes rapidement, elle la rend en réalité moins créative et moins susceptible de trouver la bonne réponse si vous lui donnez de nombreuses chances d'essayer. Ils ont appelé ce problème « concentration distributionnelle » — une façon sophistiquée de dire que l'IA s'enferme dans une routine, n'explorant que les chemins qu'elle sait déjà être sûrs.

Pour corriger cela, l'équipe a inventé une nouvelle méthode appelée ReCo (Reweighting GRPO Against Distributional Concentration). Voici comment cela fonctionne, en utilisant une analogie simple :

Imaginez que vous êtes un enseignant corrigeant une classe d'élèves qui essaient tous de résoudre le même problème de mathématiques difficile.

  • L'ancienne méthode (GRPO) : Vous demandez à la classe d'écrire leurs réponses. Si cinq élèves écrivent exactement la même solution (parce que c'est la plus populaire), vous accordez énormément d'attention à cette solution. Vous dites à toute la classe : « Regardez ! Cinq personnes ont fait cela ! Tout le monde devrait faire cela ! » Pendant ce temps, l'élève qui a tenté une méthode étrange et créative qui a également fonctionné est ignoré parce qu'il était seul. La classe cesse de tester de nouvelles choses et se contente de copier la réponse populaire.
  • La nouvelle méthode (ReCo) : L'enseignant (ReCo) remarque ce biais. D'abord, il réalise que si cinq élèves ont écrit la même réponse, c'est probablement parce que cette réponse était facile à trouver, et non parce qu'elle est forcément la seule bonne réponse. Il déclasse donc l'importance de cette réponse populaire. Il dit : « D'accord, vous êtes cinq à avoir trouvé cela, mais comme c'était très commun, cela compte moins qu'une solution unique. » Cela empêche la classe de copier aveuglément la foule.
  • Le second tour de force : L'enseignant regarde également comment les élèves réfléchissent. Si un élève est sûr à 99 % d'une étape spécifique de son calcul, l'enseignant dit : « Très bien, tu es confiant, mais ne deviens pas trop arrogant ! Il y a toujours une infime chance que tu te trompes, alors gardons ton esprit ouvert à d'autres possibilités. » Mais si un élève est coincé à un carrefour où il n'est pas sûr du chemin à prendre, l'enseignant lui donne un grand coup de pouce d'encouragement pour explorer cette incertitude. Cela empêche les élèves de s'enfermer prématurément dans une manière de penser unique et rigide.

En utilisant ces deux astuces, ReCo modifie la façon dont l'IA apprend. Elle empêche l'IA de simplement mémoriser les réponses « sûres » et la force à continuer d'explorer différents chemins.

Les chercheurs ont testé cette nouvelle méthode sur des concours de mathématiques très difficiles, comme l'AIME (American Invitational Mathematics Examination) et des problèmes d'Olympiades. Ils ont utilisé différents modèles d'IA, incluant ceux basés sur Qwen et Llama. Les résultats étaient prometteurs. Lorsque l'on demandait à l'IA d'essayer seulement quelques fois, la ReCo performait aussi bien que l'ancienne méthode. Mais lorsqu'on lui donnait beaucoup de chances d'essayer (comme demander de générer 64 réponses différentes et de choisir la meilleure), la ReCo excellait. Elle trouvait des réponses correctes que l'ancienne méthode avait complètement manquées.

En fait, sur certains des tests les plus difficiles, l'ancienne méthode (GRPO) devenait en réalité moins performante que l'IA originale, non entraînée, lorsqu'on lui donnait de nombreuses tentatives, car elle était devenue si étroite d'esprit. La ReCo, cependant, a gardé l'« esprit » de l'IA ouvert. Elle a préservé la capacité de trouver des solutions diverses, garantissant que même si les premières tentatives échouent, l'IA dispose d'une boîte à outils complète de stratégies différentes pour rebondir.

L'équipe a également examiné pourquoi cela s'était produit. Ils ont constaté que sous l'ancienne méthode, le « processus de pensée » de l'IA devenait très répétitif, comme un disque rayé jouant la même chanson. Sous la ReCo, l'IA continuait de générer des approches uniques et variées, même en résolvant le même problème. C'était comme regarder un élève qui, au lieu de simplement copier le manuel, commence à dessiner des diagrammes, utiliser différentes formules et même construire des modèles physiques pour comprendre le concept.

En résumé, la ReCo suggère que pour rendre l'IA véritablement intelligente, nous ne devons pas seulement la récompenser pour obtenir la bonne réponse rapidement. Nous devons aussi la récompenser pour ne pas s'enfermer dans une routine. En poussant doucement l'IA à valoriser la variété et l'incertitude, les chercheurs ont trouvé un moyen de garder ces cerveaux numériques curieux, créatifs et capables de résoudre des problèmes de manières que nous ne pourrions pas attendre. C'est un rappel que, parfois, la meilleure façon d'apprendre est de garder ses options ouvertes.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →