← Derniers articles
💬 NLP

Constrained Group Relative Policy Optimization

Ce document introduit le Constrained GRPO, une extension basée sur la méthode lagrangienne de l'optimisation de politique relative de groupe (Group Relative Policy Optimization) qui améliore le respect des contraintes et la stabilité de l'entraînement en scalarisant les avantages standardisés plutôt que les récompenses brutes afin d'éliminer les effets de couplage préjudiciables causés par la normalisation intra-groupe.

Auteurs originaux : Roger Girgis, Rodrigue de Schaetzen, Luke Rowe, Azalée Robitaille, Christopher Pal, Liam Paull

Publié 2026-09-03
📖 6 min de lecture🧠 Analyse approfondie

Auteurs originaux : Roger Girgis, Rodrigue de Schaetzen, Luke Rowe, Azalée Robitaille, Christopher Pal, Liam Paull

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Dans le monde en évolution rapide de l'intelligence artificielle, les chercheurs apprennent à de grands modèles informatiques à résoudre des problèmes complexes, allant de la navigation pour les voitures autonomes à la résolution d'énigmes mathématiques difficiles. Ces modèles apprennent par essais et erreurs, un processus connu sous le nom d'apprentissage par renforcement. Imaginez un étudiant essayant de résoudre un labyrinthe ; il reçoit une récompense pour avoir atteint la sortie et une pénalité pour avoir heurté un mur. Au fil du temps, l'étudiant apprend à maximiser les récompenses et à éviter les pénalités. Cependant, un défi majeur surgit lorsque nous voulons que le modèle suive des règles strictes, telles que « ne jamais heurter un piéton » ou « toujours utiliser une grammaire correcte », tout en essayant d'être utile. Si les règles sont trop rigides, le modèle peut devenir inutile ; si elles sont trop souples, il peut les transgresser. Pour résoudre cela, les scientifiques utilisent un cadre mathématique qui équilibre le désir de réussir avec la nécessité d'obéir aux contraintes, en ajustant l'importance de chaque règle au fur et à mesure que le modèle apprend.

Une méthode populaire pour enseigner ces modèles, appelée Optimisation de Politique Relative de Groupe (Group Relative Policy Optimization), est devenue une favorite car elle est efficace et ne nécessite pas de modèle « juge » séparé pour évaluer chaque étape. Au lieu de cela, elle compare un groupe de réponses générées pour la même question pour décider lesquelles sont meilleures. Bien que cette méthode fonctionne bien pour les tâches générales, les chercheurs ont découvert que l'appliquer à des règles de sécurité strictes était délicat. Dans une nouvelle étude, une équipe du Mila – Institut québécois d'intelligence artificielle et de l'École Polytechnique de Montréal a découvert que la manière standard de combiner différents objectifs en un seul score brisait en fait la capacité du système à suivre les règles. Ils ont introduit une nouvelle approche, l'Optimisation de Politique Relative de Groupe Contrainte (Constrained Group Relative Policy Optimization), qui corrige ce défaut et permet aux modèles d'apprendre des comportements complexes tout en respectant strictement les limites de sécurité.

Le problème central identifié par les chercheurs était la façon dont l'ordinateur gère plusieurs objectifs à la fois. Dans l'approche standard, le modèle prend toutes ses récompenses et pénalités, les mélange en un seul nombre, puis normalise ce nombre pour faciliter l'apprentissage. Les chercheurs ont montré que ce processus de mélange crée une interférence cachée. Lorsque l'ordinateur ajuste le poids d'une règle, il modifie involontairement l'importance relative de toutes les autres règles également. C'est comme essayer de régler le volume d'un instrument unique dans un orchestre en tournant un bouton qui déplace aussi l'équilibre de tout le groupe ; vous essayez peut-être de rendre les violons plus forts, mais ce faisant, vous rendez accidentellement les tambours trop faibles et les flûtes trop fortes. Cela rend très difficile pour le modèle de savoir exactement quelle règle suivre, provoquant souvent l'ignorance des contraintes de sécurité ou une instabilité pendant l'entraînement.

Pour corriger cela, les chercheurs ont changé l'ordre des opérations. Au lieu de mélanger les récompenses et les pénalités d'abord, ils laissent le modèle calculer la valeur de chaque règle séparément et les normaliser individuellement. Ce n'est qu'après que chaque règle a été traitée équitablement sur sa propre base qu'ils les combinent en utilisant les poids appris. Ce simple changement élimine l'interférence cachée. En gardant les signaux séparés jusqu'à la toute fin, le modèle peut clairement voir à quel point il s'améliore sur chaque règle spécifique. Le résultat est un processus d'apprentissage beaucoup plus stable et prévisible. Les chercheurs ont testé cette nouvelle méthode dans trois environnements très différents : un jeu simple basé sur une grille où un agent doit éviter la lave et gérer une batterie, une simulation réaliste de conduite autonome avec des milliers de scénarios de trafic complexes, et une tâche de raisonnement mathématique impliquant des problèmes de mathématiques de niveau primaire.

Dans le jeu basé sur la grille, la nouvelle méthode a permis à l'agent d'apprendre de manière beaucoup plus fluide. L'approche standard a rendu l'agent excessivement prudent, évitant la lave de manière si agressive qu'il bougeait à peine, tandis que la nouvelle méthode a permis à l'agent d'utiliser efficacement son « budget » de risque, atteignant l'objectif tout en restant en sécurité. Dans la simulation de conduite autonome, la nouvelle approche a produit des conducteurs non seulement plus sûrs, mais aussi plus efficaces pour terminer leurs itinéraires. Les modèles entraînés avec la nouvelle méthode ont obtenu des scores plus élevés en matière de conformité de sécurité et de progression d'itinéraire par rapport aux méthodes précédentes qui mélangeaient les signaux d'abord. Ils ont réussi à éviter les collisions et à respecter les lois de la circulation sans sacrifier leur capacité à avancer, un équilibre que les autres méthodes peinaient à maintenir.

Le test final consistait à enseigner à un modèle de langage à résoudre des problèmes mathématiques tout en s'assurant que les réponses soient courtes, formatées correctement et contiennent des nombres valides. Ici, la nouvelle méthode s'est de nouveau montrée supérieure. Les modèles entraînés avec l'approche de mélange standard sacrifiaient souvent l'exactitude pour rendre leurs réponses plus courtes ou pour respecter un format spécifique. En revanche, la nouvelle méthode a permis au modèle de prioriser l'exactitude mathématique, tout en maintenant des normes élevées pour le formatage et la longueur. À travers différentes tailles de modèles informatiques, des plus petits avec 1,5 milliard de paramètres aux plus grands avec 7 milliards, la nouvelle approche a produit de manière constante des résultats plus précis sans nécessiter de composants d'entraînement supplémentaires coûteux.

Les conclusions suggèrent que la façon dont nous combinons différents signaux d'apprentissage est aussi importante que les signaux eux-mêmes. En changeant simplement l'ordre dans lequel l'ordinateur traite ses récompenses et ses règles, les chercheurs ont pu créer un système qui respecte les contraintes de manière beaucoup plus fiable. Ce travail n'offre pas seulement une petite amélioration ; il fournit une voie plus claire pour entraîner l'intelligence artificielle à opérer en toute sécurité dans le monde réel, où suivre les règles est souvent aussi important que d'atteindre l'objectif. L'étude confirme que lorsque nous voulons que l'IA soit à la fois capable et sûre, nous devons faire attention à ce que la façon dont nous mesurons le succès ne confonde pas le modèle sur ce qu'il est réellement censé faire.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →