Complementing reinforcement learning with SFT through logit averaging in the post training of LLMs
Ce papier présente une nouvelle méthode d'après-entraînement pour les grands modèles de langage qui améliore l'optimisation de politique relative de groupe (GRPO) en moyennant les logits d'une politique de référence SFT figée et d'une politique entraînable, éliminant ainsi le besoin de régularisation KL ou d'un critique tout en combinant efficacement les capacités de raisonnement du RL avec la stabilité de formatage du SFT.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
La Vue d'Ensemble : Deux Enseignants, Un Élève
Imaginez que vous entraînez un grand modèle de langage (une IA) à résoudre des problèmes de mathématiques. Vous avez deux « enseignants » distincts qui tentent de l'enseigner :
- L'Enseignant de la Mise en Forme (SFT) : Cet enseignant est excellent pour apprendre à l'IA comment rédiger des réponses soignées, utiliser les bons symboles et suivre des règles strictes (comme encadrer la réponse finale). Cependant, cet enseignant commet parfois des erreurs dans la logique mathématique elle-même.
- L'Enseignant du Raisonnement (RL) : Cet enseignant est un génie des mathématiques capable de résoudre parfaitement des équations complexes. Mais, cet enseignant est désordonné ; il oublie souvent d'encadrer la réponse, saute des étapes ou écrit dans un format étrange qui ne correspond pas à ce que l'examen exige.
Le Problème :
Traditionnellement, lorsque vous essayez de combiner ces deux-là, vous utilisez une méthode appelée « Régularisation KL ». Imaginez cela comme un élastique reliant l'Enseignant du Raisonnement à l'Enseignant de la Mise en Forme. L'élastique force l'Enseignant du Raisonnement à rester proche du style de l'Enseignant de la Mise en Forme.
- L'Écueil : Si l'Enseignant de la Mise en Forme fait une erreur de calcul, l'élastique entraîne l'Enseignant du Raisonnement dans la même erreur. L'IA reste coincée en essayant d'être « soignée » mais échoue à être « intelligente ».
La Nouvelle Solution : La Moyenne des Logits
Les auteurs de ce document proposent une nouvelle façon de combiner ces enseignants. Au lieu de les lier ensemble avec un élastique, ils créent une Voix Mélangée.
Imaginez que l'IA est un chœur. Au lieu de forcer les chanteurs à rester en parfaite unisson (ce qui limite leur étendue), la nouvelle méthode mélange leurs voix avant qu'ils ne chantent.
- Si l'Enseignant de la Mise en Forme dit : « Encadre la réponse », et que l'Enseignant du Raisonnement dit : « La réponse est 5 », la Voix Mélangée dit : « Encadre la réponse : 5 ».
- Si l'Enseignant de la Mise en Forme fait une erreur de calcul (en disant que la réponse est 6), mais que l'Enseignant du Raisonnement sait qu'elle est 5, la Voix Mélangée s'appuie fortement sur les mathématiques de l'Enseignant du Raisonnement tout en conservant l'instruction de l'Enseignant de la Mise en Forme de « l'encadrer ».
Comment Cela Fonctionne (La Magie des « Logits »)
En termes d'IA, la « voix » du modèle est constituée de nombres appelés logits (qui représentent la probabilité que le modèle choisisse un mot ou un nombre spécifique ensuite).
- Le Mélange : Les chercheurs prennent les nombres de l'Enseignant de la Mise en Forme et de l'Enseignant du Raisonnement et les moyennent mathématiquement.
- Le Résultat : Cela crée une nouvelle « Stratégie Mélangée » temporaire.
- L'Entraînement : L'IA apprend en s'entraînant sur cette Stratégie Mélangée. Elle reçoit la récompense (des points) si la réponse finale est correcte.
- Parce que l'Enseignant de la Mise en Forme fait partie du mélange, l'IA n'oublie jamais comment écrire soigneusement.
- Parce que l'Enseignant du Raisonnement fait partie du mélange, l'IA est libre de corriger les erreurs de calcul de l'Enseignant de la Mise en Forme.
Pourquoi C'est Mieux (Le « Produit d'Experts »)
Le document utilise un concept appelé « Produit d'Experts ». Imaginez cela comme une décision de comité :
- Si Expert A (Mise en Forme) est sûr du style, et Expert B (Raisonnement) est sûr des mathématiques, la décision finale est forte sur les deux plans.
- Si Expert A se trompe sur les mathématiques, la confiance d'Expert B l'emporte, mais la confiance d'Expert A sur le style reste intacte.
Le document a constaté que cette approche de « Voix Mélangée » fonctionne mieux que l'ancienne méthode de « l'élastique ». L'IA a appris à résoudre correctement les problèmes de mathématiques et a conservé sa mise en forme soignée, alors que l'ancienne méthode faisait souvent oublier à l'IA comment formater correctement ou la laissait coincée dans les erreurs de calcul de l'Enseignant de la Mise en Forme.
Les Expériences
Les chercheurs ont testé cela sur trois différents « examens » (ensembles de données) :
- MATH : Problèmes de mathématiques difficiles.
- cn-k12 : Mathématiques du collège et du lycée chinois.
- MMLU : Connaissances générales et raisonnement.
Ils l'ont testé sur trois tailles différentes de modèles d'IA (petit, moyen et grand).
Les Résultats :
- Dans presque tous les cas, la nouvelle méthode de « Voix Mélangée » a obtenu des scores plus élevés que la méthode traditionnelle.
- Elle était particulièrement bonne pour résoudre un problème spécifique : la méthode traditionnelle faisait souvent « oublier » à l'IA comment formater les réponses alors qu'elle apprenait à résoudre des mathématiques plus difficiles. La nouvelle méthode a maintenu les compétences de mise en forme intactes tout en améliorant les compétences mathématiques.
Un Exemple Concret du Document
Le document donne un exemple spécifique d'un problème de géométrie :
- L'Enseignant de la Mise en Forme (SFT) : Met correctement en place l'équation mais fait une erreur de calcul, concluant que le rayon est 6. Il encadre la réponse soigneusement.
- L'Enseignant du Raisonnement (RL) : Calcule correctement les mathématiques, trouvant que le rayon est 5, mais oublie d'encadrer la réponse ou de l'écrire dans le format final.
- La Voix Mélangée : Elle prend les mathématiques correctes (5) de l'Enseignant du Raisonnement et l'instruction d'encadrement soigné de l'Enseignant de la Mise en Forme. La sortie finale est un 5 soigneusement encadré.
Résumé
Le document présente une méthode pour entraîner des modèles d'IA qui agit comme une équipe collaborative plutôt qu'une hiérarchie stricte. En moyennant mathématiquement les « pensées » (logits) d'un enseignant soigné mais désordonné et d'un enseignant intelligent mais désordonné, l'IA apprend à être à la fois intelligente et soignée, évitant les pièges de forcer l'un à suivre strictement l'autre.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.