How to Fine-Tune a Reasoning Model? A Teacher-Student Cooperation Framework to Synthesize Student-Consistent SFT Data
Ce papier propose TESSY, un cadre de coopération enseignant-élève qui génère des données d'entraînement synthétiques alliant les capacités de raisonnement avancées d'un modèle puissant à la cohérence stylistique du modèle étudiant, surmontant ainsi les baisses de performance observées lors du fine-tuning traditionnel sur des données générées par un enseignant.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
🍳 Le Problème : Le Chef étoilé et l'Apprenti qui perd ses repères
Imaginez que vous avez un Chef étoilé (le modèle "Professeur", très intelligent, comme GPT-OSS-120B) et un Apprenti cuisinier (le modèle "Étudiant", plus petit, comme Qwen3-8B).
L'objectif est d'apprendre à l'Apprenti à cuisiner des plats complexes (comme du code informatique) en lui faisant copier les recettes du Chef.
Le problème classique :
Si vous donnez à l'Apprenti un livre de recettes écrit entièrement par le Chef, quelque chose de bizarre se produit. Le Chef utilise un langage très spécifique, des phrases de transition particulières ("Ensuite, prenons...", "Il est crucial de noter...") et une structure de pensée très élaborée.
L'Apprenti, lui, a son propre style naturel. S'il essaie de copier tout le livre du Chef (y compris le style), il devient confus. Il oublie ses propres techniques, perd sa confiance, et finit par cuisiner moins bien qu'avant. C'est ce qu'on appelle l'oubli catastrophique : en voulant trop bien faire, il a tout gâché.
💡 La Solution : TESSY (La Cuisine à Deux)
Les chercheurs ont inventé une méthode appelée TESSY (Teacher–Student Cooperation Data Synthesis). Au lieu de donner un livre tout fait, ils créent une nouvelle méthode de travail en équipe.
Voici comment ça marche, étape par étape :
1. La division des tâches (Le "Qui fait quoi ?")
Dans une réponse typique d'un modèle de raisonnement, il y a deux types de "ingrédients" :
- La "Substance" (Le Code/Logique) : C'est la partie dure, les mathématiques, la solution exacte. C'est là que le Chef est le meilleur.
- Le "Style" (Les phrases de transition) : C'est la façon de parler, les "Alors, voyons...", "Hmm, je pense que...", les connecteurs logiques. C'est là que l'Apprenti est le plus à l'aise avec son propre langage.
La règle d'or de TESSY :
- Le Chef écrit uniquement la Substance (la logique, le code).
- L'Apprenti écrit uniquement le Style (les phrases d'introduction, les transitions).
2. La Danse Alternée (Le "Je-Je-Je")
Au lieu d'écrire une phrase après l'autre, ils travaillent en alternance, comme dans un jeu de passe-passe :
- L'Apprenti commence : "Bon, regardons ce problème..." (Style).
- Le Chef intervient : "Voici la formule mathématique exacte pour résoudre ça..." (Substance).
- L'Apprenti reprend : "Donc, si on applique ça, on obtient..." (Style).
- Le Chef continue : "Le résultat final est X." (Substance).
Ils se passent la main à chaque étape. Pour s'assurer que le Chef ne glisse pas de phrases de style et que l'Apprenti ne tente pas de faire de la logique trop complexe, ils utilisent un gardien (un petit programme appelé "Boundary Predictor") qui coupe le texte exactement là où le style finit et où la logique commence.
🎁 Le Résultat : Le Meilleur des Deux Mondes
Grâce à TESSY, l'Apprenti reçoit un livre de recettes qui ressemble à ceci :
- Le contenu est parfait : Il utilise la logique brillante du Chef.
- La forme est familière : Le texte est écrit avec les mots et le ton de l'Apprenti.
Pourquoi ça marche ?
L'Apprenti n'a plus besoin de changer de personnalité pour apprendre. Il peut se concentrer à 100 % sur l'apprentissage de la logique, car le "bruit" (le style étranger) a été éliminé.
📊 Les Résultats dans la vie réelle
Dans l'article, les chercheurs ont testé cela sur la génération de code (informatique) :
- Méthode ancienne (Copier le Chef) : L'Apprenti a perdu en performance (il a fait plus d'erreurs).
- Méthode TESSY : L'Apprenti a fait un bond en avant, devenant beaucoup plus performant que s'il avait appris seul, et bien meilleur que s'il avait juste copié le Chef.
En résumé
Imaginez que vous voulez apprendre à jouer du piano en écoutant un virtuose.
- L'ancienne méthode : Vous essayez de jouer exactement comme lui, avec ses gestes, sa respiration et ses mouvements de corps. Vous vous sentez mal à l'aise et vous jouez faux.
- La méthode TESSY : Le virtuose vous donne la partition exacte (la logique), mais vous jouez avec votre propre façon de bouger les doigts et votre propre rythme (le style). Résultat ? Vous jouez la musique parfaite, mais avec votre propre âme.
C'est ça, TESSY : garder l'intelligence du grand modèle, mais garder l'identité du petit modèle.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.