On-Policy Delta Distillation
Cet article introduit l'On-Policy Delta Distillation (OPD), une nouvelle méthode de post-entraînement pour l'apprentissage par renforcement qui exploite un « signal delta » — représentant la différence entre un modèle enseignant et son état initial avant le réglage du raisonnement — pour transférer plus efficacement les capacités de raisonnement et atteindre des performances solides sur les benchmarks de mathématiques, de sciences et de code avec un post-entraînement minimal.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Imaginez un monde où les ordinateurs sont comme de gigantesques bibliothèques affamées qui ont lu presque tous les livres jamais écrits. Ces bibliothèques, appelées Grands Modèles de Langage (LLM), sont incroyablement douées pour deviner le mot suivant dans une phrase. Mais savoir simplement terminer une phrase ne suffit pas pour résoudre un problème mathématique complexe ou déboguer un programme informatique défectueux. Pour qu'ils deviennent vraiment bons dans ces tâches, nous devons leur apprendre à penser.
Considérez ce processus comme l'entraînement d'un étudiant. D'abord, l'étudiant lit une bibliothèque massive (pré-entraînement) pour apprendre les bases du langage. Ensuite, un professeur arrive pour lui donner des leçons spécifiques sur la résolution d'énigmes (post-entraînement). Généralement, les professeurs utilisent deux méthodes principales : soit ils montrent à l'étudiant la réponse parfaite et disent : « Copie ceci » (Fine-Tuning Supervisé), soit ils laissent l'étudiant essayer, lui donnent une note, et disent : « Réessaie, mais fais mieux la prochaine fois » (Apprentissage par Renforcement). Récemment, une nouvelle méthode appelée « Distillation On-Policy » est devenue populaire. C'est comme un professeur observant l'étudiant résoudre un problème en temps réel et murmurant : « Oui, ce mot était bon », ou « Non, ce mot était mauvais », en se basant sur ce que le professeur aurait dit. C'est efficace et cela évite l'affaire désordonnée de la conception de systèmes de notation complexes.
Mais voici le piège : même cette méthode intelligente présente une faille. Lorsque le professeur murmure, il peut accidentellement murmurer des choses que l'étudiant sait déjà, comme être poli ou raconter une histoire, plutôt que les moments précis de l'« eurêka ! » de la logique qui font de l'enseignant un génie du raisonnement. Le papier que vous allez lire pose une question simple : Et si nous pouvions filtrer le bruit pour n'enseigner à l'étudiant que les nouvelles astuces que le professeur a apprises ?
Ce papier introduit une technique ingénieuse appelée On-Policy Delta Distillation (OPD2). Les chercheurs ont réalisé qu'un « Professeur de Raisonnement » est en fait deux modèles en un : le modèle « de Base » original (avant qu'il n'apprenne à raisonner) et le modèle de « Raisonnement » (après qu'il a appris). Si vous soustrayez les pensées du modèle de Base de celles du modèle de Raisonnement, vous obtenez un « Signal Delta ». Ce signal est comme un film des meilleurs moments montrant exactement ce qui a changé lorsque le professeur a appris à raisonner. Au lieu de simplement copier la réponse finale du professeur, l'étudiant apprend de ce « Signal Delta » — la différence spécifique qui représente le bond de l'aptitude au raisonnement.
Les auteurs ont testé cette idée en mélangeant des problèmes de mathématiques, de sciences et de codage. Ils ont découvert qu'utiliser ce « Signal Delta » comme récompense principale aidait les étudiants à apprendre beaucoup plus vite et mieux que les anciennes méthodes. En fait, leur nouvelle méthode, l'OPD2, a systématiquement battu les techniques précédentes les plus performantes à travers différentes tailles de modèles, des petits modèles de 1,7 milliard de paramètres aux massifs de 8 milliards. Cela a si bien fonctionné qu'un modèle plus petit entraîné avec l'OPD2 pouvait parfois surpasser un modèle beaucoup plus grand entraîné avec les anciennes méthodes. Le papier suggère qu'en se concentrant uniquement sur le changement de la pensée, plutôt que sur toute la personnalité du professeur, nous pouvons enseigner le raisonnement à l'IA plus efficacement sans perdre de temps sur ce qu'elle sait déjà.
L'histoire du signal « Delta »
Plongeons dans la mécanique de cette découverte en utilisant une analogie simple. Imaginez que vous apprenez à jouer à un jeu vidéo complexe. Vous avez une version « de Base » de votre personnage qui sait marcher, sauter et parler. Ensuite, vous obtenez une version « Pro » de ce personnage qui a maîtrisé les niveaux les plus difficiles du jeu.
L'ancienne façon d'enseigner (la distillation On-Policy standard) est comme si le personnage Pro se tenait à côté de vous et disait : « Fais exactement ce que je fais ». Le problème est que le personnage Pro marche et parle toujours exactement comme le personnage de Base le faisait. Ainsi, quand le Pro dit : « Avance », il ne fait que répéter quelque chose que vous savez déjà faire. Vous passez votre temps à pratiquer la marche, au lieu d'apprendre les combinaisons secrètes qui font de vous un pro.
Les auteurs de ce papier, Byeongho Heo, Jaehui Hwang, Sangdoo Yun et Dongyoon Han du NAVER AI Lab, ont proposé une approche différente. Ils ont demandé : « Et si nous n'enseignions à l'étudiant que la différence entre le Pro et la Base ? »
Cette différence est le Signal Delta.
- Le Modèle de Base : Sait parler et écrire, mais peut trébucher sur une logique complexe.
- Le Professeur de Raisonnement : Sait parler, écrire, et résoudre des énigmes logiques difficiles.
- Le Delta : La « magie » spécifique que l'Enseignant a apprise pour résoudre l'énigme.
Dans le papier, ils visualisent cela avec des nuages de mots. Lorsqu'ils ont regardé ce que l'ancienne méthode enseignait, c'était rempli de mots génériques comme « voir », « essayer » et « vérifier ». Mais lorsqu'ils ont regardé le Signal Delta, les mots qui ressortaient étaient des connecteurs logiques comme « par conséquent », « cependant », « notez » et « au lieu de ». Ce sont les mots qui lient un argument logique. Le Signal Delta filtre efficacement les éléments « ennuyeux » que l'étudiant connaît déjà et met en évidence la « recette secrète » du raisonnement.
Comment ils ont construit l'OPD2
Pour que cela fonctionne, les chercheurs ont dû résoudre quelques problèmes délicats. Si vous donnez simplement un Signal Delta à un étudiant, il pourrait être confus car le signal ne tient pas compte de ce que l'étudiant lui-même est en train de faire. C'est comme un coach criant des instructions sans regarder la position actuelle du joueur.
Ils ont donc ajouté deux ingrédients spéciaux à leur recette :
- Centrage : Ils ont ajusté le signal pour qu'il soit équilibré autour de zéro. Cela aide l'étudiant à comprendre si un mouvement est « meilleur que la moyenne » ou « pire que la moyenne », plutôt que de simplement recevoir un score brut qui pourrait être trompeur.
- Conditionnement Conjoint : Ils se sont assurés que le nouveau Signal Delta ne s'active que lorsqu'il est en accord avec l'ancienne méthode standard. Cela agit comme un filet de sécurité. Si le Signal Delta essaie de pousser l'étudiant dans une direction bizarre qui contredit le style général de l'enseignant, le système dit : « Attendez », et arrête la mise à jour. Cela empêche l'étudiant de s'embrouiller ou d'oublier comment parler correctement tout en essayant d'apprendre à penser.
Les résultats : Un nouveau champion
L'équipe a testé leur nouvelle méthode, qu'ils ont nommée OPD2, contre l'ancienne norme (OPD) et une méthode plus récente et avancée appelée ExOPD. Ils ont utilisé un mélange de 100 000 questions provenant de jeux de données de mathématiques, de sciences et de codage. Ils ont testé cela sur divers modèles, notamment la famille Qwen3 (tailles 1.7B, 4B et 8B) et le modèle Gemma4.
Les résultats ont été impressionnants. En mode « non-réflexion » (où les modèles répondent rapidement sans montrer leur travail), l'OPD2 a systématiquement surpassé les autres.
- Pour le modèle Qwen3-1.7B en mathématiques, l'OPD2 a fait passer le score moyen de 34,8 à 54,6. C'est un bond énorme, battant la méthode suivante de plus de 3 points.
- Pour le Qwen3-4B, l'OPD2 a atteint un score moyen de 70,3, alors que le précédent meilleur (ExOPD) était à 66,4.
- Plus surprenant encore, le modèle 4B entraîné avec l'OPD2 a performé mieux que le modèle 8B entraîné avec les anciennes méthodes. Cela suggère que la façon dont vous entraînez compte autant que la taille de votre modèle.
Ils ont également testé les modèles en mode « réflexion », où les modèles sont déjà assez intelligents et montrent leurs étapes de raisonnement. Il est plus difficile de s'améliorer ici car les modèles sont déjà bons. Pourtant, l'OPD2 a réussi à extraire un gain de performance supplémentaire. Par exemple, sur le benchmark mathématique HMMT25, le modèle Qwen3-8B a amélioré son score de 44,3 à 52,3 avec l'OPD2, tandis que les autres méthodes ont soit rendu le score moins bon, soit ne l'ont pratiquement pas fait changer.
La méthode a également fonctionné sur Gemma4, une autre famille de modèles. Alors que les autres méthodes peinaient ou rendaient même le modèle moins performant, l'OPD2 a amélioré les scores de mathématiques de 60,6 à 67,8. Cela montre que l'idée d'utiliser le « Signal Delta » n'est pas un coup de chance pour un modèle spécifique ; elle semble être un principe général qui aide l'IA à mieux apprendre à penser.
Pourquoi cela importe
Le papier suggère que la clé pour enseigner le raisonnement à l'IA n'est pas seulement de lui donner plus de données ou de rendre l'enseignant plus grand. Il s'agit d'être précis sur ce que nous enseignons. En isolant les changements spécifiques qui se produisent lorsqu'un modèle apprend à raisonner (le Delta), nous pouvons transférer cette capacité beaucoup plus efficacement.
Les auteurs notent que cette méthode est efficace sur le plan computationnel. Elle prend environ 24 à 28 % de temps en plus pour l'entraînement que la méthode standard parce que l'ordinateur doit faire tourner le modèle « de Base » en arrière-plan pour calculer la différence. Cependant, comme ces sessions d'entraînement sont généralement courtes (souvent moins d'un passage complet à travers les données), ce faible coût supplémentaire vaut largement le gain massif de performance.
En résumé, l'OPD2 est comme un chef étoilé qui réalise que pour enseigner à un apprenti le secret d'une soupe parfaite, il ne doit pas simplement dire « ajoute du sel ». Il devrait dire : « Ajoute autant de sel de plus que tu en mets d'habitude, car c'est la différence entre une bonne soupe et une excellente ». En se concentrant sur la différence, l'étudiant apprend le secret plus vite et mieux. Le papier conclut que cette approche est une étape significative pour rendre l'IA plus intelligente, plus rapide et plus capable de résoudre les problèmes complexes du futur.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.