← Derniers articles
💬 NLP

Masked Distillation: Internalizing the Chain-of-Thought in Language Models

Cet article introduit la « distillation masquée », un cadre qui internalise les capacités de raisonnement des grands modèles de raisonnement dans les paramètres d'un modèle étudiant en l'entraînant à prédire uniquement les jetons de solution tout en recevant un retour conditionné par la chaîne de pensée de l'enseignant, permettant ainsi une génération de réponses directe et une réduction de la latence d'inférence sans sacrifier la précision.

Auteurs originaux : Durgesh Kalwar, Vardhan Palod, Subbarao Kambhampati

Publié 2026-07-28
📖 6 min de lecture🧠 Analyse approfondie

Auteurs originaux : Durgesh Kalwar, Vardhan Palod, Subbarao Kambhampati

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez un monde où votre assistant IA préféré est comme un étudiant brillant mais bavard. Lorsque vous lui posez une question difficile, il ne se contente pas de donner la réponse brusquement ; il griffonne des pages de notes, dessine des diagrammes et détaille chaque étape de son raisonnement avant de finalement écrire la solution. Ce processus de « pensée à voix haute », connu dans le monde technologique sous le nom de « Chaîne de Pensée » (Chain of Thought), a rendu les modèles d'IA incroyablement intelligents pour les problèmes de mathématiques et de logique. Cependant, il y a un hic : ces pages de notes prennent beaucoup de temps et d'énergie à générer. C'est comme payer un chauffeur de taxi pour vous emmener au supermarché, mais aussi le payer pour faire tout le tour du pâté de maisons avant de « réfléchir » à l'allée dont vous avez besoin. Les scientifiques se demandent depuis longtemps : peut-on apprendre à l'IA à faire toute cette réflexion à l'intérieur de sa tête ? Si nous y parvenions, l'IA pourrait sauter les longues notes bavardes et vous donner la réponse instantanément, économisant ainsi un temps et une puissance de calcul massifs.

Cet article, intitulé « Masked Distillation » (Distillation Masquée), plonge directement dans cette question. Les chercheurs, travaillant avec des Modèles de Raisonnement de Grande Taille (LRM), ont cherché à savoir s'ils pouvaient prendre un modèle « enseignant » intelligent qui aime réfléchir à voix haute et entraîner un modèle « étudiant » plus petit à intérioriser ce processus de réflexion. Ils voulaient voir si l'étudiant pouvait apprendre à sauter les notes entièrement pour simplement donner la réponse finale, tout en étant tout aussi intelligent. Ils ont testé cela en utilisant une technique ingénieuse appelée « Masked Distillation ». Imaginez que l'enseignant résout un puzzle pendant que l'étudiant regarde. L'enseignant voit la question complète et son propre processus de pensée détaillé, mais l'étudiant n'est présenté qu'à la question. Le but était de voir si l'étudiant pouvait apprendre la logique secrète de l'enseignant et ensuite résoudre le puzzle par lui-même sans jamais avoir besoin d'écrire les étapes, même si l'enseignant avait toutes les notes pour guider l'apprentissage.

L'équipe a mis en place deux expériences principales. Dans la première, ils ont utilisé le même modèle d'IA comme enseignant et comme étudiant, en lui demandant simplement de réfléchir différemment. Dans la seconde, ils ont utilisé un modèle plus grand et plus intelligent comme enseignant et un modèle plus petit et plus simple comme étudiant. Ils ont également introduit un concept d'« échafaudage » (scaffold). Voyez cela comme des petites roues sur un vélo. Parfois, l'étudiant peut avoir besoin de voir un peu des notes de l'enseignant (l'échafaudage) pour trouver la bonne réponse, plutôt que d'essayer de tout faire à partir de zéro. Ils ont testé de combien de la pensée de l'enseignant l'étudiant avait besoin pour obtenir les meilleurs résultats.

Les résultats étaient un mélange de « wow » et de « pas si vite ». Sur un ensemble de données de problèmes mathématiques de niveau primaire appelé GSM8K, les modèles étudiants étaient formidables. Ils ont réussi à intérioriser la pensée de l'enseignant. L'étudiant entièrement « masqué » (celui qui n'écrivait jamais de notes) a obtenu 76,0 % de bonnes réponses, ce qui est un bond énorme par rapport à sa capacité initiale, et il l'a fait en utilisant seulement 369,6 tokens (unités de texte) en moyenne, contre 2 398,1 tokens pour l'enseignant. C'est une réduction d'effort massive de 6,5 fois !

Cependant, sur un puzzle numérique plus complexe appelé Countdown, l'histoire change. Ici, l'étudiant qui essayait de tout faire dans sa tête (entièrement masqué) a en fait été moins performant, tombant à 41,7 % de précision. Il s'est avéré que pour ce type spécifique de puzzle, l'étudiant avait besoin de voir une partie des notes de l'enseignant pour réussir. Mais voici la partie cool : les chercheurs ont trouvé un point d'équilibre. En laissant l'étudiant voir juste un petit peu de la pensée de l'enseignant (environ 30 % des notes, ou un « alpha » de 0,3), la précision de l'étudiant a grimpé en flèche pour atteindre 86,2 %. C'était presque aussi bon que l'enseignant (87,3 %), mais utilisait tout de même environ 1,3 fois moins de tokens que l'enseignant. C'était comme donner à l'étudiant juste assez de petites roues pour garder l'équilibre parfaitement sans avoir besoin de tout le vélo.

L'article a également examiné la capacité de ces étudiants à gérer de nouveaux puzzles inédits (tâches hors distribution). Sur le plan mathématique, les étudiants s'en sont bien sortis, mais sur les puzzles Countdown, les résultats étaient un peu plus mitigés. Curieusement, dans certains cas, les étudiants entraînés avec un peu d'échafaudage ont mieux généralisé que l'enseignant lui-même lorsque les puzzles devenaient plus difficiles ou changeaient légèrement.

Une découverte clé est que la méthode d'enseignement importait. Lorsqu'ils ont essayé d'enseigner à l'étudiant simplement en lui montrant les notes de l'enseignant et en lui demandant de les copier (une méthode appelée Apprentissage Supervisé par Affinement ou Supervised Fine-Tuning), cela n'a pas aussi bien fonctionné. La méthode de « Masked Distillation », qui utilise une façon plus complexe de comparer les suppositions de l'étudiant aux pensées réelles de l'enseignant, était beaucoup plus efficace pour transférer les compétences de « réflexion ».

En fin de compte, l'article suggère que nous ne pouvons pas simplement supprimer magiquement toutes les étapes de réflexion pour chaque problème. La capacité d'une IA à « réfléchir silencieusement » dépend fortement du type de problème et de ce que l'étudiant sait déjà sur ce sujet. Pour des tâches familières comme les mathématiques de base, l'IA peut apprendre à réfléchir silencieusement et gagner énormément de temps. Pour des puzzles plus difficiles et moins familiers, elle pourrait encore avoir besoin d'un petit coup de pouce — un petit échafaudage de notes — pour accomplir le travail correctement. Les chercheurs concluent que cet « échafaudage » est un outil puissant que l'on peut ajuster, permettant de trouver l'équilibre parfait entre l'intelligence de l'IA et la rapidité avec laquelle elle peut donner une réponse.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →