← Derniers articles
🤖 AI

RL Squeezes, SFT Expands: A Comparative Study of Reasoning LLMs

Ce papier présente un cadre novateur analysant les trajectoires de raisonnement aux niveaux de la trajectoire et de l'étape pour révéler que l'apprentissage par renforcement avec récompenses vérifiables (RLVR) comprime les trajectoires incorrectes et concentre le raisonnement en moins d'étapes, tandis que l'affinement supervisé (SFT) étend les trajectoires correctes et distribue le raisonnement sur de nombreuses étapes, expliquant ainsi le succès complémentaire du paradigme actuel d'entraînement en deux étapes.

Auteurs originaux : Kohsei Matsutani, Shota Takashiro, Gouki Minegishi, Takeshi Kojima, Yusuke Iwasawa, Yutaka Matsuo

Publié 2026-05-28
📖 7 min de lecture🧠 Analyse approfondie

Auteurs originaux : Kohsei Matsutani, Shota Takashiro, Gouki Minegishi, Takeshi Kojima, Yusuke Iwasawa, Yutaka Matsuo

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

La Grande Image : Deux Façons d'Enseigner à un Robot de Penser

Imaginez que vous avez un robot qui est bon pour parler mais pas excellent pour résoudre des énigmes complexes de mathématiques ou de programmation. Pour le rendre plus intelligent, les chercheurs utilisent deux méthodes principales d'entraînement :

  1. SFT (Affinement Supervisé) : C'est comme l'imitation. Vous montrez au robot un exemple parfait de la façon dont un expert humain résout un problème, étape par étape, et vous dites : « Faites exactement cela. »
  2. RL (Apprentissage par Renforcement) : C'est comme l'essai et l'erreur avec un tableau de scores. Vous laissez le robot essayer de résoudre le problème par lui-même. S'il trouve la bonne réponse, il reçoit une « étoile d'or » (récompense). S'il se trompe, il ne reçoit rien. Avec le temps, il apprend à éviter les chemins qui mènent à l'échec.

Le papier se demande : Que se passe-t-il réellement à l'intérieur du cerveau du robot lorsque nous utilisons ces deux méthodes différentes ? Modifient-elles comment le robot pense, ou seulement ce qu'il répond ?

Les auteurs ont découvert que ces deux méthodes font des choses opposées au « processus de pensée » du robot.


Analogie 1 : La « Piste de Raisonnement » (Niveau Trajectoire)

Imaginez le processus de pensée du robot comme un randonneur traversant une immense forêt brumeuse pour trouver un trésor caché (la bonne réponse). Il existe de nombreux chemins : certains mènent au trésor, et beaucoup mènent à des impasses ou à des falaises.

  • SFT (L'Imitateur) « Étend » les Bons Chemins :
    Lorsque vous montrez au robot la carte d'un expert (SFT), il apprend à marcher sur le bon chemin. Mais voici le hic : il commence aussi à marcher sur de nombreuses variations différentes de ce bon chemin. Il devient très créatif et diversifié dans la façon dont il trouve le trésor.

    • Le Hic : Il ne cesse pas de marcher sur les mauvais chemins. Si le robot vagabondait déjà dans un marais (commettant des erreurs), le SFT lui apprend de nouvelles façons de marcher, mais il pourrait encore vagabonder dans le marais occasionnellement. Il « étend » le nombre de routes correctes mais ne nettoie pas nécessairement les mauvaises.
  • RL (Le Juge) « Écrase » les Mauvais Chemins :
    Lorsque vous laissez le robot jouer au jeu avec des récompenses (RL), il réalise rapidement que les chemins du marais mènent à zéro point. Alors, il arrête d'y aller. Il « écrase » tous les chemins incorrects, confus ou en impasse hors de l'existence.

    • Le Hic : Il a aussi tendance à « écraser » les bons chemins. Il pourrait arrêter d'explorer les variations créatives de la bonne réponse et s'en tenir uniquement au chemin qu'il sait fonctionner le mieux. Il devient très concentré, mais moins diversifié.
  • La Combinaison Gagnante (SFT + RL) :
    Le papier explique pourquoi la meilleure pratique actuelle est de faire d'abord du SFT, puis du RL.

    1. D'abord, utilisez SFT pour enseigner au robot de nouvelles façons de trouver le trésor (en étendant les bons chemins).
    2. Ensuite, utilisez RL pour punir le robot de vagabonder dans le marais (en écrasant les chemins incorrects).
    • Résultat : Vous obtenez un robot qui connaît de nombreuses façons de résoudre le problème mais qui est très discipliné pour éviter les erreurs.

Analogie 2 : La « Ville des Pensées » (Niveau Étape)

Maintenant, examinons la pensée du robot non pas comme un chemin unique, mais comme une carte de ville. Chaque « étape » du raisonnement (comme « calculer la surface » ou « vérifier la formule ») est un bâtiment dans cette ville. Les connexions entre les étapes sont les routes.

  • RL Crée une Ville « Hub et Rayons » :
    Après l'entraînement RL, la ville change. Le robot commence à dépendre fortement de quelques bâtiments spécifiques, ultra-importants (les hubs). Il visite ces étapes clés encore et encore.

    • L'Effet : La ville devient très efficace mais encombrée autour de ces quelques points. Le robot concentre sa « puissance de pensée » dans un petit nombre d'étapes critiques. C'est comme un navetteur qui n'utilise que trois ponts spécifiques pour traverser la rivière, en ignorant tous les autres.
  • SFT Crée une Ville « Distribuée » :
    Après l'entraînement SFT, la ville a une apparence différente. Le robot répartit sa pensée. Il visite de nombreux bâtiments différents, et aucun bâtiment unique n'est visité de manière aussi écrasante que dans la ville RL.

    • L'Effet : La pensée est « homogénéisée » ou répartie uniformément. C'est comme une ville où tout le monde utilise une grande variété de rues, et où aucune rue unique n'est embouteillée.

La Découverte Clé :

  • RL rend la pensée du robot intense et concentrée sur quelques étapes clés (Écrasement).
  • SFT rend la pensée du robot large et distribuée sur de nombreuses étapes (Extension).

La Forme de la Ville (Topologie)

Les chercheurs ont également examiné la « forme » de ces villes de pensée en utilisant la géométrie.

  • Le Modèle de Base (Avant l'entraînement) : La ville est divisée en quartiers isolés (communautés). Il est difficile de passer d'un quartier à un autre. Le robot reste coincé dans des boucles locales.
  • RL : Il démolit les murs entre les quartiers. Il crée une ville dominée par quelques « hubs » massifs qui relient tout. Cela rend le robot très rapide pour trouver la réponse si il touche le bon hub, mais il dépend de ces hubs spécifiques.
  • SFT : Il démolit aussi les murs, mais au lieu de créer des hubs, il construit un réseau où tout est connecté à tout le reste. Cela rend la ville très robuste et facile à naviguer d'un point à un autre.

Résumé des Affirmations du Papier

  1. RL est un « Écraseur » : Il écrase les chemins de pensée incorrects et concentre le raisonnement du robot en quelques étapes très efficaces et à fort trafic. Il rend le robot très bon pour obtenir la bonne réponse du premier coup (Pass@1) en éliminant les mauvaises options.
  2. SFT est un « Étendeur » : Il enseigne au robot de nouvelles façons correctes de penser et répartit la charge de raisonnement sur de nombreuses étapes. Cependant, il ne se débarrasse pas automatiquement des mauvais chemins que le robot aurait pu utiliser auparavant.
  3. Pourquoi SFT + RL Fonctionne : Les meilleurs résultats proviennent de l'utilisation de SFT pour enseigner au robot comment penser correctement (en étendant les bons chemins) puis de l'utilisation de RL pour le forcer à arrêter de faire des erreurs (en écrasant les mauvais chemins).
  4. La Structure Compte : RL crée une structure de raisonnement « lourde en hubs », tandis que SFT crée une structure « distribuée ». Toutes deux sont différentes de la structure « fragmentée » d'un modèle non entraîné.

Le papier conclut que comprendre ces différences mécaniques aide à expliquer pourquoi la recette d'entraînement « en deux étapes » actuelle (SFT puis RL) est si réussie pour créer une IA de raisonnement intelligente.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →