← Derniers articles
💻 computer science

Post-Training is About States, Not Tokens: A State Distribution View of SFT, RL, and On-Policy Distillation

Cet article propose une perspective fondée sur la distribution des états pour le post-entraînement des LLM, démontrant par des expériences contrôlées que la source et la localité des états d'entraînement sont aussi critiques que le signal de supervision lui-même, comme en témoignent les méthodes on-policy surpassant les enseignants entraînés sous contrainte et préservant mieux la rétention que le fine-tuning supervisé standard.

Auteurs originaux : Dong Nie

Publié 2026-05-22
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Dong Nie

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous enseigniez à un robot très intelligent mais inexpérimenté comment résoudre des problèmes de mathématiques. Vous souhaitez qu'il progresse en mathématiques sans oublier comment dire la vérité ou répondre à des questions de culture générale.

Pendant longtemps, les chercheurs ont pensé que le type de leçon (le problème de mathématiques lui-même) était l'élément le plus important. Cet article soutient que ce n'est que la moitié de l'histoire. Le vrai secret réside dans l'endroit où se trouve le robot lorsqu'il reçoit la leçon.

L'auteur appelle cela la vision de la "Distribution d'État". Voici une explication simple utilisant des analogies du quotidien :

1. Les Trois Façons d'Enseigner (Le "Où" Compte)

Considérez l'"état" du robot comme le moment précis d'une conversation. C'est la question posée plus tout ce que le robot a dit jusqu'à présent.

  • Méthode A : L'Approche "Manuel Scolaire" (SFT)

    • Fonctionnement : Vous montrez au robot un manuel parfait contenant des questions et des réponses parfaites. Vous l'obligez à mémoriser les réponses pour ces questions spécifiques.
    • Le Problème : Le robot n'apprend à répondre que lorsque la question ressemble exactement au manuel. Si le robot fait une toute petite erreur au milieu d'une conversation, il se perd car il n'a jamais pratiqué la récupération après ses propres erreurs.
    • La Découverte de l'Article : Si vous êtes doux, le robot apprend bien les mathématiques et se souvient de tout le reste. Mais si vous le poussez trop fort (SFT sous stress), il se concentre tellement sur le manuel qu'il oublie comment parler normalement et devient même moins bon en mathématiques car il ne peut pas gérer le désordre du monde réel.
  • Méthode B : L'Approche "Essais et Erreurs" (RL)

    • Fonctionnement : Vous laissez le robot parler librement. Lorsqu'il résout correctement un problème de mathématiques, vous lui donnez une tape dans le dos (récompense). Lorsqu'il échoue, vous ne le faites pas.
    • Le Problème : Le robot ne reçoit un retour d'information que sur les phrases spécifiques qu'il a réellement écrites.
    • La Découverte de l'Article : C'est très sûr. Le robot apprend à corriger ses propres erreurs car les leçons sont appliquées aux chemins exacts qu'il emprunte. Il progresse en mathématiques sans oublier comment dire la vérité.
  • Méthode C : L'Approche "Mentor sur le Tas" (OPD)

    • Fonctionnement : C'est la grande découverte de l'article. Vous laissez le robot générer ses propres phrases (son propre "état"). Ensuite, vous demandez à un "Mentor" (qui peut être un robot légèrement défectueux ou confus) de montrer au robot quelle devrait être la prochaine étape.
    • La Magie : Même si le Mentor est mauvais en mathématiques ou oublie des choses, le robot-élève peut tout de même apprendre. Pourquoi ? Parce que l'élève demande au Mentor : "Étant donné ma phrase actuelle, que devrais-je faire ensuite ?" L'élève ne copie pas toute l'histoire de vie du Mentor ; il demande simplement des conseils locaux sur le chemin que l'élève emprunte réellement.
    • La Découverte de l'Article : Un robot-élève entraîné de cette manière peut en réalité devenir plus intelligent que son propre mentor, même si le mentor lutte. L'élève évite les mauvaises habitudes du mentor car il n'écoute les conseils que sur les chemins que l'élève emprunte réellement.

2. La Grande Surprise : La "Dérive" n'est pas toute l'histoire

Habituellement, les scientifiques mesurent à quel point un robot change en regardant un seul chiffre : "À quel point le nouveau comportement du robot diffère-t-il de l'ancien ?" (Ils appellent cela la "Dérive").

  • L'Ancienne Croyance : Si le chiffre est élevé, le robot a oublié des choses.
  • La Découverte de l'Article : Ce chiffre est trompeur.
    • Dans les expériences, un robot "Manuel Stressé" et un robot "Mentor" avaient presque la même quantité de "Dérive" (ils semblaient également différents de l'original).
    • Mais : Le robot "Manuel Stressé" a tout oublié et est devenu moins bon en mathématiques. Le robot "Mentor" a conservé sa mémoire et est devenu meilleur en mathématiques.
    • Pourquoi ? Ce n'était pas de savoir jusqu'où ils se sont déplacés, mais ils se sont déplacés. Le robot Mentor s'est déplacé dans des directions locales sûres qu'il pouvait contrôler. Le robot Manuel a été poussé dans un territoire dangereux qu'il ne pouvait pas naviguer.

3. La Conclusion Principale

L'article conclut que lorsque nous entraînons une IA, nous ne devons pas seulement regarder la leçon (le problème de mathématiques ou la récompense). Nous devons regarder le contexte (l'état spécifique dans lequel se trouve l'IA).

  • SFT est comme obliger un élève à mémoriser un script qu'il n'utilisera jamais réellement dans la vie réelle.
  • RL est comme un entraîneur qui regarde le joueur jouer son propre match et donne des conseils à la volée.
  • OPD est comme un élève demandant des conseils à un mentor légèrement confus sur les étapes spécifiques que l'élève est en train de suivre.

La leçon la plus importante ? L'endroit où vous appliquez l'entraînement compte tout autant que l'entraînement lui-même. Un élève peut apprendre d'un mentor imparfait s'il ne demande de l'aide que sur les chemins qu'il emprunte réellement, plutôt que d'essayer de copier tout le voyage du mentor.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →