← Derniers articles
🤖 machine learning

Weight-Space Geometry of Offline Reasoning Training

Cet article analyse la géométrie de l'espace des poids de six méthodes d'entraînement de raisonnement hors ligne sur un modèle Qwen3-4B, révélant que si le SFT, le RFT et le RIFT convergent vers des mises à jour presque colinéaires avec une précision similaire, le DPO adopte un sous-espace distinct, quasi orthogonal, qui atteint des performances nettement supérieures sur les benchmarks GSM8K et AIME26, tandis que l'Offline GRPO introduit une composante orthogonale substantielle tout en restant dans le bassin de perte du SFT.

Auteurs originaux : Aleksandr Nikolich, Igor Kiselev, Vladimir Platonov, Karina Romanova

Publié 2026-06-24
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Aleksandr Nikolich, Igor Kiselev, Vladimir Platonov, Karina Romanova

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous avez un brillant et gigantesque tuteur de mathématiques (l'« Enseignant ») capable de résoudre des problèmes complexes. Vous voulez apprendre à un étudiant plus petit et moins coûteux (l'« Étudiant ») à penser comme ce tuteur. Vous donnez à l'étudiant les solutions étape par étape de l'enseignant (appelées « rollouts ») et vous lui demandez d'apprendre de celles-ci.

Cette publication pose une question simple mais profonde : Est-ce que la manière dont nous disons à l'étudiant d'apprendre importe ?

Il existe de nombreuses différentes « formules d'enseignement » (fonctions de perte) que les chercheurs utilisent. Certains disent : « Ne regarde que les bonnes réponses. » D'autres disent : « Regarde toutes les réponses, mais accorde des points bonus aux bonnes. » D'autres encore disent : « Compare les bonnes réponses aux mauvaises. »

Les auteurs voulaient savoir : est-ce que ces différentes formules font changer le cerveau de l'étudiant (les poids de l'ordinateur) de la même manière, ou créent-elles des types de penseurs complètement différents ?

Voici le détail de leurs découvertes, en utilisant des analogies simples :

1. Le groupe des « Imitateurs » (SFT, RFT, RIFT)

L'analogie : Imaginez trois étudiants essayant de copier un dessin.

  • L'Étudiant A copie chaque trait.
  • L'Étudiant B ne copie que les traits qui sont parfaits.
  • L'Étudiant C copie chaque trait, mais dessine les traits parfaits de manière légèrement plus foncée.

La découverte : Même s'ils utilisent des règles légèrement différentes, ils finissent tous par dessiner presque exactement le même dessin.

  • Mathématiquement, les changements apportés à leurs cerveaux sont presque identiques (97 % de similitude).
  • Ils obtiennent tous environ le même score aux tests de mathématiques (environ 87–88 %).
  • À retenir : Si vous voulez simplement qu'un étudiant imite le raisonnement de l'enseignant, peu importe laquelle de ces trois formules spécifiques vous utilisez. Ils font essentiellement la même chose.

2. L'« Auto-ajusteur » (DFT)

L'analogie : Cet étudiant utilise la même feuille de papier que l'Étudiant A, mais il a une drôle d'habitude : il rend automatiquement le stylo plus clair lorsqu'il est déjà confiant et plus foncé lorsqu'il est incertain.

La découverte : Ce petit ajustement change considérablement la direction du dessin. Le cerveau de l'étudiant change d'une manière très différente de celle du groupe des Imitateurs, même s'il n'a utilisé aucun « score de récompense » pour le guider. C'est un chemin unique, mais cela ne mène pas nécessairement à un meilleur score.

3. Le « Pas de côté » (Offline GRPO)

L'analogie : Cet étudiant regarde le travail de l'enseignant mais décide de faire un grand pas de côté. Il reste dans le même voisinage général (le « bassin de perte »), mais il emprunte un chemin différent.

La découverte : Cette méthode pousse le cerveau de l'étudiant dans une direction qui est 67 % différente de celle du groupe des Imitateurs. Dans les couches ultérieures du cerveau (les « pensées finales »), cette différence augmente pour atteindre presque 86 %.

  • Cependant, ils obtiennent toujours un score similaire (environ 87 %).
  • À retenir : Cette méthode explore une nouvelle direction, mais elle ne semble pas débloquer de « super-pouvoir » en termes de précision par rapport aux Imitateurs.

4. L'« Outlier » (DPO)

L'analogie : Tandis que tous les autres dessinent sur la même feuille de papier dans la même pièce, cet étudiant dessine sur un canevas complètement différent, dans une autre pièce, avec un style totalement différent.

La découverte :

  • Géométrie : Les changements apportés au cerveau de cet étudiant sont presque à 90 degrés (orthogonaux) par rapport à tous les autres. Il fait quelque chose de fondamentalement différent.
  • La Barrière : Si vous essayiez de mélanger le cerveau de cet étudiant avec celui du groupe des Imitateurs (une « interpolation linéaire »), le résultat se briserait. Ils sont dans des « univers » de solutions différents.
  • Le Score : Malgré cela, cet étudiant a obtenu les meilleurs scores (93,5 % en mathématiques, 30 % sur les énigmes difficiles).
  • Le Piège : Cet étudiant a été entraîné avec un taux d'apprentissage 10 fois plus petit (il a fait des pas beaucoup plus petits et plus prudents). Les auteurs préviennent que nous ne pouvons pas être sûrs à 100 % si le score élevé est dû à la formule ou simplement au fait qu'ils ont fait des étapes plus petites et plus précises.

5. La surprise du « Live vs Enregistré »

L'article a également examiné ce qui se passe si l'étudiant apprend par la pratique en direct (Online) ou par la pratique enregistrée (Offline).

  • Offline : Lorsqu'on apprend à partir d'un ensemble fixe de réponses enregistrées de l'enseignant, l'étudiant du « Pas de côté » (Offline GRPO) reste assez proche des Imitateurs.
  • Online : Lorsque l'étudiant génère ses propres problèmes d'entraînement (Online GRPO), il devient complètement orthogonal (totalement différent) des Imitateurs.
  • Conclusion : Le fait que les méthodes « Offline » ressemblent aux Imitateurs est en partie dû au fait qu'elles regardent toutes exactement le même ensemble fixe de réponses de l'enseignant. Si vous les laissez générer leurs propres exercices, elles divergent radicalement.

Résumé

  • La plupart des méthodes (SFT, RFT, RIFT) sont juste différentes façons de dire « Copie l'enseignant ». Elles entraînent la même structure cérébrale et des scores similaires.
  • DPO est l'exception. Elle construit une structure cérébrale complètement différente. Elle obtient les meilleurs scores, mais elle le fait avec un style d'entraînement très spécifique et prudent (petit taux d'apprentissage) qui rend la comparaison directe avec les autres difficile.
  • La nature « Offline » des données d'entraînement est une raison majeure pour laquelle beaucoup de ces méthodes finissent par se ressembler.

L'article cartographie essentiellement la « géographie » de ces méthodes d'apprentissage, montant lesquelles sont voisines et lesquelles vivent sur des planètes différentes.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →