← Derniers articles
🤖 machine learning

Beyond Fixed Directions: Adaptive Representation Analysis of Reasoning and Memorization in LLMs

Cet article démontre que, bien que les tâches de raisonnement et de mémorisation dans les LLM soient décodables via une direction de représentation unique, cette direction n'est pas fixe mais subit une réorganisation géométrique substantielle lors de l'apprentissage par renforcement, même si l'information sous-jacente reste accessible.

Auteurs originaux : Shaheen Nabi

Publié 2026-08-25
📖 4 min de lecture☕ Lecture pause café

Auteurs originaux : Shaheen Nabi

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Dans le monde en évolution rapide de l'intelligence artificielle, les grands modèles de langage sont devenus capables de résoudre des énigmes complexes et de se souvenir de vastes quantités d'informations. Les scientifiques se demandent depuis longtemps comment ces cerveaux numériques fonctionnent réellement. Une idée prédominante suggère que des comportements spécifiques, comme le raisonnement logique ou la simple récupération de faits, sont liés à des voies distinctes et fixes au sein de la mémoire interne du modèle. Imaginez l'esprit du modèle comme un vaste espace multidimensionnel où chaque pensée laisse une trace. Si cette idée est vraie, alors la différence entre un modèle qui résout un problème mathématique et un autre qui se contente de se rappeler un fait devrait être visible sous la forme d'une ligne droite unique pointant dans une direction spécifique. Ce concept est si séduisant que certains chercheurs ont tenté d'utiliser ces lignes fixes comme guides pour entraîner les modèles à mieux réfléchir, supposant que le chemin qu'ils avaient trouvé resterait stable et fiable.

Cependant, une nouvelle étude remet en question l'hypothèse selon laquelle ces chemins restent en place. Des chercheurs ont examiné de plus près un petit modèle de langage, plus précisément une version connue sous le nom de Qwen3-0.6B, pour voir si cette idée de direction fixe tient la route lorsque le modèle est soumis à un entraînement rigoureux. Ils ont rassemblé un ensemble soigneusement équilibré de 400 exemples, dont la moitié exigeait un raisonnement logique et l'autre moitié un rappel de faits. En éliminant les distractions telles que la longueur des phrases ou le vocabulaire spécifique, ils se sont assurés que toute différence trouvée concernait réellement le type de pensée impliqué. Leur première découverte fut rassurante : ils ont confirmé qu'à n'importe quel instant donné, la différence entre le raisonnement et la mémorisation est effectivement si claire qu'une seule ligne peut séparer parfaitement les deux groupes. En fait, cette simple ligne fonctionnait tout aussi bien qu'une analyse complexe à haute dimension qui examinait tous les angles possibles des données.

L'histoire prend un tournant lorsque les chercheurs ont entraîné le modèle à l'aide d'une technique puissante appelée optimisation de politique relative au groupe (group-relative policy optimization), une méthode conçue pour booster les capacités de raisonnement. Ils s'attendaient à ce que, si l'idée de la direction fixe était vraie, la ligne séparant le raisonnement de la mémoire reste au même endroit, même pendant que le modèle apprenait. Au lieu de cela, ils ont découvert que, bien que le modèle connaisse toujours parfaitement la différence entre les deux tâches, la direction réelle de cette connaissance avait radicalement changé. Après l'entraînement, la ligne qui pointait autrefois clairement vers le « raisonnement » avait tellement pivoté qu'elle n'était plus alignée avec sa position d'origine. En moyenne, la nouvelle direction n'était qu'environ 45 % similaire à l'ancienne, et dans les couches les plus profondes du modèle, le décalage était encore plus prononcé, la représentation interne dérivant de plus de la moitié.

Cette découverte révèle une distinction cruciale entre ce qu'un modèle sait et la manière dont il stocke ce savoir. L'information elle-même n'a pas disparu ; le modèle pouvait toujours distinguer un problème mathématique d'une question de culture générale avec une précision parfaite après l'entraînement. Mais les coordonnées géométriques qu'il utilisait pour exprimer cette distinction avaient été complètement réorganisées. C'est comme si la carte d'une ville restait parfaitement exacte pour vous indiquer où se trouve la bibliothèque, mais que les directions de la boussole sur la carte avaient été pivotées de sorte que le « nord » pointait désormais là où l'« est » se trouvait auparavant. Les chercheurs ont mesuré ce décalage en comparant l'état interne du modèle avant et après l'entraînement, constatant que le changement n'était pas un simple ajustement mineur, mais une réorganisation substantielle du paysage interne du modèle.

L'étude conclut que, bien que la capacité à séparer le raisonnement de la mémoire soit robuste, l'idée selon laquelle cette capacité repose sur une direction unique et immuable est incorrecte. L'information persiste, mais le chemin spécifique qu'elle emprunte à travers l'esprit du modèle est fluide et change avec l'apprentissage. Cela suggère que pour les efforts futurs visant à guider l'intelligence artificielle à l'aide de ces directions internes, les scientifiques ne peuvent pas simplement trouver un chemin une fois pour toutes et supposer qu'il restera valide. Au contraire, ils doivent accepter que la carte elle-même est constamment redessinée, même si les points de repère restent en place. La stabilité du savoir ne garantit pas la stabilité du chemin utilisé pour y accéder.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →