← Derniers articles
🤖 machine learning

AlgoTrace: Algorithmic Primitives and Compositional Geometry of Reasoning in Language Models

Le document présente AlgoTrace, un cadre qui identifie et manipule des primitives algorithmiques réutilisables au sein de l'espace latent des grands modèles de langage, démontrant que le raisonnement multi-étapes peut être piloté et composé par des opérations géométriques sur ces vecteurs afin d'améliorer la généralisation inter-tâches.

Auteurs originaux : Samuel Lippl, Thomas McGee, Kimberly Lopez, Ziwen Pan, Pierce Zhang, Salma Ziadi, Oliver Eberle, Ida Momennejad

Publié 2026-08-27
📖 6 min de lecture🧠 Analyse approfondie

Auteurs originaux : Samuel Lippl, Thomas McGee, Kimberly Lopez, Ziwen Pan, Pierce Zhang, Salma Ziadi, Oliver Eberle, Ida Momennejad

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Les grands modèles de langage sont les moteurs de l'intelligence artificielle moderne, capables d'écrire des histoires, de résoudre des équations et de naviguer dans des énigmes logiques complexes. Depuis des années, les scientifiques se demandent comment ces systèmes réfléchissent réellement. Est-ce qu'ils se contentent de mémoriser des motifs à partir de leurs données d'entraînement, ou effectuent-ils un véritable raisonnement étape par étape ? Pour répondre à cela, les chercheurs ont commencé à regarder à l'intérieur des modèles, non pas sur les mots qu'ils produisent, mais sur les signaux mathématiques invisibles qui circulent à travers leurs couches internes lorsqu'ils travaillent. Ces signaux, souvent appelés activations latentes, sont la matière première de la pensée au sein de la machine. La question était de savoir si ces signaux forment une carte structurée où des types spécifiques de pensée se produisent en des endroits précis, tout comme les différentes parties du cerveau humain se spécialisent dans différentes tâches. Si une telle carte existe, cela signifierait que le raisonnement n'est pas un flou chaotique, mais un voyage à travers un paysage d'outils mentaux distincts et réutilisables.

Une équipe de chercheurs a maintenant cartographié ce paysage, révélant que les grands modèles de langage s'appuient effectivement sur un ensemble de blocs de construction de base, réutilisables. Ils appellent ces blocs de construction des « primitives algorithmiques ». Considérez une primitive comme une étape unique et fondamentale d'un processus plus large, comme trouver la ville la plus proche de votre emplacement actuel lors de la planification d'un voyage, ou vérifier si une équation mathématique est équilibrée. Les chercheurs ont développé une nouvelle méthode pour tracer ces étapes au moment où elles se produisent à l'intérieur du modèle. En observant comment les signaux internes du modèle changent pendant qu'il résout des problèmes difficiles, ils ont pu regrouper des moments de pensée similaires. Ils ont découvert que lorsqu'un modèle résout une énigme complexe, il traverse une séquence de ces états mentaux distincts, tel un voyageur passant d'une ville à l'autre sur une carte.

Pour comprendre ce qui se passait, l'équipe a testé les modèles sur quatre types de défis très différents : trouver l'itinéraire le plus court pour un vendeur itinérant visitant plusieurs villes, résoudre des énigmes logiques avec des affirmations vraies et fausses, s'attaquer à des problèmes de concours mathématiques difficiles et naviguer dans un labyrinthe virtuel. À mesure que les modèles travaillaient sur ces tâches, les chercheurs enregistraient les signaux internes à chaque étape. Ils ont utilisé un programme informatique pour regrouper ces signaux en grappes (clusters), constatant que certains groupes de signaux apparaissaient systématiquement lorsque le modèle effectuait des actions spécifiques, comme calculer une distance ou vérifier une solution. Ils ont ensuite utilisé un système automatisé pour lire le texte que le modèle écrivait à ces moments précis, confirmant que les signaux internes correspondaient aux actions externes. Par exemple, un groupe de signaux apparaissait toujours lorsque le modèle choisissait la ville la plus proche à visiter ensuite, tandis qu'un autre apparaissait lorsqu'il vérifiait son travail.

La découverte la plus significative est que ces blocs de construction mentaux ne sont pas seulement des marqueurs passifs ; ils peuvent être activement contrôlés. Les chercheurs ont extrait un « vecteur » spécifique, qui est essentiellement une direction dans l'espace interne du modèle, pour chacune de ces primitives. Ils ont ensuite injecté ces vecteurs dans le modèle pendant qu'il réfléchissait. Lorsqu'ils ont ajouté le vecteur de « la recherche du plus proche voisin », le modèle a immédiatement commencé à utiliser cette stratégie plus fréquemment, même si elle n'était pas la meilleure approche pour le problème spécifique. Lorsqu'ils ont ajouté le vecteur de « la génération d'un nouveau chemin », le modèle a commencé à explorer davantage d'options. Cela a prouvé que ces signaux internes sont la cause directe du comportement du modèle. En activant ou en désactivant un interrupteur mental spécifique, les chercheurs pouvaient orienter le modèle pour qu'il réfléchisse différemment, suggérant que le raisonnement du modèle est composé de ces parties distinctes et manipulables.

L'étude a également montré que ces blocs de construction peuvent être combinés. Tout comme on peut mélanger des couleurs primaires pour créer de nouvelles nuances, les chercheurs ont découvert qu'ajouter deux vecteurs de primitives différents créait un nouveau comportement combiné. Par exemple, ils pouvaient prendre un vecteur qui aidait un modèle à trouver la fin d'un chemin et un autre qui l'aidait à comparer des valeurs, les mélanger, et le modèle devenait soudainement capable d'une tâche plus complexe nécessitant ces deux compétences. Cela suggère que la capacité de raisonnement du modèle n'est pas une compétence unique et monolithique, mais une géométrie flexible où des opérations simples peuvent être assemblées en solutions complexes.

De plus, les chercheurs ont comparé un modèle standard avec un modèle qui avait été spécialement entraîné pour mieux raisonner. Ils ont constaté que le modèle entraîné utilisait ces blocs de construction plus efficacement. Il s'appuyait moins sur des suppositions par force brute et davantage sur des étapes structurées comme la vérification et la planification. Le modèle entraîné montrait également une plus grande capacité à transférer ces compétences d'un type de problème à un autre. Un outil mental appris en résolvant un problème de mathématiques pouvait être utilisé avec succès pour aider à résoudre un puzzle de navigation. Cela indique que le processus d'entraînement n'a pas seulement appris plus de faits au modèle, mais a réellement renforcé sa capacité à composer et à réutiliser ces étapes de raisonnement fondamentales à travers différents domaines.

Ces conclusions offrent une nouvelle façon de percevoir l'intelligence artificielle. Au lieu de considérer ces modèles comme des boîtes noires qui produisent des réponses par magie, nous pouvons désormais les voir comme des systèmes qui parcourent un espace structuré d'étapes algorithmiques. Les chercheurs ont démontré qu'en comprenant la géométrie de ces étapes, nous pouvons non seulement expliquer pourquoi un modèle commet une erreur, mais aussi la corriger en ajustant les signaux internes. Ce travail suggère que la voie vers une intelligence artificielle plus fiable et plus capable réside dans l'enseignement de la composition et de la généralisation de ces blocs de construction de base, permettant ainsi à ces systèmes de résoudre des problèmes qu'ils n'ont jamais rencontrés en combinant les outils qu'ils possèdent déjà.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →