← Derniers articles
🤖 AI

Unlocking the Working Memory of Large Language Models for Latent Reasoning

L'article présente le Raisonnement en Mémoire (RiM), une méthode de raisonnement latent économe en calcul qui remplace la génération de pensées autorégressive par des blocs de mémoire fixes, permettant aux grands modèles de langage d'utiliser la mémoire de travail pour un raisonnement interne sans externaliser les étapes intermédiaires.

Auteurs originaux : Lukas Aichberger, Sepp Hochreiter

Publié 2026-05-29
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Lukas Aichberger, Sepp Hochreiter

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Le Problème Central : « Penser à voix haute » est lent

Imaginez que vous essayez de résoudre un problème mathématique complexe. Actuellement, la plupart des modèles d'IA (les grands modèles de langage) sont contraints de « penser à voix haute ». Pour résoudre un problème, ils doivent écrire chaque étape de leur processus de pensée, en phrases complètes, avant de pouvoir vous donner la réponse finale.

  • L'Analogie : C'est comme un élève passant un examen qui est obligé de rédiger un essai complet expliquant chaque calcul qu'il effectue avant de pouvoir écrire le chiffre final.
  • Le Problème : C'est inefficace. L'IA consacre beaucoup de temps et de puissance de calcul à générer des mots (grammaire, ponctuation, phrases de liaison) juste pour accéder à la logique. C'est comme conduire une voiture où vous devez vous arrêter à chaque feu rouge pour écrire un poème sur la couleur rouge avant de pouvoir repartir.

La Solution Humaine : Le « Brouillon Interne »

Les humains ne font généralement pas cela. Lorsque nous résolvons des problèmes difficiles, nous utilisons notre mémoire de travail. Nous retenons les nombres et la logique dans notre tête, nous les manipulons intérieurement, et nous ne prononçons que le résultat final. Nous n'avons pas besoin de dire chaque étape à voix haute pour faire des maths.

Le papier soutient que l'IA devrait pouvoir faire la même chose : disposer d'un espace de travail interne où elle peut effectuer le gros du travail sans « parler » ses pensées.

La Nouvelle Méthode : Le Raisonnement en Mémoire (RiM)

Les auteurs introduisent une méthode appelée Raisonnement en Mémoire (RiM). Au lieu de faire générer du texte à l'IA pour ses pensées, ils lui donnent un ensemble de blocs de mémoire fixes.

  • L'Analogie : Imaginez que l'IA se voit remettre un ensemble de post-it magiques et vides (les blocs de mémoire) placés juste à côté de la question.
    • L'Ancienne Façon : L'IA écrit une longue histoire sur une feuille de papier pour résoudre le problème.
    • La Façon RiM : L'IA écrit ses pensées directement sur les post-it. Ces notes sont spéciales ; ce ne sont pas des mots que vous lisez, mais elles contiennent le sens des pensées.
    • La Magie : Parce que ces notes sont pré-placées et fixes, l'IA peut les examiner toutes et traiter les informations d'un seul coup (en une seule « passe avant »), plutôt que de les écrire une par une.

Comment ils ont appris à l'IA à l'utiliser (L'Entraînement en Deux Étapes)

On ne peut pas simplement donner un carnet vide à une IA et s'attendre à ce qu'elle sache l'utiliser. Les auteurs ont utilisé un curriculum d'entraînement en deux étapes, comme apprendre à un enfant à faire du vélo avec des roulettes, puis les retirer.

Étape 1 : La Phase des « Roulettes »

  • Objectif : Apprendre à l'IA que les blocs de mémoire servent à penser.
  • Fonctionnement : On montre à l'IA une question et les blocs de mémoire. Après chaque bloc, l'enseignant demande : « Quelle est l'étape suivante du raisonnement ? » L'IA doit utiliser les informations contenues dans les blocs de mémoire pour prédire l'étape écrite suivante.
  • Résultat : L'IA apprend à stocker les « pensées » à l'intérieur des blocs de mémoire car elle sait qu'elle sera immédiatement testée sur eux. Elle apprend à transformer les blocs en un espace de travail fonctionnel.

Étape 2 : La Phase du « Monde Réel »

  • Objectif : Apprendre à l'IA à résoudre tout le problème en utilisant uniquement les blocs.
  • Fonctionnement : L'enseignant arrête de demander les étapes intermédiaires. Désormais, après chaque bloc de mémoire, on demande à l'IA : « Quelle est la réponse finale ? »
  • Résultat : L'IA apprend à affiner sa réponse au fur et à mesure qu'elle remplit davantage de blocs de mémoire. Elle arrête de « penser à voix haute » et commence à « penser en mémoire », utilisant les blocs pour se rapprocher de la bonne réponse à chaque étape.

Les Résultats : Plus rapide et plus intelligent

Le papier a testé cette méthode sur des problèmes mathématiques (GSM8K et GSM-Hard) en utilisant différentes tailles de modèles d'IA.

  1. Vitesse : Parce que l'IA n'a pas à générer de mots pour ses pensées, elle est beaucoup plus rapide. Elle traite les blocs de mémoire d'un seul coup. Le papier note que RiM est environ 7 fois plus rapide que les meilleures méthodes précédentes de « pensée silencieuse » et 27 fois plus rapide que les méthodes qui écrivent des chaînes de raisonnement complètes.
  2. Précision : Malgré sa vitesse accrue, l'IA a obtenu des scores meilleurs ou équivalents par rapport aux méthodes qui écrivent leurs pensées. Cela prouve que l'IA a réussi à apprendre à utiliser les blocs de mémoire comme un véritable espace de travail.
  3. Efficacité : Elle utilise moins de puissance de calcul car elle saute la partie « frappe au clavier » de la pensée.

Résumé

Le papier présente un moyen de faire « penser silencieusement » l'IA en lui donnant des blocs de mémoire fixes au lieu de la contraindre à écrire ses pensées. En entraînant l'IA en deux étapes (d'abord pour utiliser les blocs pour les étapes, puis pour les utiliser pour la réponse finale), ils ont créé un système qui est aussi intelligent que les modèles actuels mais nettement plus rapide et plus efficace, imitant la façon dont les humains utilisent leur mémoire de travail pour résoudre des problèmes sans avoir besoin de prononcer chaque pensée à voix haute.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →