← Derniers articles
💬 NLP

MILES: Modular Instruction Memory with Learnable Selection for Self-Improving LLM Reasoning

MILES est un nouveau cadre pour le raisonnement auto-amélioré des LLM qui étend dynamiquement une mémoire modulaire de paires d'instructions étape par étape et emploie un mécanisme de sélection apprenable, du grossier au fin, pour optimiser la composition de la mémoire et la précision du raisonnement sous des contraintes réalistes de temps d'exécution.

Auteurs originaux : Ruilin Tong, Dong Gong

Publié 2026-07-09
📖 7 min de lecture🧠 Analyse approfondie

Auteurs originaux : Ruilin Tong, Dong Gong

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

La vue d'ensemble : Le « Cahier Intelligent » pour l'IA

Imaginez que vous avez un ami brillant mais têtu (l'IA) qui est excellent pour résoudre des énigmes, mais qui a une mémoire catastrophique. Chaque fois que vous lui posez un nouveau problème de mathématiques, il agit comme s'il ne l'avait jamais vu auparavant. Il le résout, mais si vous lui posez une question similaire plus tard, il doit tout reprendre depuis le début.

D'habitude, pour rendre cet ami plus intelligent, vous devriez le renvoyer à l'école pendant des années pour qu'il réapprenne tout (c'est ce qu'on appelle l'« entraînement » ou la mise à jour des paramètres du modèle). Mais et si votre ami était un livre fermé que vous ne pouvez pas renvoyer à l'école ? Vous ne pouvez pas modifier son cerveau.

MILES est une nouvelle façon d'aider cet ami à devenir plus intelligent pendant qu'il travaille, sans changer son cerveau. Cela lui donne un cahier dynamique et apprenable dans lequel il peut écrire et consulter en temps réel.

Le problème des anciens cahiers

Les tentatives précédentes pour donner une « mémoire » à l'IA présentaient deux défauts principaux :

  1. Le cahier de la « Solution Entière » : Certaines méthodes stockaient des réponses entières à des problèmes passés. Si vous posiez une question à 90 % similaire à une ancienne, cela fonctionnait très bien. Mais si la question était légèrement différente (un problème « nouveau »), l'ancienne réponse était inutile. C'était comme essayer d'utiliser une recette de « Tarte aux Pommes » pour cuisiner un « Muffin aux Myrtilles ».
  2. Le cahier « Heuristique » : D'autres méthodes stockaient de petites étapes (comme « diviser par 2 » ou « vérifier les unités »). Mais l'IA devait deviner quelle étape utiliser ensuite en regardant simplement la similitude des mots. C'était comme un chef qui attrape un pot d'épices au hasard parce que l'étiquette ressemble à celle dont il a besoin, en espérant que ça marche.

La solution MILES : Un système « Modulaire » et « Apprenable »

MILES change la donne en traitant le raisonnement comme un ensemble de LEGO plutôt que comme un seul bloc de béton.

1. Les blocs de construction : « Sous-objectifs » et « Sous-instructions »

Au lieu de stocker des réponses entières, MILES décompose les problèmes en minuscules briques réutilisables.

  • Le Sous-objectif (L'étiquette) : Une courte description de ce qui doit être fait ensuite (ex : « Simplifier la fraction »).
  • La Sous-instruction (La brique) : Un conseil spécifique en langage naturel sur comment le faire (ex : « Divisez le numérateur et le dénominateur par leur plus grand commun diviseur »).

Considérez cela comme une boîte à outils où chaque outil possède une étiquette claire.

2. Le « Sélecteur Intelligent » (La tête apprenable)

C'est la partie magique. Dans le passé, l'IA saisissait simplement l'outil qui ressemblait le plus au problème actuel. MILES donne à l'IA un assistant personnel (une « tête de sélection ») pour chaque outil de la boîte.

  • Comment il apprend : Lorsque l'IA résout un problème avec assurance (elle trouve la bonne réponse), MILES regarde en arrière les étapes qu'elle a suivies. Il demande : « Hé, quand nous avons utilisé l'outil 'Simplifier la Fraction', est-ce que cela nous a aidés à obtenir la bonne réponse ? »
  • L'entraînement : Si la réponse est « Oui », l'assistant apprend à faire confiance à cet outil pour des situations similaires. Si la réponse est « Non », l'assistant apprend à éviter cet outil.
  • Pas besoin d'école : Le cerveau de l'IA reste figé. Seuls ces petits « assistants » (qui sont de très petits programmes informatiques) sont mis à jour.

3. Le processus de recherche en deux étapes

Lorsque l'IA est confrontée à un nouveau problème, MILES utilise une recherche « du grossier au fin », comme chercher un livre dans une bibliothèque :

  • Étape 1 (La recherche grossière) : L'IA scanne rapidement les étiquettes (Sous-objectifs) pour trouver quelques outils prometteurs. C'est comme parcourir le rayon « Mathématiques » et attraper quelques livres qui pourraient être pertinents.
  • Étape 2 (L'examen de l'expert) : Les « assistants » (têtes de sélection) prennent ces quelques candidats et leur attribuent un score basé sur leur expérience passée. « Attendez, cet outil a très bien fonctionné pour l'algèbre mais a échoué pour la géométrie. Choisissons l'autre. »

Comment cela fonctionne en temps réel (Le flux « Confiance vs Incertitude »)

Le système fonctionne selon deux modes selon le degré de certitude de l'IA :

  1. Le mode « Confiance » (Phase d'apprentissage) :
    Si l'IA résout un problème facilement et obtient la bonne réponse, elle traite cela comme une « session d'entraînement ». Elle décompose ses étapes réussies, les enregistre comme de nouvelles briques LEGO dans le cahier, et enseigne à ses assistants quels outils ont le mieux fonctionné. Le cahier s'enrichit à chaque succès.

  2. Le mode « Incertitude » (Phase d'aide) :
    Si l'IA est bloquée ou incertaine, elle arrête de deviner. Elle ouvre le cahier, demande conseil à ses assistants et utilise les meilleurs outils pour guider sa réflexion. C'est comme un élève qui lève la main pour demander un indice au professeur lorsqu'il est coincé.

Pourquoi c'est important (Les résultats)

L'article a testé MILES sur des examens difficiles de mathématiques et de sciences (comme l'AIME et le MATH-500).

  • Meilleure précision : Il résout systématiquement plus de problèmes correctement que les autres méthodes utilisant la mémoire ou la recherche.
  • Efficacité : Il ne gaspille pas autant de puissance de calcul à tenter des devinettes aléatoires ; il utilise la mémoire « apprise » pour choisir le bon chemin plus rapidement.
  • Transférabilité : Le cahier construit par un modèle d'IA peut en réalité aider un autre modèle d'IA à résoudre des problèmes. C'est comme si un chef étoilé écrivait un livre de cuisine qu'un jeune chef pourrait ramasser et utiliser immédiatement, même s'ils ne se sont jamais rencontrés.

Résumé par analogie

Imaginez que vous jouez à un jeu vidéo.

  • L'ancienne méthode : Vous essayez de battre chaque niveau en devinant. Si vous mourez, vous recommencez.
  • L'ancienne méthode de mémoire : Vous gardez une liste de « Stratégies Gagnantes » pour des niveaux spécifiques. Si vous voyez le Niveau 5, vous utilisez la stratégie du Niveau 5. Si vous voyez le Niveau 5.1, vous êtes bloqué.
  • La méthode MILES : Vous gardez un guide de stratégie dynamique qui se met à jour tout seul. Quand vous battez un niveau, le guide note automatiquement exactement quel mouvement a le mieux fonctionné pour cette situation précise. La prochaine fois que vous ferez face à un saut difficile, le guide ne se contente pas de vous montrer une liste ; il possède un « filtre intelligent » qui dit : « Basé sur vos victoires passées, le mouvement 'Double Saut' a 90 % de chances de fonctionner ici. »

MILES permet à l'IA d'accumuler de l'expérience et de devenir plus intelligente au fil du temps, non pas en réentraînant son cerveau, mais en apprenant à mieux utiliser sa propre bibliothèque croissante d'astuces et de conseils.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →