← Derniers articles
🤖 AI

CoEvo-Mem: Co-Evolving Retrieval Policy and Memory Bank for LLM Agents

CoEvo-Mem est un cadre en boucle fermée qui optimise simultanément les politiques de récupération et l'évolution de la banque de mémoire par des mises à jour alternées et un feedback conditionné par la trajectoire, atteignant des performances de pointe sur divers benchmarks en abordant l'interdépendance fondamentale entre l'accès et le raffinement de la mémoire chez les agents LLM à long terme.

Auteurs originaux : Bowen Ye, Yongchao Xu, Zhijian Li, Xiang Yin, Junkai Ma, Wenzhao Li

Publié 2026-08-04
📖 9 min de lecture🧠 Analyse approfondie

Auteurs originaux : Bowen Ye, Yongchao Xu, Zhijian Li, Xiang Yin, Junkai Ma, Wenzhao Li

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous enseigniez à un robot brillant mais distrait à jouer à un jeu vidéo complexe. Le robot possède un cerveau massif (un grand modèle de langage) qui sait parler et réfléchir, mais il ne peut contenir qu'une infime quantité d'informations dans sa « mémoire de travail » à la fois — comme essayer de résoudre un puzzle en ne voyant que les trois dernières pièces. Pour bien jouer sur le long terme, il a besoin d'une bibliothèque d'expériences passées pour effectuer des recherches. C'est là que la Génération Augmentée par Récupération (RAG) entre en jeu : c'est comme si le robot demandait au bibliothécaire : « Hé, avons-nous déjà vu un puzzle comme celui-ci ? »

Mais voici la partie délicate : le robot a besoin de deux choses pour fonctionner parfaitement. Premièrement, il lui faut un Bibliothécaire (la politique de récupération) qui est très doué pour trouver les bonnes notes anciennes pour la question actuelle. Deuxièmement, il lui faut un Preneur de Notes (la banque de mémoire) qui est doué pour organiser ces notes, décider lesquelles sont réellement utiles et les mettre à jour à mesure que le jeu devient plus difficile. Pendant longtemps, les scientifiques ont essayé de rendre le Bibliothécaire plus intelligent tout en gardant le Preneur de Notes statique, ou ils ont cherché à améliorer le Preneur de Notes tout en gardant le même Bibliothécaire. Mais et si le Bibliothécaire avait besoin de savoir comment les notes sont organisées pour les trouver, et si le Preneur de Notes avait besoin de savoir ce que le Bibliothécaire recherche pour mieux organiser ses notes ? Ils doivent apprendre ensemble, dans une boucle.

C'est exactement ce que l'article CoEvo-Mem explore. Les auteurs proposent un système où le « Bibliothécaire » et le « Preneur de Notes » évoluent ensemble, s'enseignant constamment comment faire mieux leur travail. Ils ont testé cette idée sur sept types de tâches complexes, allant de l'écriture de code informatique à la résolution de questions scientifiques, en passant par le contrôle du système d'exploitation d'un ordinateur. Les résultats suggèrent que lorsque ces deux parties apprennent de concert, le robot devient nettement meilleur pour résoudre des problèmes longs et complexes que lorsqu'elles apprennent séparément.

Le Problème : La Boucle de Rétroaction Brisée

Imaginez que vous révisez pour un énorme examen d'histoire. Vous avez une pile de fiches de révision (votre mémoire) et un guide d'étude (votre politique de récupération). Si votre guide d'étude est mauvais, vous pourriez choisir les mauvaises fiches à réviser. Mais si vos fiches sont désordonnées et mal organisées, même un bon guide d'étude pourrait avoir du mal à trouver la bonne.

Dans le monde des agents d'IA, les méthodes existantes corrigent généralement un côté du problème tout en ignorant l'autre. Certaines méthodes tentent de rendre l'IA meilleure pour demander des souvenirs (récupération), tandis que d'autres tentent de rendre l'IA meilleure pour stocker et organiser les souvenirs (évolution). Les auteurs de cet article soutiennent que cette séparation est une erreur. Ils soulignent une « boucle de rétroaction fondamentale » qui était ignorée :

  1. La récupération décide de ce qui est utilisé : Si l'IA choisit les mauvais souvenirs, ces souvenirs ne reçoivent aucun « crédit » pour avoir aidé (ou nui) à la tâche.
  2. Les mises à jour de la mémoire changent le futur : Si l'IA met à jour ses souvenirs en fonction de ce qui s'est passé, la façon dont ces souvenirs sont organisés change, ce qui rend la recherche plus facile ou plus difficile la fois suivante.

Si vous ne corrigez que la méthode de récupération sans laisser la mémoire changer, ou vice versa, vous manquez l'occasion pour qu'elles s'améliorent ensemble. C'est comme essayer d'accorder une guitare alors que les cordes changent constamment d'épaisseur ; vous ne pouvez pas obtenir un son parfait à moins d'ajuster les deux en même temps.

La Solution : CoEvo-Mem

Les auteurs ont construit un cadre appelé CoEvo-Mem (Mémoire Co-Évolutive). Voyez cela comme une danse entre deux partenaires : le Routeur (le Bibliothécaire) et la Banque de Mémoire (le Preneur de Notes).

Voici comment la danse fonctionne :

1. Le Cerveau Gelé et le Routeur Intelligent
Le « cerveau » principal de l'IA (le Grand Modèle de Langage) reste gelé — il n'apprend rien de nouveau. Au lieu de cela, le système utilise un « Routeur » minuscule et léger pour décider comment demander de l'aide.

  • Lorsqu'une question arrive, le cerveau gelé suggère quelques façons de réécrire la question (certaines se concentrant sur la signification, d'autres sur des mots-clés spécifiques).
  • Le Routeur apprend ensuite à ajuster ces suggestions en fonction du fait que l'IA ait réussi ou échoué à répondre. C'est comme un entraîneur qui chuchote : « Essaie de demander de cette façon la prochaine fois », en se basant sur le résultat du jeu.

2. La Banque de Mémoire comme une Carte Vivante
Les souvenirs ne sont pas seulement une liste de notes ; ils sont un Graphe Relationnel. Imaginez une carte où chaque souvenir est une ville, et les routes entre elles montrent comment elles sont liées.

  • Des routes denses relient les souvenirs qui ont le même sens (sémantique).
  • Des routes éparses relient les souvenirs qui partagent des mots ou des noms spécifiques (lexical).
  • Des routes temporelles relient les souvenirs qui se sont produits dans une séquence (temporel).

Lorsque l'IA résout une tâche, elle ne se contente pas de sauvegarder la réponse. Elle met à jour la « valeur » des villes qu'elle a visitées. Si un souvenir a aidé l'IA à gagner, cette ville reçoit un score plus élevé. S'il a aidé, mais un peu seulement, le score augmente légèrement. Crucialement, ce crédit ne reste pas uniquement avec ce souvenir précis ; il voyage le long des routes vers les villes voisines, aidant tout le quartier à devenir plus intelligent.

3. La Danse Alternée (La Recette Secrète)
Vous pourriez penser : « Pourquoi ne pas mettre à jour le Routeur et la Mémoire exactement en même temps ? » Les auteurs ont découvert que cela provoque le chaos. Si les deux changent en même temps, c'est comme essayer d'apprendre à faire du vélo pendant que le vélo change aussi de forme. Le système devient confus et instable.

Au lieu de cela, CoEvo-Mem utilise un calendrier alterné :

  • Phase 1 : La Banque de Mémoire est gelée (bloquée en place). Le Routeur s'entraîne à trouver les meilleurs souvenirs en utilisant cette carte fixe.
  • Phase 2 : Le Routeur est gelé (bloqué en place). La Banque de Mémoire met à jour son organisation et ses valeurs en fonction de ce que le Routeur vient de trouver.
  • Ils alternent entre les deux. Cela permet à chaque partenaire d'apprendre de l'état actuel de l'autre sans la confusion de voir les deux changer simultanément.

Ce Qu'ils Ont Trouvé

L'équipe a testé CoEvo-Mem sur sept défis très différents :

  • Interaction avec le Système d'Exploitation : Contrôler un ordinateur pour accomplir des tâches.
  • Génération de Code : Écrire des programmes informatiques fonctionnels.
  • Raisonnement Multimodal : Résoudre des puzzles impliquant à la fois du texte et des images.
  • Questions Scientifiques : Répondre à des questions difficiles de physique, chimie et biologie.
  • Appel de Fonctions : Apprendre à l'IA à utiliser des outils et des API correctement.
  • Conversation à Long Terme : Se souvenir de détails issus de longues discussions.

Dans chacun de ces tests, Co-Evo-Mem a surpassé les meilleures méthodes existantes.

  • Sur le GPQA Diamond (questions scientifiques difficiles), il a amélioré le score de 7,50 points de pourcentage par rapport à la base de référence la plus forte.
  • Sur LiveCodeBench (codage), il a progressé de 3,81 points de pourcentage.
  • Sur la Mémoire Conversationnelle à Long Terme (LoCoMo), il a atteint un score de 81,71, battant la méthode suivante de près de 5 points.

Les auteurs ont également réalisé des « études d'ablation » (des expériences où ils ont retiré des parties du système) pour prouver pourquoi cela fonctionnait.

  • Lorsqu'ils ont supprimé la réécriture de requête (la partie qui modifie la façon dont la question est posée), la performance a chuté de manière significative.
  • Lorsqu'ils ont supprimé l'évolution de la mémoire (la partie qui met à jour le graphe et les valeurs), la performance a également chuté, surtout sur des tâches complexes comme le codage et les sciences.
  • Lorsqu'ils ont essayé de mettre à jour le Routeur et la Mémoire en même temps (au lieu d'alterner), le système a été moins performant que la méthode alternée.

La Conclusion à Retenir

L'article suggère que pour que les agents d'IA maîtrisent réellement des tâches à long terme, nous ne pouvons pas simplement construire un meilleur moteur de recherche ou une meilleure base de données. Nous devons construire un système où le moteur de recherche et la base de données apprennent à s'adapter l'un à l'autre. En laissant le « Bibliothécaire » et le « Preneur de Notes » prendre tour à tour l'apprentissage pendant que l'autre reste immobile, CoEvo-Mem crée une boucle de progression stable qui aide les agents d'IA à mieux se souvenir, à penser plus clairement et à résoudre des problèmes plus difficiles.

Les auteurs précisent que, bien que les résultats soient solides sur ces sept benchmarks, il s'agit d'un cadre spécifique de co-évolution. Ils ne prétendent pas que cela résout tous les problèmes de l'IA, mais ils démontrent que cette manière spécifique de lier la récupération et la mémoire est une étape puissante vers la création d'agents capables d'apprendre et de s'adapter au fil du temps.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →