← Derniers articles
💬 NLP

Total Recall at What Cost? Benchmarking the Serving Cost of Agentic Memory Systems

Cet article évalue les coûts de service et la précision de trois systèmes de mémoire agentiques par rapport à des stratégies standards, révélant que les coûts sont dictés par les comportements internes du système plutôt que par la seule longueur de la conversation, varient considérablement selon les différents modèles de base et systèmes, et impliquent un compromis où aucune solution unique n'optimise à la fois le coût et la précision.

Auteurs originaux : Natchanon Pollertlam, Witchayut Kornsuwannawit

Publié 2026-08-13
📖 7 min de lecture🧠 Analyse approfondie

Auteurs originaux : Natchanon Pollertlam, Witchayut Kornsuwannawit

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous parlez à un ami robot très intelligent, mais un peu étourdi. Vous discutez depuis des semaines, partageant des histoires, des projets et des secrets. Maintenant, vous voulez demander : « Tu te souviens de ce restaurant de pizza dont on a parlé il y a trois semaines ? » Si le robot n'a pas de mémoire, vous devez lui raconter toute l'histoire de votre amitié depuis le premier jour à chaque fois que vous posez une question. C'est comme envoyer un sac à dos énorme et lourd contenant chaque mot que vous avez déjà dit au robot juste pour poser une question simple. Cela fonctionne, mais cela devient vite lourd, lent et coûteux.

Pour corriger cela, les ingénieurs ont construit des « systèmes de mémoire » pour ces robots. Au lieu de porter tout le sac à dos, le robot prend des petites notes, des faits ou des résumés dans un carnet spécial. Quand vous posez une question, il se contente de feuilleter la bonne page et de lire la note. Cela semble parfait : plus léger, plus rapide et moins cher. Mais attention : écrire les notes, les organiser et trouver la bonne page demande aussi du travail. La grande question est : le robot fait-il des économies en utilisant le carnet, ou le coût de la gestion du carnet rend-il l'ensemble plus coûteux que de simplement porter le sac à dos lourd ? Cette étude plonge dans ce mystère exact, mesurant le prix réel de ces astuces de mémoire pour voir si elles en valent vraiment la peine.


Le Duel des Coûts de Mémoire

Dans cette étude, les chercheurs ont organisé une course massive pour voir combien il en coûte réellement pour maintenir la mémoire d'un chatbot en vie. Ils ne se sont pas contentés de deviner ; ils ont mené une expérience contrôlée avec trois différents « systèmes de mémoire » (considérez-les comme trois façons différentes d'organiser ce carnet) : Mem0, Hindsight et Mastra Observational Memory.

Pour que le test soit équitable, ils ont comparé ces systèmes de mémoire à deux stratégies extrêmes :

  1. La « Fenêtre Glissante » (La base bon marché) : C'est comme ne se souvenir que des 10 dernières choses que vous avez dites. C'est super bon marché, mais cela oublie tout le reste.
  2. Le « Transcript Complet » (La base coûteuse) : C'est la méthode du « sac à dos lourd ». Chaque fois que vous posez une question, le robot relit l'intégralité de l'historique de votre conversation depuis le tout premier mot.

Ils ont fait passer ces systèmes à travers des conversations allant jusqu'à 400 tours (soit 400 échanges de messages) et les ont testés sur 665 questions spécifiques pour voir si le robot se souvenait réellement des bonnes choses. Ils ont également testé deux « cerveaux » différents (modèles de base) pour le robot afin de voir si le type de cerveau changeait le coût.

La Grande Surprise : On ne peut pas prédire le prix

La première grande découverte est que vous ne pouvez pas simplement regarder la longueur de la conversation ou la taille des messages pour deviner le coût. Les chercheurs ont essayé de construire une formule mathématique simple pour prédire le coût en fonction de la longueur de la conversation et de la taille des messages.

  • Pour les stratégies du « Transcript Complet » et de la « Fenêtre Glissante », les mathématiques fonctionnaient parfaitement. Si vous connaissez le nombre de mots envoyés, vous savez exactement combien cela coûte.
  • Pour les Systèmes de Mémoire, les mathématiques ont échoué lamentablement. La formule a manqué le coût réel de 18 % à 69 %.

Pourquoi ? Parce que le coût d'un système de mémoire ne dépend pas seulement de la quantité de ce que vous dites, mais de ce que le système fait en interne pendant que vous parlez. Parfois, le système décide d'écrire un long résumé, d'autres fois, il ne saisit qu'un fait rapide. Parfois, il réorganise tout son carnet. Ces décisions internes sont dictées par le contenu de la conversation, et non par sa simple longueur. C'est comme essayer de prédire le coût d'un voyage routier en regardant simplement la carte, sans savoir si le conducteur va s'arrêter pour un déjeuner gastronomique ou juste prendre une barre de céréales. Le « déjeuner » (le traitement interne) varie énormément, rendant la facture totale imprévisible.

Le « Point de Rentabilité » : Quand le carnet devient-il rentable ?

Les chercheurs ont posé une question cruciale : À quel moment l'utilisation d'un système de mémoire devient-elle moins chère que de simplement relire tout l'historique ?

La réponse est : Cela dépend entièrement du système et du cerveau du robot.

  • Mastra Observational Memory était le champion de la vitesse. Dans certains cas, il était moins cher que la méthode du « Transcript Complet » dès le premier tour (Tour 0).
  • Mem0 a mis un peu plus de temps, atteignant généralement l'équilibre autour du Tour 82, mais seulement si les messages étaient raisonnablement longs.
  • Hindsight était le plus lent. Dans de nombreux cas, il n'est pas devenu moins cher que la méthode du « Transcript Complet », même après 400 tours. En fait, pour certaines configurations, il était encore plus coûteux à la fin du test.

Cela signifie que si vous avez une conversation courte, utiliser un système de mémoire complexe peut en réalité coûter plus cher que de simplement renvoyer l'historique de la discussion. Vous devez parler pendant un certain temps (le « point de rentabilité ») avant que le système de mémoire ne commence à vous faire économiser de l'argent.

Précision vs Coût : Pas de repas gratuit

L'étude a également vérifié si les systèmes de mémoire étaient réellement bons pour répondre aux questions. Les résultats ont montré une large gamme de performances :

  • La précision variait de 21 % à 54 %.
  • Mem0 présentait les variations d'exactitude les plus importantes, réussissant bien avec certains cerveaux de robot et moins bien avec d'autres.
  • Hindsight était généralement le plus précis (souvent au-dessus de 50 %), mais c'était aussi le plus coûteux à exploiter.
  • Mastra était un performeur intermédiaire, mais souvent le plus rentable lorsqu'on prenait en compte le nombre de bonnes réponses données.

Les chercheurs ont découvert que le choix du « cerveau » du robot (le modèle de base) comptait tout autant que le choix du système de mémoire. Un système de mémoire qui était bon marché sur un cerveau de robot pouvait être coûteux sur un autre.

Le Verdict Final

L'article conclut qu'il n'existe pas un seul « meilleur » système de mémoire.

  • Si vous voulez l'option la moins chère par réponse correcte sur un cerveau de robot spécifique, Mastra sur le cerveau gpt-oss-20b était le vainqueur (coûtant environ 0,028 $ par réponse correcte à 100 tours).
  • Si vous utilisez un autre cerveau de robot (Gemma 4 26B A4B), Mem0 devient l'option la moins chère.
  • Hindsight, bien qu'accurate, est souvent trop coûteux pour en valoir la peine, à moins que la conversation ne soit très longue.

La principale conclusion est que vous ne pouvez pas choisir un système de mémoire simplement parce qu'il a l'air cool. Vous devez examiner votre situation spécifique : Quelle sera la durée de la conversation ? Quelle est la taille des messages ? Et quel cerveau de robot utilisez-vous ? Ce n'est qu'alors que vous pourrez savoir si le système de mémoire vous fera économiser de l'argent ou s'il ajoutera simplement des frais à votre facture. La « mémoire totale » d'un système de mémoire a un prix, et ce prix est bien plus complexe que le simple décompte des mots que vous tapez.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →