The Hidden Footprint: Making Storage a First-Class Metric for LLM Agent Evaluation
Cet article introduit AgentFootprint, un benchmark révélant que l'empreinte de stockage persistant des agents LLM varie considérablement selon les frameworks et les configurations indépendamment de la précision des tâches, tout en démontrant que le stockage adressable par contenu peut réduire significativement ce surcoût sans compromettre la reconstructibilité des données.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Imaginez que vous regardez un brillant détective robot résoudre un mystère. Il lit des indices, pose des questions et écrit sa réponse finale. Tout le monde applaudit lorsque le détective trouve la bonne réponse, et l'on vérifie à quelle vitesse il a réfléchi et combien il a coûté à faire fonctionner. Mais personne ne regarde le désordre que le détective laisse derrière lui sur le sol.
Ce document, intitulé The Hidden Footprint (L'empreinte cachée), est comme un rapport de concierge. Il demande : « Quand le détective a fini, quel tas de déchets laisse-t-il dans la pièce ? »
La grande surprise : Le désordre est énorme
La conclusion principale est choquante : Deux détectives peuvent résoudre exactement le même mystère parfaitement, mais l'un laisse derrière lui une pile de déchets 15,7 fois plus grande que l'autre.
Voyez cela comme ceci : Vous et votre ami avez tous deux cuisiné un parfait gâteau au chocolat. Vous présentez le gâteau (le résultat). Mais alors que vous venez de nettoyer le plan de travail, votre ami a laissé derrière lui 15 bols, 30 tasses de farine et une montagne d'emballages collants. Le gâteau est identique, mais la cuisine de votre ami est une zone de catastrophe.
Dans le monde réel, ce « déchet » n'est pas seulement du papier ; ce sont des octets numériques stockés sur un disque dur. Les chercheurs ont découvert que pour une seule tâche, certains frameworks laissent derrière eux 131 Mo de données, alors que la réponse réelle (le « gâteau livré ») ne pesait que 2,6 Mo. Cela signifie que le « résidu » du framework était 24 033 fois plus grand que le travail qu'il était censé accomplir !
L'astuce du double comptage « invisible »
Voici la partie délicate : Si vous comptez simplement les fichiers sur l'ordinateur, vous pourriez penser que le désordre n'est pas si grave. Le papier soutient que le comptage standard est un piège.
Imaginez que vous écriviez le mot « Bonjour » sur une feuille de papier. Ensuite, vous photocopiez cette feuille, mais la photocopieuse ajoute un minuscule tampon à l'« encre invisible » sur chaque copie. Si vous comptez le papier, vous voyez une feuille. Mais si vous regardez l'encre, vous voyez le mot « Bonjour » écrit douze fois.
Les chercheurs ont découvert qu'en raison de la manière dont les ordinateurs enregistrent les données (en utilisant des choses comme les pages « SQLite » et l'échappement « JSON »), la même information est enregistrée encore et encore, cachée à l'intérieur du système.
- Le comptage naïf disait : « Oh, il y a peu de duplication. »
- Le comptage intelligent du papier disait : « En fait, le même contenu est stocké 12,1 fois ! »
Ils ont prouvé que si vous ne regardez pas à l'intérieur de l'« encre invisible », vous manquez la taille réelle du désordre par une marge énorme.
Le problème de la « croissance »
Le papier teste également ce qui se passe lorsqu'un détective doit vérifier le même indice 200 fois.
- Certains frameworks (comme LangGraph et AutoGen) agissent comme un écureuil qui n'oublie jamais rien. Chaque fois qu'il vérifie l'indice, il réécrit l'intégralité de l'historique. Cela provoque une croissance de l'espace de stockage de manière superlinéaire (de plus en plus vite). Après 200 tours, ils ont laissé derrière eux 323 Mo de données pour un seul petit fichier.
- D'autres frameworks (comme OpenAI Agents) agissent comme un preneur de notes intelligent. Ils n'écrivent que les nouveautés. Leur stockage a grandi lentement, presque en ligne droite.
Le papier a mesuré ce taux de croissance (appelé ) et a constaté qu'il variait de 0,73 (en diminution !) à 1,95 (explosion de la taille).
Un plus gros désordre signifie-t-il un détective plus intelligent ?
Vous pourriez penser : « Peut-être que le détective désordonné est juste plus prudent, donc il est plus intelligent ? »
Le papier dit : Non.
Ils ont examiné 108 soumissions réelles provenant d'un célèbre défi de codage (SWE-bench). Ils ont découvert que la quantité de données exportées par ces systèmes variait de 1 617 fois (des fichiers minuscules aux fichiers énormes). Mais voici le plus frappant : Il n'y avait aucun lien entre la taille du désordre et la capacité du système à résoudre le problème.
En fait, la corrélation était si faible qu'elle était pratiquement nulle. Un système pouvait laisser derrière lui une montagne de données et échouer, ou laisser une empreinte minuscule et réussir. Le papier écarte explicitement l'idée que « plus de stockage = de meilleures performances ».
La « Gomme Magique » (Mais ne l'achetez pas encore)
Les chercheurs n'ont pas seulement souligné le problème ; ils ont montré un moyen de le résoudre, mais ils précisent qu'il s'agit d'une preuve de concept, et non d'un produit fini.
Ils ont construit un « magasin adressé par le contenu » (content-addressed store). Imaginez une bibliothèque où, au lieu de mettre chaque livre sur une étagère, vous prenez une photo de l'empreinte digitale unique du livre. Si deux livres sont identiques, vous ne gardez qu'une seule photo et une note disant « Celui-ci est le même que celui-là ».
Lorsqu'ils ont appliqué cette « gomme magique » aux frameworks désordonnés :
- Cela a réduit le stockage de 4,8 à 32,7 fois.
- Crucialement, ils ont prouvé qu'en supprimant toutes ces données, vous pouviez toujours reconstruire parfaitement l'intégralité de l'historique de la conversation. Le « score » pour pouvoir rejouer les pensées du détective est resté exactement le même.
Ce que le papier écarte
- Il écarte l'idée que nous devrions simplement ignorer le stockage sous prétexte qu'il est « bon marché ». Le papier soutient que le stockage est une dette persistante qui s'accumule avec le temps, contrairement au coût de fonctionnement de l'IA qui disparaît une fois la tâche terminée.
- Il écarte l'idée que les compteurs de fichiers standards sont précis. Ils ont montré que le comptage simple manque la duplication cachée à l'intérieur du code du système.
- Il écarte l'idée que des traces de données plus grandes signifient de meilleurs résultats. Les données ne montrent aucun lien avec le succès.
À quel point sont-ils sûrs ?
Les auteurs sont très sûrs des mesures qu'ils ont prises. Ils ont mené 1 061 expériences dans des environnements isolés et propres (sandboxes) pour s'assurer que rien d'autre n'interfère. Ils ont testé 8 frameworks différents (comme LangGraph, CrewAI et AutoGen) en utilisant exactement les mêmes tâches et modèles.
Ils n'ont pas seulement deviné ; ils ont mesuré. Ils ont constaté que, dans des conditions identiques, la quantité de données laissées derrière elles variait de 15,7 fois entre les meilleurs et les moins bons performeurs. Ils ont également montré que cette différence ne provient pas du fait qu'un framework est plus « intelligent » pour résoudre les tâches, mais de la manière dont ils sont construits pour sauvegarder les données.
Ce qu'il faut retenir
Le papier conclut que nous devons commencer à mesurer l'« empreinte » des agents IA de la même manière que nous mesurons leur vitesse ou leur coût. Actuellement, nous laissons certains systèmes laisser derrière eux des montagnes de déchets numériques tandis que d'autres ne laissent presque rien, et il s'avère que les systèmes désordonnés ne font pas un meilleur travail.
Les auteurs suggèrent que si nous voulons faire fonctionner ces agents à une échelle massive (comme une flotte de 10 000 robots par jour), la différence entre un framework « propre » et un framework « désordonné » pourrait signifier qu'il faudra 3 Go de stockage ou 51 Go chaque jour. C'est une différence énorme pour un problème qui, comme ils l'ont montré, ne rend même pas le robot plus intelligent.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.