← Derniers articles
💻 computer science

Tessera: Lossless-First, Vendor-Free Session Compression for Long-Horizon Agent Harnesses

Tessera est un proxy de compression de session sans fournisseur et privilégiant l'absence de perte, qui réduit les coûts de jetons et la latence pour les agents LLM à horizon long en employant un système de mémoire à trois niveaux pour réécrire de manière déterministe l'historique de la conversation tout en préservant un accès vérifiable aux données originales via le Model Context Protocol.

Auteurs originaux : Mohammad Mosafer

Publié 2026-09-14
📖 9 min de lecture🧠 Analyse approfondie

Auteurs originaux : Mohammad Mosafer

Article original sous licence CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Dans le monde de l'intelligence artificielle, un type spécifique de logiciel appelé agent agit comme un travailleur numérique. Ces agents ne se contentent pas de discuter ; ils accomplissent des tâches en utilisant des outils, en lisant des fichiers et en exécutant des commandes. Pour ce faire, ils s'appuient sur un grand modèle de langage, un puissant programme informatique qui comprend et génère le langage humain. Cependant, ces modèles ont une limite de mémoire. Chaque fois que l'agent effectue une étape, il doit renvoyer l'intégralité de l'historique de sa conversation au modèle afin que celui-ci sache ce qui s'est passé jusqu'à présent. À mesure qu'une session s'allonge, impliquant des dizaines de fichiers et des centaines de commandes, cet historique devient massif. Tout envoyer à chaque fois est lent et coûteux.

Pour résoudre ce problème, les ingénieurs ont essayé deux astuces principales. La première consiste simplement à couper les parties les plus anciennes de la conversation, en ne conservant que les messages les plus récents. Cela économise de l'espace mais risque de supprimer des faits importants, comme un mot de passe ou l'emplacement d'un fichier, dont l'agent pourrait avoir besoin plus tard. La seconde astuce consiste à demander au modèle de résumer les parties anciennes sous la forme d'un récit plus court. C'est également risqué car le résumé peut omettre un détail crucial ou en inventer un nouveau, et il n'y a aucun moyen de vérifier si le résumé est exact. Les deux méthodes imposent un choix entre l'économie d'argent et la préservation de la vérité.

Un chercheur nommé Mohammad Mosafer a proposé une approche différente qui refuse de faire ce choix. Il a construit un système appelé Tessera, qui agit comme un intermédiaire intelligent entre l'agent et le modèle. Au lieu de supprimer les anciennes informations ou de les réécrire sous forme de résumé, Tessera compresse la conversation en identifiant et en supprimant les copies exactes et les quasi-doublons. Il garde le texte original en sécurité dans une zone de stockage séparée et remplace les parties répétées dans la conversation principale par de minuscules pointeurs précis. Si l'agent a besoin de revoir l'ancien texte, il peut le demander, et le système récupère l'original exact instantanément. Cette méthode permet à l'agent de travailler avec un historique de conversation beaucoup plus court sans perdre aucun fait et sans dépendre de la technologie d'une entreprise spécifique.

Le cœur du problème réside dans la manière dont ces agents fonctionnent. Lorsqu'un agent exécute une commande, il obtient un résultat. S'il exécute la même commande à nouveau, il obtient souvent exactement le même résultat. Dans une session longue, l'agent peut lire le même fichier journal plusieurs fois ou vérifier le même statut de manière répétée. Comme l'agent envoie tout l'historique à chaque fois, il finit par envoyer les mêmes gros blocs de texte encore et encore. Tessera remarque cette répétition. Il scanne l'historique de la conversation et identifie quand un morceau de texte est identique à quelque chose envoyé précédemment. Au lieu d'envoyer à nouveau le texte complet, il envoie un marqueur court qui dit : « Ceci est le même texte qu'il y a trois étapes ». Le modèle peut toujours lire le marqueur et comprendre le contexte, mais la quantité de données envoyées est considérablement réduite.

Tessera va plus loin que la simple recherche de copies exactes. Il recherche également des textes qui sont presque identiques, comme un fichier journal qui n'a changé que de quelques mots. Lorsqu'il trouve ces quasi-doublons, il envoie une petite note décrivant uniquement les changements, plutôt que le fichier entier. Il gère également les gros blocs de données, comme de longues listes de nombres ou de code, en supprimant le formatage inutile et en ne gardant que la structure essentielle. Tout cela se déroule sans utiliser un grand modèle de langage pour prendre des décisions. Le système utilise des règles déterministes simples, ce qui signifie qu'il produira toujours le même résultat pour une même entrée. Cela rend le processus rapide et fiable, n'ajoutant que quelques millisecondes au temps nécessaire pour envoyer un message.

Pour tester si ce système fonctionne réellement, le chercheur a créé un environnement contrôlé. Il a construit un générateur qui crée des sessions d'agents fictives remplies de données réalistes, telles que des réponses JSON, des journaux de service et des sorties de commandes. Dans ces sessions, il a implanté des faits spécifiques et uniques, comme un code aléatoire ou un paramètre spécifique, à des positions aléatoires. Il a ensuite fait passer les sessions par Tessera et a mesuré combien de ces faits implantés avaient survécu dans l'historique compressé. Il a comparé cela à d'autres méthodes qui suppriment simplement les messages anciens ou ne conservent que les plus récents. Les résultats étaient clairs. Lorsque le système a compressé la conversation à environ 29 % de sa taille originale, il a conservé 61,8 % des faits dans l'historique principal. En revanche, les autres méthodes, qui étaient contraintes de conserver la même quantité d'espace, n'ont conservé qu'environ 26 à 30 % des faits.

Le système comprend également un moyen de récupérer les informations manquantes si elles sont nécessaires. C'est ce qu'on appelle un niveau de rappel (recall tier). Si l'agent pose une question spécifique sur une partie plus ancienne de la conversation, le système peut rechercher dans son stockage sécurisé des textes originaux et ramener le passage exact. Lorsque cette fonctionnalité est utilisée, le système peut récupérer 99,5 % des faits, même s'ils n'étaient pas dans l'historique compressé principal. Cela signifie que l'agent peut travailler avec un historique minuscule et efficace, tout en ayant accès aux détails complets dès que nécessaire. Les chercheurs ont constaté que cette récupération fonctionne mieux lorsque l'agent se souvient du contexte de l'événement ancien, mais elle fonctionne également bien même avec des questions vagues.

L'étude a également examiné le comportement de différents types d'agents. Certains agents, comme ceux conçus pour corriger des bugs logiciels, ont tendance à répéter des commandes et à voir les mêmes résultats souvent. Pour ces agents, le système a constaté que près de 15 % de la conversation était composée de doublons exacts. D'autres agents, utilisant différents modèles, se répètent rarement. Le système s'est adapté à ces deux situations, prouvant qu'il n'a pas besoin d'être ajusté pour un type d'agent spécifique pour fonctionner. Il supprime simplement ce qui est présent, qu'il s'agisse de beaucoup de répétitions ou de très peu. Le temps nécessaire pour compresser les données est négligeable, ajoutant moins de huit millisecondes par requête, ce qui est bien inférieur au temps nécessaire au modèle pour générer une réponse.

L'une des découvertes les plus importantes est que cette méthode ne nécessite pas de renoncer à la précision. Contra-irement à la synthèse, qui peut perdre des détails ou changer les significations, Tessera garde chaque octet de texte original en sécurité. Si un fait est retiré de la vue principale pour gagner de l'espace, il n'est pas disparu ; il est juste caché derrière une poignée (handle) qui peut être ouverte à tout moment. Cela rend le système entièrement auditable. Un ingénieur peut regarder l'historique compressé et savoir exactement ce qui a été retiré et où trouver l'original. Il s'agit d'un changement significatif par rapport aux méthodes actuelles, qui reposent souvent sur la capacité du modèle à deviner ce qui est important, un processus difficile à vérifier.

Les chercheurs ont testé leur système par rapport à plusieurs autres façons de gérer la mémoire. Ils ont constaté que le simple fait de conserver les messages les plus récents, une pratique courante, était la méthode la moins efficace pour conserver les faits. Même une méthode qui conservait des messages de manière aléatoire était plus performante que la suppression des messages les plus anciens, mais elle ne pouvait toujours pas égaler la précision de Tessera. La clé du succès de Tessera est qu'il ne jette pas des messages entiers. Au lieu de cela, il « dégraisse » l'intérieur des messages, en gardant l'en-tête et la queue des longs textes et en remplaçant le milieu par un pointeur. Cela permet à l'agent de conserver le contexte de la conversation tout en se débarrassant de la masse de données.

L'étude a également examiné la sensibilité du système à ses paramètres. Les chercheurs ont ajusté les règles définissant ce qui compte comme un doublon et le nombre de messages récents protégés de la compression. Ils ont constaté que le système est robuste. Changer légèrement les règles n'a pas provoqué l'effondrement des performances. Le système a systématiquement sauvegardé environ 70 % des données tout en conservant la grande majorité des faits importants. Cette stabilité suggère que le système pourrait être utilisé dans des applications réelles sans nécessiter d'ajustements constants.

En fin de compte, ce travail démontre qu'il est possible de rendre les conversations d'agents beaucoup plus courtes sans perdre la vérité. En traitant l'historique de la conversation comme une collection de données pouvant être compressées et récupérées, plutôt que comme un récit qui doit être résumé ou coupé, le système atteint un niveau d'efficacité que l'on pensait auparavant impossible sans compromis. L'agent peut accomplir des tâches plus longues et plus complexes sans manquer de mémoire ou payer pour un transfert de données excessif. Le système reste indépendant de tout fournisseur de modèle spécifique, ce qui signifie qu'il peut être utilisé avec n'importe quel outil parlant le langage standard de ces agents.

Les chercheurs reconnaissent que leur test a été réalisé avec des données synthétiques, ce qui signifie que les sessions ont été générées par un ordinateur plutôt que d'être enregistrées à partir d'une utilisation humaine réelle. Ils prévoient de tester le système sur des trajectoires d'agents réels pour voir comment il se comporte en conditions réelles. Ils notent également que, bien que le système actuel soit excellent pour supprimer la redondance, il ne comprend pas encore le sens profond de la conversation. Les futures versions pourraient ajouter des couches capables d'identifier les parties les plus importantes de la conversation en fonction de la tâche en cours. Cependant, le système actuel constitue une base solide. Il prouve qu'avec une ingénierie minutieuse, nous pouvons conserver l'enregistrement complet du travail d'un agent tout en n'envoyant qu'une fraction des données, garantissant ainsi qu'aucun fait n'est jamais vraiment perdu.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →