Résumé technique : RECON – Évaluer la mémoire des agents pour le raisonnement compositionnel sur de longs contextes
Énoncé du problème
Les agents basés sur les grands modèles de langage (LLM) sont de plus en plus déployés dans des flux de travail à enjeux élevés (codage, clinique, juridique, financier) où ils doivent conserver, accéder et raisonner sur des informations accumulées à travers de longs contextes et de multiples interactions. Les architectures de mémoire actuelles (par exemple, Mem0, Zep, MemGPT) et les systèmes de génération augmentée par récupération (RAG) modélisent principalement la mémoire comme une machine à états, suivant les valeurs actuelles des faits. Cependant, dans des scénarios réels, les faits ne se contentent pas de s'accumuler ; ils interagissent, se contredisent et s'invalident mutuellement par le biais de structures de dépendance explicites.
Les benchmarks existants (par exemple, RULER, LongBench, LoCoMo) évaluent si les agents peuvent récupérer des faits dispersés ou détecter si un fait a changé. Ils échouent à évaluer les conséquences de ces changements : si un agent peut tracer quels développements en aval sont affectés par une invalidation, quels développements survivent grâce à un support indépendant, et comment d'autres chronologies pourraient se dérouler. Il existe une lacune critique dans l'évaluation du raisonnement compositionnel sur des récits évolutifs à long contexte, où la validité d'une conclusion dépend d'un graphe de provenance complexe plutôt que d'une liste de faits statiques.
Méthodologie : Le benchmark RECON
Les auteurs introduisent RECON (Reasoning over Extended Contexts with Obfuscated Narratives), un benchmark conçu pour évaluer les agents sur six tâches intensives en mémoire sur de longs contextes (50k–100k jetons).
1. Pipeline de génération déterministe
Pour garantir la fiabilité de la vérité de terrain (ground-truth), RECON emploie un pipeline de génération entièrement déterministe où les LLM sont restreints à la réalisation de surface (narration) uniquement et n'influencent jamais la structure causale, la provenance ou les clés de réponse.
- Synthèse du blueprint : Un moteur de production avec graine génère un blueprint de cas utilisant des terminaux typés (acteurs, preuves) et des règles de production, garantissant que les prérequis logiques sont remplis avant que les conclusions ne soient tirées.
- Expansion du squelette : Le blueprint se développe en un squelette structuré d'événements horodatés, de dépendances causales, d'invalidations, de conflits de sources et de flux temporels parallèles (ex: surveillance, transactions).
- DAG de Provenance : Un Graphe Acyclique Dirigé (DAG) global est induit à partir du contrat de génération. Les nœuds représentent des événements/preuves, et les arêtes encodent les relations causales, révisionnelles et d'invalidation. Ce DAG sert de vérité de terrain faisant autorité.
- Synthèse des tâches : Les questions sont générées algorithmiquement à partir du DAG. Par exemple, les questions de Propagation de Cascade sont créées en sélectionnant un nœud d'invalidation et en calculant la joignabilité pour déterminer quelles conclusions s'effondrent.
- Réalisation narrative : Un LLM convertit le squelette structuré en fichiers de cas en langage naturel (rapports de police, journaux cliniques, audits financiers) tout en adhérant strictement aux faits immuables du squelette.
2. Catégories de tâches
RECON couvre 24 fichiers de cas à travers trois domaines (criminel, médical, financier) et 1 604 questions, classées en six tâches :
- Reconstruction de chaîne : Localiser et ordonner causalement 5 à 15 sauts de preuves dispersés dans le document.
- Propagation de cascade : Déterminer quelles conclusions se brisent et lesquelles survivent via un support indépendant après l'invalidation d'une preuve spécifique.
- Résolution de conflit de source : Arbitrer des comptes contradictoires en utilisant des preuves de corroboration indépendantes.
- Raisonnement contrefactuel : Déterminer comment les événements en aval changent sous une chronologie alternative (ex: si un événement s'était produit plus tôt).
- Satisfaction de contraintes temporelles : Recouper des flux de données parallèles par rapport à une fenêtre temporelle spécifique.
- Récupération de faits temporels : Tâches de base pour l'ordonnancement temporel et les requêtes d'état.
3. Configuration de l'évaluation
Le benchmark évalue trois familles de systèmes plus un plafond Oracle :
- Long-Context : Modèles traitant le fichier de cas complet de 100k jetons.
- RAG : Variantes incluant la récupération dense, la récupération hybride et le re-ranking.
- Agents de mémoire : Systèmes tels que Mem0, Mem0-Graph, Supermemory et Hindsight.
- Oracle : Reçoit le DAG structuré de la vérité de terrain au lieu du texte narratif, fournissant une limite supérieure de récupération parfaite.
Le scoring implique des mesures de précision strictes, avec des pénalités pour les mauvaises réponses aux questions à choix multiples et les options d'abstention. Un filtre de contamination élimine les questions répondables via les connaissances préalables des LLM.
Résultats clés
L'évaluation révèle des limitations substantielles pour toutes les architectures actuelles :
- Performance globale : Aucun système non-Oracle ne dépasse 25 % de précision. Le meilleur système non-Oracle (Gemini-2.5-Pro) atteint seulement 22,4 % de précision, tandis que l'Oracle (avec une récupération parfaite) atteint 54,6 %. Cela indique que même avec un accès parfait au graphe de dépendance, le raisonnement reste un goulot d'étranglement important.
- Performance par tâche :
- Propagation de cascade : Les systèmes de mémoire excellent ici, Supermemory atteignant un score de 0,708, soit presque le double du meilleur modèle de long-contexte. Cela suggère que les architectures de mémoire sont efficaces pour suivre les changements d'état lorsque la structure de dépendance est simple.
- Raisonnement contrefactuel : C'est la tâche la plus difficile. Même l'Oracle n'atteint que 0,483, indiquant que l'inférence en chaîne est le principal goulot d'étranglement, et non la récupération.
- Reconstruction de chaîne et Conflit de source : Les modèles de long-contexte dominent ces tâches, mais la performance reste faible. Les systèmes RAG et de mémoire peinent considérablement, probablement en raison de la perte des arêtes entre les faits lors de la compression ou de la récupération.
- Récupération vs Raisonnement :
- La récupération est nécessaire mais insuffisante. Dans les scénarios de "couverture complète" où la preuve correcte est récupérée, les systèmes répondent toujours de manière incorrecte environ 80 % du temps.
- L'écart entre l'Oracle et la performance des LLM est le plus important pour les tâches nécessitant un raisonnement multi-sauts (Reconstruction de chaîne, Conflit de source), suggérant que l'incapacité à composer les faits récupérés est un mode de défaillance majeur.
- Efficacité des jetons : Les approches basées sur la récupération (RAG, Mémoire) sont 8 à 20 fois plus efficaces en jetons que les modèles de long-contexte, mais sacrifient souvent la performance sur les tâches de raisonnement complexes.
Signification et affirmations
L'article affirme que RECON représente un changement dans la manière dont la mémoire des agents doit être évaluée :
- Du machine à états au graphe de provenance : Le benchmark soutient que la mémoire doit être modélisée comme un graphe d'histoires de dérivation où les invalidations se propagent à travers les dépendances, plutôt que comme une simple machine à états de valeurs de faits actuels.
- Le raisonnement compositionnel est le goulot d'étranglement : Les résultats démontrent que les agents actuels échouent non seulement à trouver l'information, mais aussi à la composer. L'écart important entre l'Oracle (récupération parfaite) et la performance des LLM souligne que la capacité à tracer les chaînes causales et à gérer les invalidations est une limitation fondamentale des architectures actuelles.
- Vérité de terrain déterministe : En découplant la génération de la structure causale de la narration par LLM, RECON fournit un benchmark rigoureux et reproductible, exempt des hallucinations souvent présentes dans les jeux de données synthétiques générés entièrement par des LLM.
Les auteurs concluent que tant la récupération que le raisonnement restent des défis ouverts. Même avec un contexte parfait, les agents peinent à maintenir une compréhension cohérente et évolutive de documents longs où les faits interagissent et se contredisent. La publication du benchmark, du générateur et de l'outil d'évaluation vise à soutenir les travaux futurs sur le développement d'agents capables d'un raisonnement compositionnel robuste sur de longs contextes.