← Derniers articles
🤖 AI

Context as an Environment: Programmatic Context Management for Long-Horizon Agents

Le document présente Scroll, un système de gestion de contexte programmatique qui traite les sessions d'agents comme des environnements exécutables dotés d'un journal d'événements en ajout uniquement et d'un noyau Python persistant, permettant aux LLM de gérer dynamiquement l'état à long horizon par le code tout en atteignant des performances de pointe sur les benchmarks de contexte long.

Auteurs originaux : Yin Lin, Elaine Ang, Erkang Zhu, Bolin Ding, Jingren Zhou

Publié 2026-08-25
📖 6 min de lecture🧠 Analyse approfondie

Auteurs originaux : Yin Lin, Elaine Ang, Erkang Zhu, Bolin Ding, Jingren Zhou

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez une conversation qui ne s'arrête jamais. Vous discutez avec un programme informatique très intelligent, capable de vous aider à écrire du code, à planifier des voyages complexes ou à effectuer des recherches sur des sujets profonds. Au début, la conversation est facile. Le programme se souvient de tout ce que vous avez dit au cours des dernières minutes. Mais à mesure que la conversation s'étire sur des heures ou des jours, la quantité d'informations augmente. Finalement, cela devient trop important pour que le programme puisse le conserver dans sa mémoire immédiate. Dans le monde de l'intelligence artificielle, cette mémoire immédiate est appelée fenêtre de contexte. Elle a une taille fixe, comme un bureau qui ne peut contenir qu'un certain nombre de papiers. Lorsque la pile de papiers devient trop haute, le programme doit en jeter certains pour faire de la place aux nouveaux.

Le problème est que le programme ne sait pas quels papiers sont importants avant qu'il ne soit trop tard. Si vous posez une question sur quelque chose que vous avez mentionné il y a trois jours, le programme pourrait déjà avoir jeté ce papier. Les solutions traditionnelles tentent de résoudre cela en résumant les vieux papiers sous forme de notes courtes ou en extrayant quelques faits pour les garder dans un carnet séparé. Mais ces méthodes sont risquées. Si le programme jette un détail spécifique, comme une date ou un nombre, ce détail est perdu à jamais. Il ne peut pas être récupéré. Pour les tâches qui nécessitent de consulter un historique long pour trouver des faits précis ou pour suivre l'évolution d'une situation, perdre ne serait-ce qu'un seul détail peut faire échouer le programme.

Une équipe de chercheurs a proposé une autre façon de gérer cette conversation croissante. Ils appellent leur système Scroll. Au lieu d'essayer de faire tenir tout l'historique dans la mémoire immédiate du programme, ils traitent l'historique comme un environnement distinct et permanent que le programme peut visiter dès qu'il en a besoin. Imaginez cela comme une vaste archive organisée qui se trouve juste à l'extérieur du bureau du programme. Le programme ne lit pas toute l'archive à la fois. Au lieu de cela, il écrit une petite instruction, comme une requête de recherche ou une commande, pour aller dans l'archive, trouver la page spécifique dont il a besoin et rapporter juste cette page sur le bureau.

Le cœur de ce système est un enregistrement permanent de chaque interaction, appelé Journal d'Événements (Event Log). Ce journal est comme un magnétophone qui ne s'arrête jamais, capturant chaque message, chaque résultat d'outil et chaque décision dans les moindres détails. Il est stocké en toute sécurité en dehors de la mémoire immédiate du programme, de sorte que rien n'est jamais perdu. À côté de ce journal se trouve un espace de travail persistant, une sorte de bac à sable numérique où le programme peut conserver ses pensées et calculs actuels. Lorsque le programme a besoin de se souvenir de quelque chose du passé, il ne compte pas sur un résumé. Il écrit un morceau de code pour chercher dans le Journal d'Événements, trouver le moment exact qu'il recherche, et charger cette information dans son espace de travail.

Cette approche change la façon dont le programme perçoit sa propre mémoire. Au lieu de deviner ce qu'il faut garder, le programme décide de ce qu'il doit rechercher au moment où cela est nécessaire. Si le programme planifie un voyage et doit se souvenir d'une préférence mentionnée par l'utilisateur il y a plusieurs semaines, il écrit une commande pour rechercher cette préférence spécifique. Il charge ensuite les mots exacts utilisés par l'utilisateur et les utilise pour prendre une décision. Le programme ne ramène dans sa vue immédiate que l'information nécessaire. Le reste de l'historique de la conversation demeure stocké en toute sécurité dans l'archive, attendant d'être récupéré si le programme en a besoin plus tard.

Pour éviter que la vue immédiate ne soit trop encombrée, le système dispose d'un moyen de vider les anciennes informations qui ne sont pas actuellement utilisées. Lorsque l'espace de travail devient trop chargé, le système déplace les parties les plus anciennes de la conversation vers l'archive. Cependant, contrairement à d'autres systèmes qui pourraient supprimer ou résumer ces anciennes parties, Scroll les conserve exactement telles quelles. Il crée une petite carte, un index, qui indique au programme l'endroit exact où ces anciennes parties sont stockées. Si le programme réalise plus tard qu'il doit vérifier une ancienne conversation, il peut utiliser cette carte pour sauter directement au bon endroit et récupérer le texte original. Cela garantit que le programme peut toujours revenir à la source, même si l'information n'est plus dans sa vue immédiate.

Les chercheurs ont testé ce système sur plusieurs défis difficiles conçus pour voir comment une intelligence artificielle peut gérer de longues conversations. Dans un test, le système devait répondre à des questions basées sur un historique de plus d'un million de mots de conversation. Dans un autre, il devait agir en tant qu'agent prenant des décisions sur une longue période, utilisant des outils pour recueillir des informations et résoudre des problèmes. Les résultats ont montré que cette nouvelle méthode était hautement efficace. Sur un test mesurant la capacité du système à se souvenir et à raisonner sur de longs historiques, il a obtenu un score de 94,8 %. Sur un autre test impliquant dix millions de mots d'historique, il a obtenu 73,1 %, ce qui est supérieur à tout autre système publié précédemment. Dans un test où le système devait gérer un environnement croissant tout en résolvant des tâches complexes, il a atteint 86,7 %, dépassant largement les meilleurs résultats précédents.

Le succès de ce système provient de sa capacité à traiter la mémoire comme une tâche de programmation. En permettant au programme d'écrire ses propres instructions pour trouver et utiliser l'information, le système tire parti de la capacité croissante du programme à écrire du code. Il ne force pas le programme à compresser son historique en un résumé qui pourrait perdre des détails importants. Au lieu de cela, il donne au programme les outils pour accéder à l'historique complet et non édité dès qu'il en a besoin. Les chercheurs ont constaté que cette méthode fonctionne bien avec différents types de programmes puissants, suggérant que la capacité de gérer la mémoire à long terme par le code est une compétence générale qui peut être apprise par divers systèmes.

Ce travail suggère un changement dans la manière dont nous construisons les agents intelligents. Plutôt que d'essayer de rendre la mémoire immédiate du programme plus grande ou plus performante dans la synthèse, nous pouvons lui donner accès à un enregistrement permanent et consultable de sa propre vie. Le programme apprend à naviguer dans cet enregistrement, décidant de ce qu'il doit faire avancer et de ce qu'il doit laisser derrière lui. Cela permet de garder la vue immédiate claire et concentrée, tout en garantissant que la vérité entière du passé est toujours disponible. Les chercheurs pensent que cette approche pourrait aider l'intelligence artificielle à gérer des tâches encore plus longues et complexes à l'avenir, lui permettant d'apprendre d'un historique beaucoup plus profond sans perdre les détails qui comptent.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →