← Derniers articles
💻 computer science

Experience Graphs: The Data Foundation for Self-Improving Agents

Le document propose Trellis, une architecture centrée sur la base de données qui traite les « graphes d'expérience » structurés générés par des tâches agentiques à long terme comme des données de premier rang, interrogeables, afin de permettre des agents sans état, une récupération après sinistre robuste et un volant d'inertie d'entraînement en boucle fermée, démontrant des gains d'efficacité significatifs dans un optimiseur de noyau de production chez Meta.

Auteurs originaux : Gang Liao, Yujia He, Abdullah Ozturk, Zhouyang Li, Ying Wang, Zhitong Guo, Hongsen Qin, Yaobin Qin, Tao Yang, Zewei Jiang, Dianshi Li, Jort Gemmeke, Jiangyuan Li, Liyuan Li, Nathan Yan, Masha Basmanov
Publié 2026-06-30
📖 7 min de lecture🧠 Analyse approfondie

Auteurs originaux : Gang Liao, Yujia He, Abdullah Ozturk, Zhouyang Li, Ying Wang, Zhitong Guo, Hongsen Qin, Yaobin Qin, Tao Yang, Zewei Jiang, Dianshi Li, Jort Gemmeke, Jiangyuan Li, Liyuan Li, Nathan Yan, Masha Basmanova, Uladzimir Pashkevich, Matt Steiner, Pedro Pedreira, Rob Fergus, Anirudh Goyal, Carole-Jean Wu, Gaoxiang Liu, Andrew Witten, Daniel J. Abadi

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

L'idée maîtresse : Des agents « amnésiques » aux apprenants « cumulatifs »

Imaginez que vous enseigniez à un robot à résoudre un puzzle très difficile, comme la conception d'une nouvelle puce informatique ou l'écriture d'un code complexe.

L'ancienne méthode (Agents actuels) :
Actuellement, la plupart des agents IA travaillent comme une personne essayant de résoudre un puzzle en une seule séance. Ils tentent une étape, échouent peut-être, essaient à nouveau, et continuent jusqu'à obtenir une réponse. Mais une fois qu'ils ont terminé (ou qu'ils plantent), ils oublient presque tout ce qu'ils ont appris durant cette tentative spécifique. S'ils essaient le même puzzle demain, ils doivent repartir de zéro. Leur « mémoire » n'est qu'un tas de notes désordonnées (journaux de bord/logs) difficiles à lire ou à réutiliser.

La nouvelle méthode (Trellis & Experience Graphs) :
Ce papier propose un nouveau système appelé Trellis. Imaginez un treillis comme la structure en bois qu'utilisent les jardiniers pour aider les plantes grimpantes à pousser. Le treillis (la base de données) soutient la plante, organise les branches et s'assure que la plante ne s'effondre pas, tandis que la vigne (l'agent IA) grimpe et se développe.

Dans ce nouveau système, chaque étape franchie par l'agent — chaque supposition, chaque échec, chaque outil utilisé et chaque score obtenu — est sauvegardée dans une structure géante, organisée et consultable appelée Experience Graph (Graphe d'Expérience).

La métaphore centrale : Le « Jardin des Tentatives »

Au lieu qu'un agent se contente d'écrire un rapport final, imaginez qu'il explore un immense jardin.

  • L'Experience Graph : C'est le jardin lui-même. Chaque chemin parcouru par l'agent, chaque fleur cueillie et chaque impasse rencontrée est enregistré comme une plante permanente dans le jardin.
  • Les « Vignes » : Les agents IA sont les vignes. Elles poussent, explorent et tentent de nouvelles choses.
  • Le « Trellis » (Système Trellis) : C'est la base de données qui soutient le jardin. Il ne fait pas pousser les plantes ; il les supporte. Il se souvient exactement de l'emplacement de chaque branche, de la qualité de sa croissance et de ce qui se serait passé si un autre chemin avait été emprunté.

Pourquoi cela change tout

Le papier soutient que traiter ces « registres de jardin » comme une véritable base de données (comme celles qui gèrent les banques ou les compagnies aériennes) change la manière dont l'IA fonctionne de trois façons principales :

1. Plus d'amnésie après un plantage

Le Problème : Si un agent actuel plante (comme un ordinateur qui se fige), il perd ses progrès. C'est comme un randonneur qui tombe d'une falaise et oublie la carte qu'il tenait en main.
La Solution Trellis : Comme la « carte » (le graphe d'expérience) réside dans la base de données et non dans la tête de l'agent, celui-ci peut être redémarré instantanément. Il demande simplement à la base de données : « Où en étais-je ? » et reprend exactement là où il s'était arrêté. L'agent devient « sans état » (stateless) — il est juste un travailleur qui réfléchit, tandis que la base de données détient la mémoire.

2. Apprendre des autres (Réutilisation inter-sessions)

Le Problème : Actuellement, si l'Agent A résout un problème, l'Agent B n'en est pas automatiquement informé. Ils sont isolés.
La Solution Trellis : La base de données permet à l'Agent B de consulter le « jardin » de l'Agent A. Si l'Agent A a trouvé un raccourci ou un moyen d'éviter une impasse, l'Agent B peut voir ce chemin immédiatement.

  • Le Résultat : Le papier a testé cela avec un outil réel nommé KernelEvolve (qui optimise le code informatique). Lorsque les agents pouvaient « emprunter » au jardin partagé, ils trouvaient des solutions 10 fois plus vite et utilisaient 52 % de puissance de calcul en moins (tokens), car ils ne perdaient pas de temps à répéter les erreurs déjà commises par d'autres.

3. Le « Voyage dans le Temps » pour l'entraînement

Le Problème : Pour mieux enseigner à l'IA, nous devons généralement parcourir des journaux de bord désordonnés pour trouver des exemples de ce qui a fonctionné ou non. C'est lent et souvent imprécis.
La Solution Trellis : La base de données organise automatiquement le « jardin » en matériel d'entraînement.

  • Elle peut montrer à l'IA : « Voici un chemin où tu as réussi (Bien). »
  • Elle peut montrer : « Voici un chemin où tu as échoué (Mal). »
  • Elle peut même faire du « Voyage dans le Temps » : elle peut reconstruire exactement ce que l'agent savait à ce moment précis dans le passé, sans voir les résultats futurs. Cela crée automatiquement des données d'entraînement parfaites et de haute qualité.

Le « Volant d'Inertie de l'Auto-Amélioration » (Self-Improving Flywheel)

Le papier décrit un cycle qui rend le système plus intelligent au fil du temps :

  1. Explorer : Les agents cherchent dans le jardin, tentant de nouvelles choses.
  2. Enregistrer : Chaque tentative est sauvegardée dans la base de données Trellis.
  3. Apprendre : La base de données transforme ces tentatives en données d'entraînement pour enseigner aux modèles d'IA.
  4. Améliorer : Les modèles plus intelligents retournent dans le jardin et explorent encore mieux.

Parce que la base de données détient la mémoire, l'ensemble du système devient plus intelligent à mesure que davantage de personnes l'utilisent. Ce n'est pas seulement un agent qui devient plus intelligent ; c'est toute une communauté d'agents partageant une bibliothèque de connaissances unique et croissante.

Ce que le papier affirme réellement (et ce qu'il ne fait pas)

  • Il affirme : Ils ont construit un système (Trellis) qui traite l'historique de recherche de l'IA comme une base de données. Ils l'ont testé sur l'optimisation de puces informatiques (KernelEvolve) et la validation matérielle. Ils ont démontré que cela rend les agents plus rapides, moins coûteux et plus fiables.
  • Il affirme : Cette architecture permet une « Auto-amélioration Récursive » (les agents s'améliorant dans leur propre travail).
  • Il ne prétend PAS : Ce papier ne traite pas des usages médicaux, des essais cliniques ou d'applications spécifiques en dehors de l'optimisation logicielle/matérielle (bien qu'il mentionne que la structure pourrait s'appliquer à la découverte de médicaments ou à la science, les résultats réels présentés concernent uniquement le code informatique et les puces).

Analogie de synthèse

Imaginez un groupe de scientifiques essayant de découvrir une nouvelle loi de la physique.

  • Sans Trellis : Chaque scientifique travaille dans une pièce séparée, écrit des notes sur du papier, et si l'on quitte la pièce, les notes sont jetées. Ils doivent réinventer la roue à chaque fois.
  • Avec Trellis : Tous les scientifiques travaillent dans une immense bibliothèque partagée. Chaque expérience, chaque échec et chaque succès est écrit sur une fiche et classé parfaitement. Si un scientifique commet une erreur, la bibliothèque le sait. Si un autre scientifique a besoin d'un indice, il peut consulter la fiche exacte de l'expérience d'un collègue. La bibliothèque est le « cerveau » qui se souvient de tout, permettant aux scientifiques de s'appuyer sur les épaules des autres pour aller plus loin que jamais.

Le papier conclut que si les journaux de bord ont rendu les bases de données fiables, les graphes d'expérience pourraient rendre les agents d'IA cumulatifs — c'est-à-dire qu'ils peuvent construire des connaissances qui durent et croissent, plutôt que de simplement résoudre un problème à la fois.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →