← Derniers articles
💬 NLP

MemoHarness: Agent Harnesses That Learn from Experience

MemoHarness est un cadre d'optimisation d'agents adaptatif qui améliore les performances des LLM à travers diverses tâches en décomposant la couche de contrôle en six dimensions et en adaptant dynamiquement les configurations du harnais pour chaque cas à l'aide d'une banque d'expérience à double couche dérivée des exécutions passées, le tout sans nécessiter de labels au moment du test ni de recherche supplémentaire.

Auteurs originaux : Yue Huang, Wenjie Wang, Han Bao, Yuchen Ma, Xiaonan Luo, Yi Nian, Haomin Zhuang, Zheyuan Liu, Yue Zhao, Xiangliang Zhang

Publié 2026-07-17
📖 4 min de lecture☕ Lecture pause café

Auteurs originaux : Yue Huang, Wenjie Wang, Han Bao, Yuchen Ma, Xiaonan Luo, Yi Nian, Haomin Zhuang, Zheyuan Liu, Yue Zhao, Xiangliang Zhang

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous ayez un assistant robotique brillant et super intelligent. Vous lui confiez une tâche, et il essaie de la résoudre. Mais voici le hic : le robot n'a pas seulement besoin d'être intelligent ; il doit savoir comment utiliser son cerveau. Il lui faut un ensemble d'instructions sur la manière d'organiser ses pensées, quand chercher des informations, comment demander de l'aide et comment vérifier son travail avant de vous donner la réponse. Dans le monde de l'intelligence artificielle, cet ensemble d'instructions et d'outils est appelé un « harnais d'agent » (agent harness). Considérez cela comme le tableau de bord, le volant et le GPS dans une voiture. Le moteur (le modèle d'IA) peut être puissant, mais si le tableau de bord est cassé ou si le GPS est bloqué sur une vieille carte, la voiture ne vous emmènera pas là où vous devez aller. Pendant longtemps, les scientifiques ont essayé de rendre ces robots plus intelligents en rendant leurs moteurs plus gros. Mais cet article pose une question différente : et si nous réparions simplement le tableau de bord ? Et si nous pouvions apprendre au robot à tirer des leçons de ses propres erreurs et à ajuster son style de conduite pour chaque trajet, plutôt que d'utiliser les mêmes instructions rigides et universelles pour tout ?

C'est exactement ce que les chercheurs derrière MemoHarness ont cherché à faire. Ils ont réalisé que la plupart des agents d'IA actuels sont comme des voitures avec un volant fixe : ils utilisent la même configuration pour chaque problème, qu'il s'agisse d'un virage simple ou d'une insertion complexe sur une autoroute. L'équipe a construit un nouveau système qui agit comme un « conducteur apprenant ». Au lieu de simplement chercher un ensemble parfait d'instructions à utiliser pour toujours, MemoHarness permet à l'agent d'apprendre de ses trajets passés. Il tient un journal détaillé de ce qui a fonctionné, de ce qui a échoué et de pourquoi. Lorsqu'une nouvelle tâche se présente, l'agent ne se contente pas de deviner ; il consulte son journal, trouve des situations passées similaires et ajuste ses propres instructions à la volée pour s'adapter au défi spécifique.

L'article présente une manière ingénieuse de diviser le « harnais » en six parties distinctes, comme si l'on ajustait différents boutons sur un panneau de commande : comment l'agent recueille l'information (Contexte), quels outils il utilise (Outil), comment il pense et s'exprime (Génération), l'ordre de ses étapes (Orchestration), ce qu'il mémorise (Mémoire) et comment il finalise sa réponse (Sortie). En traitant ces éléments comme des surfaces séparées et modifiables, le système peut diagnostiquer exactement ce qui a mal tourné. A-t-il oublié de consulter une carte ? A-t-il essayé de conduire trop vite ? A-t-il oublié de mémoriser un détail clé ?

Dans leurs expériences, l'équipe a testé ce système sur trois types de tâches très différents : agir comme un terminal informatique pour réparer un logiciel, écrire du code et résoudre des énigmes complexes de raisonnement financier. Les résultats sont prometteurs. Sur les tests de terminal informatique, MemoHarness a amélioré le taux de réussite de 0,722 à 0,806, battant les meilleures configurations fixes auxquelles ils ont comparé le système. Il a également montré que ces habitudes apprises pouvaient se « transférer » à de nouvelles tâches inédites et même fonctionner efficacement sur différents types de modèles d'IA sans nécessiter de réentraînement. Par exemple, lorsqu'ils ont pris le harnais appris sur un modèle et l'ont appliqué à six autres modèles, le taux de réussite moyen a bondi de +0,098.

Les auteurs suggèrent que cette approche est un moyen pratique de rendre l'IA plus adaptable sans avoir besoin de construire un nouveau moteur à chaque fois. Cependant, ils précisent avec prudence que, bien que les résultats soient solides, ils sont basés sur des tests et des simulations spécifiques. Ils ne prétendent pas avoir résolu tous les problèmes ni prouvé que cela fonctionne parfaitement dans chaque scénario réel. Ils ont également constaté que, bien que le système utilise davantage de données pour « lire » son journal, la majeure partie de ces données peut être mise en cache (stockée pour une réutilisation rapide), ce qui maintient un coût compétitif. En bref, MemoHarness suggère que donner à une IA la capacité de réfléchir sur sa propre expérience et d'ajuster son propre panneau de commande pourrait être la clé pour la rendre véritablement utile, transformant une machine rigide en un partenaire d'apprentissage flexible.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →