HarnessX: A Composable, Adaptive, and Evolvable Agent Harness Foundry
HarnessX introduit une fonderie composable et adaptative qui fait évoluer systématiquement les interfaces d'exécution des agents IA par le biais d'une algèbre de substitution et d'une évolution multi-agents pilotée par les traces, atteignant des gains de performance significatifs à travers divers benchmarks sans reposer uniquement sur la mise à l'échelle des modèles.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Imaginez que vous ayez un stagiaire brillant mais inexpérimenté (le modèle d'IA). Vous voulez qu'il résolve un problème complexe, comme planifier un voyage, réparer un site web cassé ou naviguer dans un jeu vidéo.
Actuellement, la plupart des gens essaient de rendre le stagiaire plus intelligent en embauchant un « super-stagiaire » (un modèle d'IA plus gros et plus coûteux). Mais ce document, HarnessX, soutient que le véritable secret n'est pas seulement d'embaucher un meilleur stagiaire ; c'est de construire un meilleur bureau, une meilleure boîte à outils et un meilleur manuel de règles pour qu'il puisse y travailler.
Les auteurs appellent cette « configuration de bureau » un Harness (un harnais).
Le Problème : Le Bureau « Fait Main »
Actuellement, si vous voulez qu'une IA accomplisse un nouveau travail, un ingénieur humain doit construire manuellement un bureau sur mesure pour elle. Il écrit des instructions spécifiques (prompts), connecte des outils spécifiques et configure des systèmes de mémoire.
- Le Problème : Ces bureaux sont statiques. Si le stagiaire change ou si le travail change, tout le bureau doit être reconstruit de zéro.
- Le Gaspillage : Lorsque le stagiaire échoue, nous examinons l'erreur, réparons le bureau manuellement et réessayons. Nous utilisons rarement ces erreurs pour améliorer automatiquement le bureau ou même pour entraîner le stagiaire à être meilleur lors de la tentative suivante.
La Solution : La « Forge de Harness »
HarnessX est une usine (une « fonderie ») qui construit ces bureaux automatiquement. Elle traite la configuration du bureau comme une entité vivante qui peut être assemblée, adaptée et évoluée par elle-même.
Voici comment cela fonctionne, divisé en trois parties simples :
1. Composition : Le Bureau LEGO
Au lieu d'un bureau désordonné et emmêlé, HarnessX construit le bureau à partir de blocs interchangeables et typés appelés « Processors » (processeurs).
- L'Analogie : Imaginez que le bureau possède des emplacements spécifiques : un pour les « Outils », un pour la « Mémoire », un pour les « Règles » et un pour le « Contexte ».
- Comment ça marche : Vous pouvez emboîter un bloc « Recherche Web » dans l'emplacement des Outils ou un bloc « Mémoire à long terme » dans l'emplacement de la Mémoire. Comme ce sont des blocs standardisés, vous pouvez les remplacer sans casser tout le bâtiment. Cela rend le bureau modulaire et sûr à modifier.
2. Adaptation : Le Manager Auto-Améliorateur (AEGIS)
C'est le cerveau du système. HarnessX utilise un manager spécial appelé AEGIS pour surveiller le travail du stagiaire et réparer automatiquement le bureau.
- Le Miroir : AEGIS traite le bureau comme un personnage de jeu vidéo. Il examine les « traces » (le journal étape par étape de ce que le stagiaire a fait) et se demande : « Pourquoi a-t-il échoué ? Était-ce l'outil ? La règle ? Le prompt ? »
- La Boucle en 4 Étapes :
- Digérer : Il lit les journaux désordonnés et résume les échecs.
- Planifier : Il décide du type de changement nécessaire (ex : « Nous avons besoin d'un nouvel outil » vs « Nous devons réécrire les instructions »).
- Évoluer : Il construit réellement la nouvelle configuration du bureau.
- Critiquer : Il agit comme un inspecteur de sécurité strict. Il teste le nouveau bureau pour s'assurer qu'il ne casse pas ce qui fonctionnait auparavant.
- Le Résultat : Le bureau s'améliore de plus en plus de lui-même, sans qu'un humain ait besoin de réécrire le code à chaque fois.
3. Co-Évolution : Une Rue à Double Sens
Habituellement, nous soit réparons le bureau, soit nous entraînons le stagiaire. HarnessX fait les deux en même temps.
- L'Analogie : Imaginez que le bureau s'améliore, ce qui aide le stagiaire à apprendre de nouveaux tours. Ensuite, le stagiaire devient plus intelligent, ce qui permet au bureau d'essayer des tâches encore plus complexes. Ils se tirent mutuellement vers le haut.
- La Boucle : Le système utilise les échecs du stagiaire pour mettre à jour le bureau et utilise le nouveau bureau pour générer de meilleures données d'entraînement pour mettre à jour le cerveau du stagiaire. Ils progressent ensemble.
Qu'est-ce qui s'est passé lors des expériences ?
L'équipe a testé cela sur cinq « jeux » (benchmarks) allant de l'achat en ligne à l'ingénierie logicielle. Ils ont utilisé trois types différents de modèles d'IA (du plus petit au plus grand).
- La Grande Victoire : En moyenne, le système a amélioré les performances de 14,5 %.
- La Victoire Suprême : Pour les modèles d'IA les plus faibles, l'amélioration a été massive, atteignant jusqu'à 44 %.
- Pourquoi ? Le document note que les modèles plus faibles ont plus de « écarts comportementaux » (ils ne savent pas comment faire certaines choses). Un meilleur bureau (harness) peut combler ces écarts immédiatement. Les modèles plus forts sont déjà assez bons, donc le bureau les aide moins.
- Le Problème du « Blocage » : Sur un test très mixte (GAIA), un seul bureau ne pouvait pas tout réparer car certaines tâches nécessitaient des règles opposées. Le système a résolu cela en créant plusieurs versions du bureau (variantes) et en dirigeant chaque tâche vers la version la mieux adaptée. Cela a empêché le système d'« oublier » comment effectuer des tâches précédentes.
Ce qu'il faut retenir
Le document conclut que nous n'avons pas besoin d'attendre que les modèles d'IA deviennent infiniment intelligents pour obtenir de meilleurs résultats. En construisant un environnement d'exécution composable et auto-évolutif (le Harness), nous pouvons extraire des gains de performance massifs, surtout pour les modèles plus petits ou moins capables.
En bref : Ne vous contentez pas d'acheter un stagiaire plus intelligent ; construisez un bureau plus intelligent, capable de s'auto-réparer, et laissez-le apprendre de ses propres erreurs pour rendre le bureau encore meilleur.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.