← Derniers articles
🤖 AI

StarHarness: Evolving Harnesses with Stratified Search for Enterprise Environments

StarHarness est un cadre qui améliore considérablement la performance des agents dans les environnements d'entreprise en faisant évoluer des harnais spécifiques à l'environnement par une recherche stratifiée tout en maintenant les poids du modèle fixes, atteignant ainsi des gains substantiels dans les scores de référence et la généralisation à travers différentes familles de modèles.

Auteurs originaux : Esakkivel Esakkiraja, Denis Akhiyarov, Vikas Yadav, Sai Rajeswar, Patrice Bechard, Sridhar Nemala, Sagar Davasam

Publié 2026-08-26
📖 6 min de lecture🧠 Analyse approfondie

Auteurs originaux : Esakkivel Esakkiraja, Denis Akhiyarov, Vikas Yadav, Sai Rajeswar, Patrice Bechard, Sridhar Nemala, Sagar Davasam

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Dans le monde de l'informatique moderne, il existe une classe croissante de programmes intelligents connus sous le nom d'agents. Il ne s'agit pas de simples outils qui suivent une commande unique ; ce sont des systèmes conçus pour raisonner, examiner des informations et prendre des mesures pour résoudre des problèmes complexes, de la même manière qu'un employé humain le ferait. Pour fonctionner, ces agents s'appuient sur deux parties distinctes. La première est le cerveau, un grand modèle de langage qui fournit le raisonnement et la connaissance. La seconde est le harnais, qui agit comme les mains, les yeux et les oreilles de l'agent. Le harnais définit comment l'agent perçoit le monde, quels outils il est autorisé à utiliser et comment il vérifie son propre travail. Pendant des années, les scientifiques se sont presque exclusivement concentrés sur le fait de rendre le cerveau plus grand et plus intelligent. Cependant, dans la réalité désordonnée et régie par des règles des environnements commerciaux, un cerveau brillant peut tout de tenu échouer si ses mains sont maladroites ou s'il ne comprend pas les règles spécifiques du bureau dans lequel il travaille. Cela soulève une question pratique : si nous ne pouvons pas changer le cerveau, pouvons-nous améliorer les mains et les règles pour rendre l'agent plus performant ?

Une équipe de chercheurs chez ServiceNow, accompagnée de collaborateurs d'institutions académiques, s'est donné pour mission de répondre à cette question avec un nouveau cadre appelé StarHarness. Ils se sont concentrés sur un défi spécifique présent dans les contextes d'entreprise, où les logiciels doivent gérer des éléments tels que les systèmes informatiques, les flux de travail financiers et les dossiers de service client. Dans ces environnements, le logiciel doit interagir avec des bases de données et des outils qui possèdent des règles strictes, souvent cachées. Les chercheurs voulaient voir s'ils pouvaient améliorer automatiquement le harnais de l'agent sans jamais toucher au cerveau sous-jacent. Ils ont traité le harnais comme un morceau de code qui pouvait être évolué, ou amélioré, par un processus d'essais et d'erreurs. L'objectif était de trouver une meilleure façon pour l'agent de structurer ses tâches, d'utiliser ses outils et de vérifier ses résultats, tout en gardant les poids internes du modèle complètement gelés.

Pour tester leur idée, les chercheurs ont créé un système capable de rechercher des améliorations de manière contrôlée. Ils ont commencé par faire exécuter l'agent sur un large ensemble de tâches pour voir où il échouait typiquement. Ils ont ensuite divisé ces tâches en trois groupes. Un groupe a été utilisé pour proposer des changements, un autre a été gardé caché pour tester si les changements fonctionnaient réellement, et un troisième groupe a été réservé pour une vérification finale impartiale. Le système suggérait un petit changement au harnais, comme corriger la façon dont un outil était appelé ou ajouter une règle pour prévenir une erreur courante. Il testait ensuite ce changement sur le groupe caché. Si le changement améliorait les performances de l'agent, le système le conservait ; sinon, il le rejetait. Ce processus se répétait, permettant au harnais d'évoluer lentement vers une version plus capable de lui-même. Les chercheurs ont utilisé cette méthode à travers trois types différents de défis commerciaux : l'analyse des défaillances de réseaux informatiques, la gestion des demandes de services informatiques et la gestion des flux de travail financiers.

Les résultats furent frappants. Après que le système eut effectué seulement quelques changements acceptés — généralement entre quatre et douze ajustements par environnement — la performance de l'agent bondit de manière significative. Sur l'ensemble des tests de référence, la performance globale s'est améliorée de 20 à 35 points de pourcentage par rapport au harnais par défaut. Plus précisément, le taux de réussite s'est amélioré de 35 points de pourcentage sur les tâches d'analyse de réseau, a augmenté de 20 points de pourcentage dans les tests de gestion de services informatiques et a grimpé de 26 points de pourcentage dans les flux de travail financiers. Crucialement, ces améliorations n'étaient pas seulement le résultat de la mémorisation des problèmes spécifiques rencontrés par le système pendant l'entraînement. Lorsque les chercheurs ont testé le harnais évolué sur de nouvelles tâches inconnues, l'agent était toujours bien plus performant qu'auparavant. Plus surprenant encore, les améliorations se sont transférées à différents types de modèles d'IA. Un harnais évolué à l'aide d'une famille de modèles spécifique fonctionnait tout aussi bien lorsqu'il était donné à une famille de modèles complètement différente, sans nécessiter d'entraînement ou d'ajustement supplémentaire.

Les chercheurs ont analysé les changements pour comprendre ce que le système avait réellement appris. Ils ont découvert que les améliorations se répartissaient en trois catégories claires. Premièrement, le système a réparé les interfaces entre l'agent et ses outils, corrigeant les erreurs qui causaient des appels d'outils incorrects. Deuxièmement, il a appris les conventions cachées de l'environnement, telles que l'ordre spécifique dans lequel certaines étapes doivent être suivies ou la manière de gérer correctement les dates et les priorités. Troisièmement, il a compressé le processus de recherche en ajoutant des connaissances opérationnelles, permettant à l'agent de sauter des étapes inutiles et de se concentrer sur les causes les plus probables d'un problème. Par exemple, dans les tâches financières, le harnais évolué a appris à vérifier les violations de sécurité avant d'effectuer tout changement, ce qui a considérablement réduit le nombre d'erreurs. Dans les tâches d'analyse de réseau, l'agent a appris à arrêter la recherche une fois qu'il avait trouvé une cause probable, plutôt que de perdre du temps à chercher davantage de preuves qui n'étaient pas nécessaires.

Ces conclusions suggèrent que pour de nombreuses applications commerciales réelles, le principal obstacle au succès n'est pas l'intelligence du modèle, mais la conception du système qui le guide. En faisant évoluer le harnais, les chercheurs ont pu réduire le nombre de diagnostics erronés, raccourcir le temps nécessaire pour accomplir les tâches et abaisser le coût d'exécution de l'agent. L'étude démontre qu'un cerveau fixe et immuable peut devenir remarquablement plus efficace lorsque les outils et les règles qui l'entourent sont soigneusement ajustés à l'environnement spécifique dans lequel il opère. Cela offre une voie pratique pour les organisations qui ont besoin d'agents d'IA fiables aujourd'hui, sans attendre le développement de la prochaine génération de modèles plus vastes. Le travail montre que parfois, la mise à jour la plus puissante n'est pas un nouvel esprit, mais une meilleure façon de travailler.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →