← Derniers articles
🤖 AI

Harness-R1: Learning to Edit Executable Runtime Harnesses from Agent Failure Trajectories

Harness-R1 introduit une nouvelle méthode qui utilise l'apprentissage par renforcement en ligne pour entraîner un « ingénieur de harnais » dédié afin de générer automatiquement des correctifs d'exécution à partir des trajectoires d'échec de l'agent, améliorant considérablement les taux de réussite des tâches sur plusieurs benchmarks sans nécessiter de mise à jour des poids du modèle de l'agent cible.

Auteurs originaux : Shuai Shao, Kangning Zhang, Qingyao Li, Shijian Wang, Hao Wang, Wenxiang Jiao, Yuan Lu, Yi Guo, Weiwen Liu, Weinan Zhang

Publié 2026-08-04
📖 3 min de lecture☕ Lecture pause café

Auteurs originaux : Shuai Shao, Kangning Zhang, Qingyao Li, Shijian Wang, Hao Wang, Wenxiang Jiao, Yuan Lu, Yi Guo, Weiwen Liu, Weinan Zhang

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous ayez un assistant robotique brillant et super intelligent. Vous lui confiez une tâche, comme « trouver la chemise rouge parfaite à moins de 20 $ », et il commence à travailler. Mais parfois, le robot s'embrouille. Peut-être clique-t-il sur le mauvais bouton, oublie-t-il ce qu'il cherchait, ou reste-t-il bloqué dans une boucle en essayant d'acheter le même article encore et encore. Dans le monde de l'intelligence artificielle, ce robot est appelé un « agent », et la trace désordonnée de ses pensées, de ses actions et de ses erreurs est appelée une « trajectoire ».

Habituellement, lorsqu'un robot commet une erreur, la seule façon de la corriger est de repartir de zéro et de réentraîner l'intégralité de son cerveau. Cela prend beaucoup de temps et d'énergie. Mais il existe une autre méthode : au lieu de modifier le cerveau du robot, vous pourriez modifier le « harnais » qu'il porte. Considérez le harnais comme l'équipement de sécurité du robot, sa liste de contrôle et son guide de communication, tout cela réuni en un seul outil. C'est le code qui dit au robot comment communiquer avec le monde, comment vérifier son travail et comment se rétablir lorsqu'il trébuche. La grande question que se posent les chercheurs est la suivante : pouvons-nous apprendre à un robot à corriger son propre harnais en se basant sur ses échecs passés, sans avoir besoin de réentraîner son cerveau à chaque fois ?

C'est exactement ce que l'article « Harness-R1 » explore. Les chercheurs ont construit un système où une IA spéciale, l'« Ingénieur », apprend à réécrire le harnais du robot en étudiant ses erreurs passées. Voici comment cela fonctionne : d'abord, ils laissent un robot standard (la « Cible ») essayer de résoudre des tâches et échouer. Ensuite, l'IA Ingénieur examine ces récits d'échec et rédige un nouvel ensemble d'instructions — un correctif — pour réparer le harnais. Crucialement, ils ne se contentent pas de deviner si le correctif est bon ; ils appliquent réellement le correctif sur le robot et le laissent essayer à nouveau les tâches. Si le robot réussit plus souvent, l'Ingénieur reçoit une récompense et apprend à écrire de meilleurs correctifs. Si le correctif aggrave les choses, l'Ingénieur apprend à ne plus faire cela.

Les résultats sont assez cool. Lorsqu'ils ont testé cela sur trois jeux différents et exigeants (faire des achats en ligne, naviguer dans une maison textuelle et gérer une base de données), le robot standard n'a réussi que 44,3 % du temps. Après que l'Ingénieur de Harness-R1 a appris à réparer son harnais, le taux de réussite est passé à 53,6 %. C'est une améliation de 9,3 points de pourcentage simplement en ajustant le harnais, et non le cerveau. Mieux encore, ils ont testé cela sur un robot qui avait déjà été entraîné pour être plus intelligent, et l'Ingénieur a tout de même réussi à augmenter ses performances de 5,0 points supplémentaires.

L'article montre également qu'il ne s'agit pas d'un coup de chance pour un robot spécifique. L'Ingénieur qu'ils ont entraîné a pu observer un tout nouveau robot différent qu'il n'avait jamais vu auparavant, étudier ses échecs et rédiger un correctif personnalisé qui a également aidé ce nouveau robot à réussir. Cela suggère que l'apprentissage de l'édition du « harnais » est une compétence qui peut être enseignée à une IA, permettant de co-évoluer avec les robots qu'elle aide, les rendant plus intelligents et plus fiables au fil du temps sans jamais avoir besoin de réentraîner leurs cerveaux fondamentaux.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →