OpenForgeRL: Train Harness-native Agents in Any Environment
OpenForgeRL est un framework open-source qui permet l'entraînement de bout en bout d'agents IA natifs de harnais dans divers environnements en découplant l'inférence de l'entraînement via un proxy léger et un orchestrateur Kubernetes, atteignant des performances de pointe sur des benchmarks complexes d'outils et d'interfaces graphiques tout en fournissant des informations sur la manière dont les choix de harnais et l'apprentissage par renforcement façonnent le comportement des agents.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Imaginez un monde où les ordinateurs ne se contentent pas de répondre à des questions, mais accomplissent réellement des tâches pour vous. Ils peuvent écrire du code, réserver des vols ou organiser vos fichiers numériques. Pour que cela se produise, des scientifiques ont construit des « agents IA » : des programmes intelligents capables de réfléchir, de planifier et d'utiliser des outils. Mais voici la partie délicate : ces agents ne travaillent pas dans le vide. Ils ont besoin d'un « harnais », qui est comme une salle de contrôle complexe ou un cockpit spécialisé. Ce harnais gère la mémoire de l'agent, le connecte à Internet et l'aide à utiliser des outils comme une calculatrice ou un navigateur web. Considérez le harnais comme le siège du pilote et l'agent comme le pilote ; on ne peut pas simplement entraîner un pilote dans un jeu vidéo et s'attendre à ce qu'il pilote un véritable 747. Un vrai avion possède des boutons spécifiques, des protocoles d'urgence et une configuration de cockpit que le jeu vidéo n'a jamais montrés.
Pendant longtemps, il y a eu un problème majeur : les « jeux vidéo » (environnements d'entraînement simplifiés) ne correspondaient pas aux « vrais avions » (les harnais complexes utilisés dans le monde réel). Les chercheurs pouvaient entraîner les agents facilement, mais lorsqu'ils les plaçaient dans les harnais réels et complexes, les agents étaient souvent confus ou échouaient. Ce document, intitulé « OpenForge RL », s'attaque précisément à ce décalage. Il introduit une nouvelle façon d'entraîner ces pilotes numériques directement dans les vrais cockpits qu'ils voleront par la suite, en utilisant un système qui leur permet de s'exercer sur des milliers d'« avions » différents en même temps sans faire planter l'ensemble de l'installation d'entraînement.
Le Problème : S'entraîner dans un jeu vidéo vs Piloter le vrai avion
Imaginez que vous essayiez d'apprendre à un robot à réparer une voiture. Si vous l'entraînez dans un jeu vidéo simple où le moteur est juste un bouton rouge et le pneu est un carré bleu, le robot apprendra à appuyer sur le rouge et à saisir le bleu. Mais quand vous placerez ce robot dans un vrai garage avec un vrai moteur, un vrai pneu et un million d'autres outils, il se figera. Il ne saura pas comment gérer la vraie complexité.
C'est ce qui arrive aux agents d'IA. Les agents modernes sont puissants, mais ils dépendent de « harnais » sophistiqués (comme Claude Code ou Codex) pour gérer leurs pensées et leurs outils. Ces harnais sont comme le vrai cockpit : ils possèdent une mémoire d'état (se souvenir de ce qui s'est passé cinq étapes auparavant), des flux de travail multi-processus (exécuter plusieurs choses à la fois) et des connexions d'outils complexes. Cependant, les méthodes standards utilisées par les chercheurs pour entraîner l'IA (en utilisant l'apprentissage par renforcement ou Reinforcement Learning) supposent généralement un environnement simple et plat. Ils tentent d'entraîner l'agent dans une version simplifiée du harnais, ce qui crée un « décalage entraînement-déploiement ». C'est comme entraîner un pilote sur un simulateur qui ne possède pas les vrais freins d'urgence, puis attendre de lui qu'il atterrisse un véritable avion lorsque les freins tombent en panne.
La Solution : OpenForge RL (Le Garage Cloud)
Les auteurs de ce document ont construit OpenForge RL, un framework qui agit comme un immense garage basé sur le cloud. Au lieu de tenter de forcer le véritable harnais complexe dans une boîte d'entraînement simple, OpenForge RL fait l'inverse : il prend la boîte d'entraînement et l'envoie vers le véritable harnais.
Voici comment cela fonctionne, en utilisant une analogie ludique :
- Les Pods Distants (Le Garage Cloud) : Imaginez que vous avez une flotte de petits garages autonomes dans le cloud. Chaque garage est un conteneur qui contient un « harnais » spécifique (comme un modèle de voiture spécifique). OpenForge RL utilise un « orchestrateur Kubernetes » (pensez à un gestionnaire de garage super efficace) pour lancer instantanément des milliers de ces garages distants.
- Le Proxy (Le Miroir Sans Tinte) : À l'intérieur de chaque garage, l'agent d'IA tente de résoudre une tâche. Un « proxy léger » agit comme un miroir sans tain. Il permet à l'agent de communiquer avec le véritable harnais et le véritable environnement (comme un véritable ordinateur ou un navigateur web), mais enregistre secrètement chaque mouvement, pensée et clic d'outil.
- La Boucle d'Entraînement : Le proxy renvoie ces « journaux de vol » enregistrés vers le cerveau d'entraînement principal (qui utilise des outils standards comme veRL). Le cerveau apprend de ces journaux du monde réel, met à jour le cerveau de l'agent, et renvoie la nouvelle version vers les garages distants pour un nouvel essai.
La magie réside dans le fait que l'entraînement se déroule à l'intérieur du véritable harnais, dans le véritable environnement, mais la lourde tâche de gérer tous ces environnements différents est gérée par le cloud. Cela signifie que les chercheurs peuvent entraîner des agents sur « ZeroClaw », « OpenClaw », « Codex » ou même des agents GUI (des agents qui utilisent une souris et un clavier) tous en même temps, sans avoir besoin de réécrire leur code d'entraînement pour chaque nouvel outil.
Ce qu'ils ont trouvé : L'entraînement réel fonctionne mieux
L'équipe a testé ce système avec deux types d'agents : les Agents Claw (qui utilisent du texte et des outils pour effectuer des tâches comme rechercher des e-mails ou gérer des fichiers) et les Agents GUI (qui regardent un écran et utilisent une souris pour cliquer sur des boutons dans un navigateur web ou un ordinateur).
Ils ont entraîné ces agents en utilisant seulement quelques centaines à quelques milliers de tâches — bien moins que les modèles massifs qui en utilisent des millions. Les résultats sont impressionnants :
- Pour les Agents Claw : Leur modèle, OpenForge-Claw, a obtenu un score de 31,7 (pass@3) sur le benchmark ClawEval et 33,7 sur QwenClawBench. C'était nettement supérieur aux autres modèles open-source de taille similaire (environ 30 milliards de paramètres). En fait, il a surpassé certains modèles qui sont plusieurs fois plus grands.
- Pour les Agents GUI : Leur modèle, OpenForge-GUI, a atteint un score de 37,7 sur OSWorld-Verified, 63,0 sur Online-Mind2Web, et 72,3 sur WebVoyager. C'est un événement majeur car les tâches GUI sont incroyablement difficiles ; l'agent doit « voir » l'écran et déterminer où cliquer. OpenForge-GUI a égalé ou même battu des modèles beaucoup plus gros qui avaient été entraînés sur beaucoup plus de données.
La Leçon du « Harnais » : Tous les Cockpits ne se valent pas
L'une des découvertes les plus intéressantes n'était pas seulement que l'entraînement fonctionnait, mais comment différents harnais affectaient l'apprentissage. Les auteurs ont testé leurs agents dans quatre harnais différents : ReACT (une boucle simple), ZeroClaw (léger), OpenClaw et Codex (très complexe).
Ils ont découvert que certains harnais sont beaucoup plus difficiles à apprendre que d'autres.
- Les harnais plus simples et mieux alignés (comme ZeroClaw) ont permis aux agents d'apprendre plus vite et de mieux performer.
- Les harnais plus complexes (comme Codex) étaient plus difficiles à maîtriser. Les agents éprouvaient plus de difficultés et, bien que l'apprentissage par renforcement (RL) ait aidé, les gains étaient moindres par rapport aux harnais plus simples.
Cela suggère que la conception du « cockpit » compte autant que l'entraînement du pilote. Un harnais bien conçu rend l'agent plus intelligent et plus fiable.
Ce que le RL a réellement appris aux agents
Les auteurs ont également examiné de près ce que les agents apprenaient réellement lorsque l'on ajoutait l'apprentissage par renforcement (RL) au-dessus de l'entraînement de base (SFT). Ils ont découvert que le RL ne rendait pas seulement les agents « plus intelligents » de manière générale ; il améliorait spécifiquement la fiabilité :
- Auto-vérification : Les agents ont commencé à vérifier leur propre travail. Par exemple, s'ils créaient un fichier, ils étaient plus susceptibles de le relire pour s'assurer qu'il était correct.
- Couverture des outils : Ils ont commencé à utiliser une plus grande variété d'outils au lieu de s'en tenir à un ou deux qu'ils connaissaient bien.
- Récupération d'erreurs : C'était la partie délicate. Bien que le RL ait aidé les agents à se remettre de petites erreurs, la récupération d'erreurs est restée faible. Même après l'entraînement, si un agent commettait une erreur majeure, il ne pouvait souvent pas la corriger et abandonnait simplement. Les auteurs suggèrent que cette compétence spécifique pourrait nécessiter des données spéciales ou des méthodes d'entraînement différentes pour être maîtrisée.
L'essentiel
OpenForge RL proule que vous n'avez pas besoin de simplifier le monde réel pour entraîner des agents d'IA. En utilisant un système basé sur le cloud qui découple l'entraînement de l'environnement, vous pouvez entraîner des agents directement dans les harnais complexes et désordonnés qu'ils utiliseront réellement.
Le document suggère que cette approche permet aux chercheurs de construire des agents qui sont non seulement plus capables, mais aussi plus fiables dans leurs tâches spécifiques. Bien que les agents luttent encore avec la récupération d'erreurs complexes, la capacité de les entraîner dans le « vrai cockpit » plutôt que dans un « jeu vidéo » est une étape majeure. Cela signifie qu'à l'avenir, nous pourrions voir des agents d'IA véritablement prêts à travailler à nos côtés, non pas seulement dans des simulations, mais dans les outils numériques que nous utilisons quotidiennement.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.