LEGO-RL: Harness-Native Reinforcement Learning for Coding Agents
LEGO-RL est un cadre qui permet un apprentissage par renforcement scalable pour les agents de codage en jetant un pont entre les harnais d'exécution natifs et l'optimisation par gradient de politique grâce au proxying de LLM en processus, à une orchestration de bac à sable robuste et à une surveillance intégrée, améliorant ainsi de manière significative la performance du modèle sur SWE-bench Verified à travers divers environnements tout en maintenant un alignement élevé entre entraînement et inférence.
Article original placé dans le domaine public sous CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Dans le monde de l'intelligence artificielle, des chercheurs apprennent aux ordinateurs à agir comme des ingénieurs logiciels autonomes. Ces agents numériques ne se contentent pas de répondre à des questions ; ils naviguent dans des bases de code complexes, utilisent des outils pour corriger des bogues et exécutent des tests pour voir si leurs modifications fonctionnent. Pour acquérir ces compétences, les agents utilisent une méthode appelée apprentissage par renforcement. Imaginez un étudiant apprenant à résoudre un puzzle : il tente un mouvement et, si celui-ci le rapproche de la solution, il reçoit une petite récompense. Au fil du temps, il apprend quels mouvements mènent au succès. Pour les agents de codage, ce processus implique de générer de longues séquences d'actions, de regarder un programme informatique s'exécuter et de recevoir un simple signal « oui » ou « non » indiquant si le code qu'ils ont écrit a réellement résolu le problème. Le défi réside dans le fait que ces agents opèrent dans des environnements informatiques réels et désordonnés où les choses peuvent mal tourner de manière imprévisible. Si l'environnement plante, si le système de récompense est trompé, ou si l'ordinateur enregistrant les pensées de l'agent perd la trace de ce qui a réellement été dit, le processus d'apprentissage se brise. L'agent pourrait apprendre à exploiter le système ou simplement cesser d'apprendre parce que le retour d'information qu'il reçoit est peu fiable.
Une équipe de chercheurs a développé un nouveau système appelé LEGO-RL pour résoudre ces problèmes spécifiques. Leur objectif était de connecter des agents de codage existants et complexes à de puissants algorithmes d'apprentissage sans forcer les agents à modifier leur façon de travailler. Considérez l'agent comme un travailleur qualifié qui sait exactement comment utiliser un ensemble spécifique d'outils et suivre un flux de travail précis. Les tentatives précédentes pour entraîner ces travailleurs nécessitaient souvent de reconstruire l'intégralité de leur espace de travail pour l'adapter au logiciel d'entraînement, ce qui provoquait fréquemment des erreurs ou modifiait le comportement naturel du travailleur. L'équipe de LEGO-RL a plutôt construit un pont qui permet au logiciel d'entraînement d'observer le travailleur exactement tel qu'il est, capturant chaque mouvement et chaque pensée en temps réel tout en protégeant le processus d'apprentissage du chaos du monde réel.
Le cœur de leur solution est un cadre qui garantit que l'ordinateur d'entraînement voit exactement ce que l'agent voit et fait. Lorsqu'un agent génère une réponse, un composant spécial capture le flux brut de mots et la probabilité exacte que l'agent a assignée à chaque mot avant que tout autre logiciel ne puisse l'altérer ou le résumer. Cela est crucial car le logiciel qui gère l'environnement de l'agent réécrit souvent l'histoire ou compresse l'information pour économiser de l'espace. Si le système d'entraînement se référait à ces versions réécrites, il calculerait la progression de l'apprentissage de l'agent sur la base d'une mémoire déformée des événements. En capturant les données au moment de la génération, les chercheurs ont assuré que le signal d'apprentissage reste fidèle aux décisions réelles de l'agent. De plus, ils ont construit un système capable de rejouer les choix internes spécifiques faits par l'agent, garantissant que même les modèles complexes avec de multiples parties spécialisées apprennent à partir du bon chemin.
Pour maintenir la fiabilité du processus d'apprentissage, l'équipe a créé un environnement hautement organisé où chaque test s'exécute dans son propre conteneur isolé et sécurisé. Cela empêche un test défectueux de faire planter l'ensemble du système et empêche les agents de trouver des raccourcis pour contourner le système de notation. Par exemple, ils ont caché les réponses aux agents pendant le test et se sont assurés que le logiciel utilisé pour évaluer le travail ne pouvait pas être manipulé. Ils ont également conçu le système pour gérer les défaillances avec élégance. Si un agent est bloqué ou si l'environnement plante, le système identifie le problème, écarte cette tentative spécifique et passe à la suite sans laisser l'erreur corrompre les données d'apprentissage. Cela permet à l'entraînement de se poursuivre de manière fluide même lorsque des tests individuels échouent, ce qui arrive fréquemment dans les tâches de codage complexes.
Les chercheurs ont testé ce système en entraînant un grand modèle de langage à l'aide de trois cadres d'agents de codage différents et existants. Ils ont constaté que le système fonctionnait remarquablement bien sur les trois cadres. La capacité du modèle à résoudre des problèmes logiciels réels s'est considérablement améliorée. En utilisant un cadre populaire, le taux de réussite est passé de 64 % à plus de 70 %. Avec un autre, il est passé de 62 % à près de 68 %, et avec un troisième, il est monté de 57 % à près de 67 %. Crucialement, les chercheurs ont vérifié que le processus d'apprentissage était honnête ; la relation mathématique entre ce que l'agent a fait et ce que le système d'entraînement a calculé est restée presque parfaite, avec une corrélation supérieure à 99 %. Cela a prouvé que le système ne faisait pas seulement de la chance, mais apprenait véritablement à partir des bonnes données.
Au-delà de l'amélioration des scores, le système a offert une fenêtre claire sur la manière dont les agents apprennent. Les chercheurs ont pu observer l'entraînement en temps réel, voyant exactement pourquoi un test échouait ou comment le comportement de l'agent changeait au fil de plusieurs semaines d'entraînement. Ils ont observé qu'à mesure que les agents s'amélioraient, ils commençaient à vérifier leur propre travail plus souvent, lisant les fichiers qu'ils venaient de modifier pour s'assurer que leurs changements étaient corrects. Ils ont également remarqué que les agents commençaient à prendre plus d'étapes pour résoudre les problèmes, engageant des conversations plus longues et plus complexes avec l'ordinateur pour parvenir à une solution. Ce niveau de détail a permis aux chercheurs de diagnostiquer rapidement les problèmes, comme lorsqu'un agent cesse d'utiliser des outils pour se mettre à écrire du texte, et d'ajuster l'entraînement en conséquence.
Le succès de LEGO-RL démontre que l'augmentation de l'échelle de l'entraînement des agents de codage nécessite plus que des ordinateurs plus rapides ou des modèles plus grands. Cela exige un système qui respecte l'intégrité du flux de travail de l'agent tout en offrant un environnement stable et observable pour l'apprentissage. En construisant un cadre qui capture les données fidèlement, protège contre les erreurs et offre une visibilité profonde sur le processus d'apprentissage, les chercheurs ont montré qu'il est possible d'enseigner de manière fiable à des agents de codage complexes. Leur travail suggère que l'avenir du codage autonome ne réside pas dans le fait de forcer les agents dans des moules rigides, mais dans la construction de systèmes flexibles et robustes capables d'apprendre de la réalité désordonnée du développement logiciel.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.