← Nieuwste papers
🤖 AI

LEGO-RL: Harness-Native Reinforcement Learning for Coding Agents

LEGO-RL is een framework dat schaalbare reinforcement learning voor coderingsagenten mogelijk maakt door native execution harnesses te overbruggen met policy-gradient optimalisatie via in-process LLM-proxying, robuuste sandbox-orkestratie en geïntegreerde monitoring, waardoor de modelprestaties op SWE-bench Verified over diverse omgevingen heen aanzienlijk worden verbeterd terwijl een hoge training-inferentie alignment behouden blijft.

Oorspronkelijke auteurs: Yiming Du, Yuxin Jiang, Tao Yuan, Jianbo Dai, Shaowei Wang, Jierun Chen, Chaofan Tao, Xianzhi Yu, Lifeng Shang, Kam-Fai Wong, Xiaohui Li, Haoli Bai

Gepubliceerd 2026-08-19
📖 6 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Yiming Du, Yuxin Jiang, Tao Yuan, Jianbo Dai, Shaowei Wang, Jierun Chen, Chaofan Tao, Xianzhi Yu, Lifeng Shang, Kam-Fai Wong, Xiaohui Li, Haoli Bai

Oorspronkelijk artikel vrijgegeven aan het publieke domein onder CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

In de wereld van kunstmatige intelligentie leren onderzoekers computers om te handelen als autonome software engineers. Deze digitale agenten beantwoorden niet simpelweg vragen; ze navigeren door complexe codebases, gebruiken hulpmiddelen om bugs op te lossen en draaien tests om te zien of hun wijzigingen werken. Om deze vaardigheden te leren, gebruiken de agenten een methere genaamd reinforcement learning (versterkend leren). Stel je een student voor die leert een puzzel op te lossen: ze proberen een zet, en als die hen dichter bij de oplossing brengt, krijgen ze een kleine beloning. Na verloop van tijd leren ze welke zetten leiden tot succes. Voor coderingsagenten houdt dit proces het genereren van lange reeksen acties in, het observeren van een draaiend computerprogramma en het ontvangen van een eenvoudig "ja" of "nee"-signaal dat aangeeft of de code die ze schreven het probleem daadwerkelijk heeft opgelost. De uitdaging ligt in het feit dat deze agenten opereren in rommelige, echte computeromgevingen waar dingen op onvoorspelbare manieren mis kunnen gaan. Als de omgeving crasht, als het beloningssysteem wordt misleid, of als de computer die de gedachten van de agent registreert de controle verliest over wat er daadwerkelijk is gezegd, dan stort het leerproces in. De agent kan leren het systeem te exploiteren of simpelweg stoppen met leren omdat de feedback die het ontvangt onbetrouwbaar is.

Een team van onderzoekers heeft een nieuw systeem ontwikkeld genaamd LEGO-RL om deze specifieke problemen op te lossen. Hun doel was om bestaande, complexe coderingsagenten te verbinden met krachtige leeralgoritmen zonder de agenten te dwingen hun werkwijze aan te passen. Denk aan de agent als een bekwame werker die precies weet hoe hij een specifieke set hulpmiddelen moet gebruiken en een specifieke workflow moet volgen. Eerdere pogingen om deze werkers te trainen vereisten vaak het volledig herbouwen van hun werkplek om aan de trainingssoftware te voldoen, wat regelmatig fouten veroorzaakte of het natuurlijke gedrag van de werker veranderde. Het LEGO-RL-team bouwde in plaats daarvan een brug die de trainingsoftware in staat stelt de werker precies zo te observeren als hij is, waarbij elke beweging en gedachte in realtime wordt vastgelegd, terwijl het leerproces wordt beschermd tegen de chaos van de echte wereld.

De kern van hun oplossing is een framework dat ervoor zorgt dat de trainende computer precies ziet wat de agent ziet en doet. Wanneer een agent een reactie genereert, legt een speciaal onderdeel de ruwe stroom woorden en de exacte waarschijnlijkheid vast die de agent aan elk woord toekende voordat andere software deze kon wijzigen of samenvatten. Dit is cruciaal omdat de software die de omgeving van de agent beheert, de geschiedenis vaak herschrijft of informatie comprimeert om ruimte te besparen. Als het trainingssysteem op deze herschreven versies zou vertrouwen, zou het de leerprogressie van de agent berekenen op basis van een vertekend geheugen van gebeurtenissen. Door de gegevens op het moment van generatie vast te leggen, hebben de onderzoekers ervoor gezorgd dat het leersignaal getrouw blijft aan de werkelijke beslissingen van de agent. Bovendien bouwden ze een systeem om de specifieke interne keuzes die de agent maakte af te spelen, waardoor zelfs complexe modellen met meerdere gespecialiseerde onderdelen leerden van het juiste pad.

Om het leerproces betrouwbaar te houden, creëerde het team een zeer georganiseerde omgeving waarin elke test in zijn eigen geïsoleerde, beveiligde container wordt uitgevoerd. Dit voorkomt dat één defecte test het hele systeem laat crashen en voorkomt dat agenten manieren vinden om het scorend systeem te omzeilen. Ze verstopten bijvoorbeeld de antwoorden voor de agenten tijdens de test en zorgden ervoor dat de software die het werk beoordeelde, niet gemanipuleerd kon worden. Ze ontwierpen het systeem ook om op een gracieuze manier met fouten om te gaan. Als een agent vastloopt of de omgeving crasht, identificeert het systeem het probleem, verwerpt het die specifieke poging en gaat het verder zonder de leerdata te laten corrumperen. Dit maakt het mogelijk dat de training soepel doorgaat, zelfs wanneer individuele tests falen, wat regelmatig voorkomt bij complexe coderingsopdrachten.

De onderzoekers testten dit systeem door een groot taalmodel te trainen met drie verschillende, bestaande frameworks voor coderingsagenten. Ze kwamen tot de conclusie dat het systeem uitstekend werkte over alle drie de frameworks. Het vermogen van het model om real-world softwareproblemen op te lossen verbeterde aanzienlijk. Bij het gebruik van een populair framework sprong het succespercentage van 64 procent naar meer dan 70 procent. Met een ander steeg het van 62 procent naar bijna 68 procent, en met een derde steeg het van 57 procent naar bijna 67 procent. Cruciaal was dat de onderzoekers verifieerden dat het leerproces eerlijk was; de wiskundige relatie tussen wat de agent deed en wat het trainingssysteem berekende bleef bijna perfect, met een correlatie boven de 99 procent. Dit bewees dat het systeem niet alleen geluk had, maar daadwerkelijk leerde van de juiste gegevens.

Naast het verbeteren van scores bood het systeem ook een helder venster in hoe de agenten leerden. De onderzoekers konden de training in realtime volgen, waarbij ze precies zagen waarom een test faalde of hoe het gedrag van de agent over weken van training veranderde. Ze observeerden dat naarming de agenten hun eigen werk vaker gingen controleren, door bestanden te lezen die ze net hadden bewerkt om te controleren of hun wijzigingen correct waren. Ze merkten ook op dat de agenten meer stappen gingen zetten om problemen op te lossen, door langere en complexere gesprekken met de computer aan te gaan om tot een oplossing te komen. Dit niveau van detail stelde de onderzoekers in staat om problemen snel te diagnosticeren, zoals wanneer een agent stopte met het gebruiken van hulpmiddelen en in plaats daarvan tekst begon te schrijven, en om de training dienovereenkomstig aan te passen.

Het succes van LEGO-RL toont aan dat het opschalen van de training van coderingsagenten meer vereist dan alleen snellere computers of grotere modellen. Het vereist een systeem dat de integriteit van de workflow van de agent respecteert en tegelijkert z een stabiele, observeerbare omgeving biedt voor leren. Door een framework te bou�n dat gegevens getrouw vastlegt, beschermt tegen fouten en diepe zichtbaarheid biedt in het trainingsproces, hebben de onderzoekers aangetoond dat het mogelijk is om complexe softwareagenten betrouwbaar te leren verbeteren. Hun werk suggereert dat de toekomst van autonome codering niet ligt in het dwingen van agenten in rigide mallen, maar in het bouwen van flexibele, robuuste systemen die kunnen leren van de chaotische realiteit van softwareontwikkeling.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →