← Nieuwste papers
💬 NLP

Envs-FORGE: Frontier-Optimized Reward-Grounded Environment Synthesis for Agent RL

Envs-FORGE is een nieuw prompting-beleid dat de synthese van omgevingen voor reinforcement learning dynamisch optimaliseert door verifier-beloningen om te zetten in per-seed acties via mixed-integer lineaire programmering, waardoor op maat gemaakte trainingsomgevingen worden gegenereerd die de prestaties van agenten over diverse benchmarks aanzienlijk verbeteren vergeleken met fixed-recipe baselines.

Oorspronkelijke auteurs: Xiaojun Wu, Cehao Yang, Honghao Liu, Xueyuan Lin, Zhichao Shi, Hao Zhou, Xuhui Jiang, Chengjin Xu, Jia Li, Jian Guo

Gepubliceerd 2026-08-17
📖 6 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Xiaojun Wu, Cehao Yang, Honghao Liu, Xueyuan Lin, Zhichao Shi, Hao Zhou, Xuhui Jiang, Chengjin Xu, Jia Li, Jian Guo

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een robot probeert te leren hoe hij een computer moet repareren of een stuk code moet schrijven. Je kunt hem niet gewoon een handleiding geven; hij moet oefenen door het echt te doen. Dit is de wereld van Reinforcement Learning (RL), waarbij een AI-agent leert door dingen uit te proberen, fouten te maken en een "beloning" (zoals een hoge score) te krijgen wanneer het lukt. Maar hier is de crux: voor de robot om beter te worden, moeten de oefenproblemen die hij oplost precies goed zijn. Als de problemen te makkelijk zijn, raakt de robot verveeld en leert hij niets nieuws. Als ze te moeilijk zijn, raakt hij gefrustreerd en geeft hij op. Het ideale punt wordt de "learning frontier" genoemd—de rand van wat de robot momenteel kan, waar een beetje uitdaging helpt om het meeste te groeien.

Lama tijd hebben wetenschappers geprobeerd om deze oefenproblemen automatisch te creëren met behulp van Large Language Models (LLMs), de superintelligente AI-hersenen achter chatbots. Ze gebruikten eenvoudige, vaste recepten om taken te genereren, een beetje zoals een chef die telkens exact hetzelfde recept gebruikt om elke maaltijd te koken, ongeacht of de diner een peuter of een fijnproever is. Dit artikel introduceert een nieuwe, slimmere manier om deze oefenproblemen te bereiden. Het heet Envs-FORGE. In plaats van een een-maat-past-iedereen-recept, werkt deze nieuwe methode als een persoonlijke trainer die naar de huidige kracht van de robot kijkt, bepaalt hoe moeilijk de volgende uitdaging precies moet zijn, en dan een unieke oefening op maat bouwt. Het doel is om ervoor te zorgen dat elke enkele oefentaken perfect is afgestemd om de robot net een klein beetje verder te duwen dan hij voorheen kon.

Het probleem met "één-maat-past-iedereen" recepten

In het verleden vertrouwden onderzoekers, wanneer ze nieuwe trainings-taken wilden maken voor deze AI-agenten, op vaste strategieën. Stel je een leraar voor die een enkel werkblad heeft en besluit om het voor elke leerling simpelweg "iets moeilijker te maken", ongeacht wie ze zijn. Voor een leerling die de toets al met vlag en wimpel heeft gehaald, kan dit nieuwe werkblad nog steeds te makkelijk zijn. Voor een leerling die moeite had, kan het onmogelijk zijn.

Het artikel betoogt dat deze vaste methoden—zoals "Self-Instruct" of "Evol-Instruct"—als die rigide leraar zijn. Ze passen dezelfde logica toe op elk startidee (of "seed") zonder te controleren of de AI er klaar voor is. Ze kunnen een taak moeilijker maken terwijl deze makkelijker had moeten worden gemaakt, of ze kunnen het onderwerp volledig veranderen terwijl de AI alleen een specifieke vaardigheid dieper had moeten oefenen. Dit verspilt tijd en resulteert in trainingsdata die niet erg nuttig is.

Ontmoet Envs-FORGE: De slimme persoonlijke trainer

De auteurs van dit artikel presenteren Envs-FORGE (Frontier-Optimized Reward-Grounded Environment Synthesis). Denk aan dit als een slim systeem dat niet alleen raadt wat de volgende stap is; het berekent het.

Zo werkt het, stap voor stap:

  1. De Check-up: Eerst bekijkt het systeem een starttaak en vraat de huidige AI-agent om de taak op te lossen. Het telt hoe vaak de agent slaagt. Dit geeft een "pass rate", wat een soort rapportcijfer is dat laat zien hoe makkelijk of moeilijk de taak is voor die specifieke robot op dit moment.
  2. De Strategievergadering: Op basis van dat rapportcijfer overweegt het systeem zes verschillende manieren om de taak te veranderen. Het kan kiezen om te:
    • Verhogen van de moeilijkheidsgraad (meer beperkingen of randgevallen toevoegen).
    • Verlagen van de moeilijkheidsgraad (het vereenvoudigen als de robot vastloopt).
    • Diversifiëren van de taak (de context veranderen maar de moeilijkheidsgraad vergelijkbaar houden).
    • En voor elk van deze kan het in-depth gaan (dieper graven in hetzelfde onderwerp) of in-breadth gaan (een breder, gerelateerd onderwerp verkennen).
  3. De Wiskundige Magie (MILP): Het systeem gebruikt een speciaal soort wiskundige puzzel genaamd een "Mixed-Integer Linear Program" (MILP) om de enkele beste combinatie van veranderingen voor die specifieke taak te kiezen. Het is als een coach die naar de statistieken van een speler kijkt en besluit: "Oké, voor deze speler moeten we de moeilijkheidsgraad in-depth verhogen om de perfecte leerzone te raken."
  4. De Constructie: Zodra de beste strategie is gekozen, schrijft het systeem het hele taakpakket opnieuw. Het verandert niet alleen de vraag; het werkt ook de instructies, de data, de oplossing, de tests en zelfs de computermonitoring (zoals een Docker container) bij om ervoor te zorgen dat alles nog steeds samenwerkt.
  5. De Gold Standard Check: Voordat de nieuwe taak de trainingsgym binnen mag, gaat deze door een strikte "Gold Verifier". Dit is een superstrenge test om te controleren of de nieuwe taak uitvoerbaar, consistent en daadwerkelijk oplosbaar is. Als het faalt, wordt het weggegooid. Alleen de perfecte taken komen erdoor.

Wat ze ontdekten

De onderzoekers testten deze nieuwe methode op een krachtig AI-model genaamd Qwen 3.5 35B. Ze vergeleken Envs-FORGE met de oude vaste recepten (Few-shot, Self-Instruct, en Evol-Instruct) en een baseline-model zonder extra training.

De resultaten waren duidelijk: Envs-FORGE won.

  • Op een benchmark genaamd tb-core scoorde het basemodel 40,0%. Het beste vaste recept behaalde 46,8%, maar Envs-FORGE schoot omhoog naar 49,2%. Dat is een verbetering van 9,2 procentpunt ten opzichte van het startpunt.
  • Op tb-2.0 scoorde het basemodel 23,0%, terwijl Envs-FORGE 29,4% bereikte, een sprong van 6,4 procentpunt.
  • Zelfs op een zeer moeilijke real-world test genaamd SWE-bench Verified, behaalde Envs-FORGE een score van 77,1%, waarmee het de 73,4% van het basemodel versloeg.

Cruciaal was dat het artikel laat zien dat dit niet kwam doordat Envs-FORGE meer computerkracht gebruikte of meer data genereerde. Alle methoden genereerden exact 100 geverifieerde omgevingen voor training. Het verschil zat puur in hoe ze kozen wat die 100 taken moesten zijn. Envs-FORGE koos simpelweg betere taken.

Waarom dit ertoe doet

De belangrijkste les uit dit artikel is dat de manier waarop we trainingsdata creëren net zo belangrijk is als de data zelf. Door te stoppen met het gebruik van rigide, een-maat-past-iedereen-recepten en in plaats daarvan een slim, datagestuurd proces te gebruiken om elke taak aan te passen aan de huidige capaciteit van de AI, kunnen we deze agenten sneller en beter leren.

De auteurs suggereren dat deze "frontier-aware" aanpak—het constant controleren waar de agent staat en de uitdaging aanpassen om hem op de rand van zijn mogelijkheden te houden—de sleutel is tot het bouwen van meer capabele terminal agents die complexe software engineering en systeembeheer taken kunnen afhandelen. Hoewel de studie zich richtte op specifieke benchmarks en modelgroottes, wijzen de resultaten sterk aan dat deze methode van "slimme synthese" een significante stap voorwaarts is in het onderwijzen van AI om te leren.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →