← Nieuwste papers
💬 NLP

OpenForgeRL: Train Harness-native Agents in Any Environment

OpenForgeRL is een open-source framework dat het end-to-end trainen van harness-native AI-agenten in diverse omgevingen mogelijk maakt door inferentie te ontkoppelen van training via een lichtgewicht proxy en een Kubernetes-orchestrator, waarmee staat-van-de-kunst prestaties wordt behaald op complexe tool- en GUI-benchmarks, terwijl inzichten worden geboden in hoe harness-keuzes en reinforcement learning het gedrag van agenten vormgeven.

Oorspronkelijke auteurs: Xiao Yu, Baolin Peng, Ruize Xu, Hao Zou, Qianhui Wu, Hao Cheng, Wenlin Yao, Nikhil Singh, Zhou Yu, Jianfeng Gao

Gepubliceerd 2026-08-10
📖 8 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Xiao Yu, Baolin Peng, Ruize Xu, Hao Zou, Qianhui Wu, Hao Cheng, Wenlin Yao, Nikhil Singh, Zhou Yu, Jianfeng Gao

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je een wereld voor waarin computers niet alleen vragen beantwoorden, maar ook daadwerkelijk dingen voor je doen. Ze kunnen code schrijven, vluchten boeken of je digitale bestanden organiseren. Om dit mogelijk te maken, hebben wetenschappers "AI-agenten" gebouwd—slimme programma's die kunnen denken, plannen en hulpmiddelen kunnen gebruiken. Maar hier komt de crux: deze agenten werken niet in een vacuüm. Ze hebben een "harness" (tuig) nodig, wat een soort complexe controlekamer of een gespecialiseerde cockpit is. Deze harness beheert het geheugen van de agent, verbindt de agent met het internet en helpt de agent om tools te gebruiken zoals een rekenmachine of een webbrowser. Denk aan de harness als de stoel van de piloot en de agent als de piloot; je kunt een piloot niet alleen trainen in een videogame en verwachten dat hij een echte 747 bestuurt. Een echt vliegtuig heeft specifieke knoppen, noodprotocollen en een cockpitindeling die de videogame nooit heeft getoond.

Lange tijd was er een groot probleem: de "videogames" (eenvoudige trainingsomgevingen) kwamen niet overeen met de "echte vliegtuigen" (de complexe harnesses die in de echte wereld worden gebruikt). Onderzoekers konden agenten gemakkelijk trainen, maar wanneer ze ze in de echte, chaotische harnesses plaatsten, raakten de agenten in de war of faalden ze. Dit paper, getiteld "OpenForge RL", pakt precies die mismatch aan. Het introduceert een nieuwe manier om deze digitale piloten direct in de echte cockpits te trainen waarin ze uiteindelijk zullen vliegen, met behulp van een systeem dat hen in staat stelt om te oefenen op duizenden verschillende "vliegtuigen" tegelijkertijd zonder de hele trainingsfaciliteit te laten crashen.


Het Probleen: Trainen in een Videogame versus Vliegen in een Echt Vliegtuig

Stel je voor dat je een robot probeert te leren een auto te repareren. Als je hem traint in een simpele videogame waar de motor gewoon een rode knop is en de band een blauw vierkant, leert de robot om op rood te drukken en blauw te pakken. Maar wanneer je die robot in een echte garage zet met een echte motor, een echte band en een miljoen andere gereedschappen, bevriest hij. Hij weet niet hoe hij met de echte complexiteit moet omgaan.

Dit is wat er is gebeurd met AI-agenten. Moderne agenten zijn krachtig, maar ze vertrouwen op geavanceerde "harnesses" (zoals Claude Code of Codex) om hun gedachten en tools te beheren. Deze harnesses zijn als de echte cockpit: ze hebben een stateful geheugen (onthouden wat er vijf stappen geleden gebeurde), multi-process workflows (meerdere dingen tegelijk uitvoeren) en complexe tool-verbindingen. Echter, de standaard manieren waarop onderzoekers AI trainen (met behulp van Reinforcement Learning) gaan meestal uit van een eenvoudige, vlakke omgeving. Ze proberen de agent te trainen in een vereenvoudigde versie van de harness, wat een "train-deploy mismatch" creëert. Het is alsof je een piloot traint op een simulator die niet over de echte noodremmen beschikt, en vervolgens verwacht dat hij een echt vliegtuig landt wanneer de remmen falen.

De Oplossing: OpenForge RL (De Cloud-Garage)

De auteurs van dit paper hebben OpenForge RL gebouwd, een framework dat fungeert als een enorme, cloud-gebaseerde garage. In plaats van te proberen de echte, complexe harness in een simpele trainingsbox te dwingen, doet OpenForge RL het tegenovergestelde: het neemt de trainingsbox en stuurt deze naar de echte harness.

Zo werkt het, met behulp van een speelse analogie:

  1. De Remote Pods (De Cloud-Garage): Stel je voor dat je een vloot kleine, zelfrijdende garages in de cloud hebt. Elke garage is een container die een specifieke "harness" bevat (zoals een specifiek automodel). OpenForge RL gebruikt een "Kubernetes orchestrator" (denk aan een superefficiënte garagebeheerder) om duizenden van deze remote garages direct op te spinnen.
  2. De Proxy (De Twee-Zijdig-Spiegel): Binnen elke garage probeert de AI-agent een taak op te lossen. Een "lichtgewicht proxy" fungeert als een twee-zijdig spiegelglas. Het laat de agent communiceren met de echte harness en de echte omgeving (zoals een echte computer of webbrowser), maar neemt stiekem elke beweging, gedachte en tool-klik op.
  3. De Training Loop: De proxy stuurt deze opgenomen "vluchtlogs" terug naar de centrale trainingshersenen (die standaardtools zoals veRL gebruiken). De hersenen leren van deze echte logs, updaten de hersenen van de agent en sturen de nieuwe versie weer terug naar de remote garages om het opnieuw te proberen.

De magie is dat de training plaatsvindt binnen de echte harness, in de echte omgeving, maar dat het zware werk van het beheren van al die verschillende omgevingen wordt afgehandeld door de cloud. Dit betekent dat onderzoekers agenten kunnen trainen op "ZeroClaw", "OpenClaw", "Codex", of zelfs visuele GUI-agenten (agenten die een muis en toetsenbord gebruiken) allemaal tegelijkertijd, zonder dat ze hun trainingscode voor elke nieuwe tool opnieuw hoeven te schrijven.

Wat Ze Vonden: Echt Trainen Werkt Beter

Het team testte dit systeem met twee soorten agenten: Claw Agents (die tekst en tools gebruiken om dingen te doen zoals e-mails zoeken of bestanden beheren) en GUI Agents (die naar een scherm kijken en een muis gebruiken om op knoppen te klikken in een webbrowser of computer).

Ze trainden deze agenten met slechts enkele honderden tot enkele duizenden taken—veel minder dan sommige enorme modellen die miljoenen gebruiken. De resultaten waren indrukwekkend:

  • Voor Claw Agents: Hun model, OpenForge-Claw, scoorde 31.7 (pass@3) op de ClawEval benchmark en 33.7 op QwenClawBench. Dit was aanzienlijk beter dan andere open-source modellen van vergelijkbare grootte (rond de 30 miljard parameters). Sterker nog, het presteerde beter dan sommige modellen die vele malen groter zijn.
  • Voor GUI Agents: Hun model, OpenForge-GUI, bereikte een score van 37.7 op OSWorld-Verified, 63.0 op Online-Mind2Web, en 72.3 op WebVoyager. Dit is een grote prestatie omdat GUI-taken ongelooflijk moeilijk zijn; de agent moet het scherm "zien" en uitzoeken waar hij moet klikken. OpenForge-GUI kwam in de buurt van of versloof modellen die veel groter waren en getraind waren op veel meer data.

De "Harness"-Les: Niet Alle Cockpits Zijn Gelijk

Een van de meest interessante ontdekkingen was niet alleen dat de training werkte, maar ook hoe verschillende harnesses het leren beïnvloedden. De auteurs testten hun agenten in vier verschillende harnesses: ReACT (een simpele loop), ZeroClaw (lichtgewicht), OpenClaw, en Codex (zeer complex).

Ze ontdekten dat sommige harnesses veel moeilijker te leren zijn dan andere.

  • Simpelere, beter afgestemde harnesses (zoals ZeroClaw) lieten de agenten sneller leren en beter presteren.
  • Complexere harnesses (zoals Codex) waren moeilijker te beheersen. De agenten hadden meer moeite, en hoewel Reinforcement Learning (RL) hielp, waren de winsten kleiner vergeleken met de simpelere harnesses.

Dit suggereert dat het ontwerp van de "cockpit" net zo belangrijk is als de training van de piloot. Een goed ontworpen harness maakt de agent slimmer en betrouwbaarder.

Wat RL de Agenten Werkelijk Heeft Geleerd

De auteurs keken ook nauwgezet naar wat de agenten daadwerkelijk leerden wanneer ze Reinforcement Learning (RL) toevoegden bovenop de basisgetrainde kennis (SFT). Ze ontdekten dat RL de agenten niet alleen in algemene zin "slimmer" maakte; het verbeterde specifiek de betrouwbaarheid:

  • Zelfverificatie: De agenten begonnen hun eigen werk te controleren. Bijvoorbeeld, als ze een bestand aanmaakten, waren ze eerder geneigd het terug te lezen om te controleren of het correct was.
  • Tool Coverage: Ze begonnen een breder scala aan tools te gebruiken in plaats van zich alleen te beperken tot één of twee tools die ze goed kenden.
  • Foutherstel: Dit was het lastige deel. Hoewel RL de agenten hielp bij het herstellen van kleine fouten, bleef foutherstel zwak. Zelfs na de training, als een agent een grote fout maakte, kon hij dit vaak niet herstellen en gaf hij het simpelweg op. De auteurs suggereren dat deze specifieke vaardigheid speciale data of andere trainingsmethoden vereist om te beheersen.

De Kern van het Verhaal

OpenForge RL bewijst dat je de echte wereld niet hoeft te vereenvoudigen om AI-agenten te trainen. Door een cloud-gebaseerd systeem te gebruiken dat de training loskoppelt van de omgeving, kun je agenten trainen direct in de complexe, chaotische, echte-wereld harnesses die ze daadwerkelijk zullen gebruiken.

Het paper suggereert dat deze aanpak onderzoekers in staat stelt om agenten te bouwen die niet alleen capabeler zijn, maar ook betrouwbaarder in hun specifieke taken. Hoewel de agenten nog steeds worstelen met complexe foutherstel, is het vermogen om hen te trainen in de "echte cockpit" in plaats van in een "videogame" een grote stap voorwaarts. Dit betekent dat we in de toekomst AI-agenten kunnen zien die echt klaar zijn om naast ons te werken, niet alleen in simulaties, maar in de eigenlijke digitale tools die we dagelijks gebruiken.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →