← Nieuwste papers
🤖 machine learning

Single-Rollout Asynchronous Optimization for Agentic Reinforcement Learning

Dit artikel introduceert Single-rollout Asynchronous Optimization (SAO), een stabiel en efficiënt asynchroon reinforcement learning-framework dat groepsgewijze sampling vervangt door single-rollout-strategieën en strikte token-niveau clipping gebruikt om grootschalige agentische modellen zoals GLM-5.2 succesvol te trainen op complexe codering- en redeneerbenchmarks.

Oorspronkelijke auteurs: Zhenyu Hou, Yujiang Li, Jie Tang, Yuxiao Dong

Gepubliceerd 2026-07-09
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Zhenyu Hou, Yujiang Li, Jie Tang, Yuxiao Dong

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een team van student-chefs traint om de perfecte maaltijd te koken. In de oude manier van doen (wat het artikel Synchrone RL noemt), riep de chef-kok: "Iedereen, beginnen met koken!" en wachtte vervolgens af. De studenten begonnen allemaal aan hun gerechten te werken. Maar hier is het probleem: sommige studenten zijn snel, en sommige zijn traag. De snelle studenten zouden hun gerechten afmaken en dan stilstaand tegen de muur staren, wachtend tot de traagste student klaar was. Pas wanneer iedereen klaar was, kon de chef-kok het eten proeven, feedback geven en iedereen vertellen wat ze het volgende moesten doen. Dit is ongelooflijk inefficiënt; de keuken zit vol met stilstand.

Om dit op te lossen, probeerden onderzoekers Asynchrone RL. In deze versie proeft de chef-kok direct aan een gerecht zodra een student klaar is en geeft direct feedback. De student kan meteen aan het volgende gerecht beginnen. De keuken staat nooit stil. Dit is veel sneller.

Er zat echter een grote adder onder het gras. Omdat de chef-kok gerechten proefde van studenten die op verschillende tijdstippen waren begonnen, veranderde het "recept" dat de studenten volgden constant. Sommige studenten kookten op basis van een oud recept, terwijl anderen een nieuw recept gebruikten. Deze verwarring maakte de training instabiel, en de studenten werden vaak slechter in koken in plaats van beter. Ook vereiste de populaire methode om deze studenten te beoordelen (genaamd GRPO) dat de chef-kok wachtte tot een groep studenten klaar was voordat hij een cijfer gaf, wat het wachttraject weer terugbracht.

De auteurs van dit artikel introduceerden een nieuwe methode genaamd SAO (Single-Rollout Asynchronous Optimization). Ze losten de chaos op met drie slimme trucs:

1. De "Directe Feedback"-regel (Single-Rollout)

In plaats van te wachten tot een groep studenten een batch afmaakt, zegt SAO: "Zodra één student een gerecht heeft afgerond, beoordeel dit dan onmiddellijk."

  • De Metafoor: Stel je een videogame voor waarbij je een score krijgt op het moment dat je een level voltooit, in plaats van te wachten tot je hele partij klaar is. Dit elimineert de vertraging van het "wachten op de langzaamste persoon".
  • Het Probleem dat het Oplost: Het voorkomt dat de "groep" moet wachten op het traagste lid, waardoor de training op volle snelheid doorgaat.

2. Het "Strikte Veiligheidsnet" (Double-Sided Clipping)

Omdat de studenten zo snel werken en de recepten constant veranderen, is er een risico dat ze door het lint gaan en iets totaal wilds en gevaarlijks proberen.

  • De Metafoor: De auteurs plaatsten een "hek" rond de training. Als een nieuw idee van een student te veel afwijkt van wat de leraar verwacht (te ver naar links of te ver naar rechts), negeert het systeem dit niet alleen; het blokkeert de student volledig om van die specifieke fout te leren. Het is als een strenge coach die zegt: "Als je probeerd achteruit te rennen, zal ik je niet eens laten leren van die loop."
  • Het Probleem dat het Oplost: Dit voorkomt dat de training instabiel wordt of "ontploft" wanneer de studenten in de war raken door het snelle tempo.

3. De "Super-Coach" (Betere Value Model)

In de oude "groep"-methode kon de coach een gerecht van een student vergelijken met de gerechten van hun klasgenoten om te zien of het goed was. Maar in deze "één-voor-één"-methode zijn er geen klasgenoten om mee te vergelijken. De coach moet ongelooflijk slim zijn om te weten of een enkel gerecht op zichzelf goed of slecht is.

  • De Metafoor: De auteurs trainden een speciale "Value Coach" (een Critic) die veel slimmer is en hun kennis twee keer zo snel bijwerkt als de student-chefs. Ze bevroren ook de "instincten" (attention layers) van de coach zodat deze niet in de war zou raken, waarbij ze de coach alleen lieten leren over de specifieke details van het recept.
  • Het Probleem dat het Oplost: Dit zorgt ervoor dat zelfs wanneer de student alleen werkt, de coach nauwkeurig kan zeggen: "Ja, dat was een goede zet," of "Nee, dat was slecht," zonder een groep nodig te hebben om mee te vergelijken.

De Resultaten

De paper testte deze nieuwe methode op twee zeer moeilijke taken:

  1. Coderen: Een AI vragen om bugs in software te repareren (zoals een monteur die een auto repareert).
  2. Wiskundig Redeneren: Een AI vragen om complexe wiskundige problemen op te lossen (zoals een student die een moeilijk examen maakt).

De Uitkomst:

  • De oude methode (GRPO) begon wel goed, maar stortte na een tijdje in en faalde omdat het te veel in de war raakte.
  • De nieuwe SAO-methode hield de training langdurig soepel (tot 1.000 stappen) en werd consequent beter in scores.
  • Het bewees ook dat deze methode perfect is voor Online Learning, waarbij de regels van het spel veranderen terwijl je speelt. Bijvoorbeeld, als de leraar plotseling zegt: "Nu wil ik schattige verhalen," kon de met SAO getrainde AI snel van stijl wisselen, terwijl andere methoden te traag waren om zich aan te passen.

Kortom, de paper zegt: "Stop met wachten op groepen. Laat iedereen op eigen tempo werken, maar geef ze een strikt veiligheidsnet en een super-slimme coach die hun kennis direct bijwerkt. Dit maakt AI-training sneller, stabieler en beter in het oplossen van moeilijke, veranderende problemen."

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →