← Nieuwste papers
🤖 machine learning

Efficient Reinforcement Learning for Long-Horizon Tool-Use Agentic Tasks

Dit artikel introduceert SINKFLEX-RL, een modulair trainingssysteem dat omgevingsinterfaces, RL-dataflow en een sink-bewust FlexAttention-pad integreert om geheugenefficiënt, langdurig reinforcement learning voor gereedschapgebruikende agenten mogelijk te maken, waarbij verbeterde validatiebeloningen en significante VRAM-reducties in voorlopige benchmarks worden aangetoond.

Oorspronkelijke auteurs: Zelei Cheng, Amritansh Mishra, Sambit Sahu, William Campbell

Gepubliceerd 2026-08-12
📖 9 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Zelei Cheng, Amritansh Mishra, Sambit Sahu, William Campbell

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een superintelligente robot leert om een zeer ingewikkeld, meerdaags bordspel te spelen. Dit is geen spel waarbij je gewoon dobbelstenen gooit en een pion verplaatst; dit is een spel waarbij de robot met andere spelers moet praten, een gereedschapskist met speciale gadgets moet gebruiken, een strikt regelboek moet volgen en dagen moet wachten om te weten of hij daadwerkelijk heeft gewonnen. Dit is de wereld van "Agentic AI", waar computerprogramma's handelen als kleine agenten die acties kunnen ondernemen in een digitale wereld. Het grote probleem is dat deze spellen zo lang en complex worden dat het brein van de robot (zijn geheugen) begint te overstromen. Het is alsoals proberen elk woord van een 10-urige conversatie te onthouden terwijl je ook nog wiskunde doet; uiteindelijk raak je simpelweg de ruimte kwijt om na te denken. Wetenschappers proberen uit te zoeken hoe ze deze robots kunnen trainen om beter te worden in deze lange spellen zonder dat hun brein smelt door de enorme hoeveelheid informatie die ze moeten vasthouden.

Dit artikel introduceert een nieuw trainingssysteem genaamd SINKFLEX-RL, wat een slimme truc is om de robot te helpen de belangrijkste delen van het spel te onthouden zonder een groter brein nodig te hebben. De onderzoekers hebben een systeem gebouwd dat een standaard spelinterface combineert met een slimme manier om van fouten te leren (genaamd "Group-Relative Policy Optimization" of GRPO) en een speciale geheugenbesparende techniek voor de aandacht van de robot. In plaats van te proberen elk enkel detail van de afgelopen 8.000 stappen in een gesprek te onthouden, gebruikt het systeem een "sink"-mechanisme (een afvoer of put). Denk hierbij aan een magische spons in de geest van de robot: het absorbeert de overweldigende ruis van oude informatie, maar behoudt de essentiële "sinks" (de startpunten) die de robot helpen stabiel te blijven. Door deze spons te gebruiken, kan de robot zich concentreren op de huidige zet zonder verpletterd te worden door het gewicht van het verleden.

Het team heeft dit systeem getest in een gesimuleerde winkelomgeving waarin de robot een klant moet helpen, gereedschap moet gebruiken om de voorraad te controleren en winkelbeleid moet volgen. In deze vroege tests steeg de score van de prestaties van de robot, van 0,25 naar 0,44 naarmate hij leerde. Maar de echte magie gebeurde toen ze testten hoeveel computergeheugen (VRAM) het systeem nodig had. Wanneer het gesprek erg lang werd (8.192 tokens), liep de oude, standaard manier van denken zonder geheugen vast en crashte het systeem. Echter, het nieuwe SINKFLEX-RL-systeem ging gewoon door en gebruikte slechts 25,53 GB aan geheugen. Zelfs bij een iets kortere lengte van 4.096 tokens bespaarde het nieuwe systeem een enorme 19,7% aan geheugen vergeleken met de oude manier. De auteurs suggereren dat dit bewijst dat het mogelijk is om deze langdurige agenten te trainen zonder de noodzaak voor extreem dure hardware, hoewel ze opmerken dat dit slechts een voorlopige blik is en geen definitieve, perfecte oplossing.

Het Probleem: Het Geheugenlek van de Robot

Stel je voor dat jij de robot in dit verhaal bent. Je speelt een spel waarbij je een klant moet helpen een shirt te kopen. Je vraat de klant naar de maat, de klant vertelt het je, je controleert de voorraad, de klant vraagt om een andere kleur, je controleert opnieuw, enzovoort. Na 50 beurten moet je nog steeds het eerste dat ze zeiden onthouden om er zeker van te zijn dat je hun maat niet bent vergeten.

In de wereld van AI wordt dit een "long-horizon" taak genoemd. Het probleem is dat naarmate het gesprek langer wordt, de hoeveelheid geheugen die de computer nodig heeft om al die woorden vast te houden, ongelooflijk snel groeit. Het is alsof je een rugzak draagt die zwaarder wordt bij elke stap die je zet. Als het gesprek te lang wordt (zo als 8.000 woorden), wordt de rugzak zo zwaar dat de robot instort. Dit wordt het "uitlopen van VRAM" (Video Random Access Memory) genoemd, het snelle geheugen dat de computer gebruikt om na te denken.

De onderzoekers merkten op dat standaard manieren om deze robots te trainen tegen een "geheugenmuur" aanliepen. De robots kwamen vast te zitten omdat ze probeerden alles expliciet te onthouden, wat te duur is. Ze hadden een manier nodig om efficiënt te zijn zonder het vermogen om te redeneren te verliezen.

De Oplossing: De Magische Spons en de Groepsvergadering

Het artikel stelt een drieledige oplossing voor om dit geheugenlek te repareren, die ze SINKFLEX-RL noemen.

1. De Gymnasium Wrapper (De Universele Afstandsbediening)
Eerst bouwden ze een standaard interface, zoals een universele afstandsbediening, waarmee de robot met verschillende spelomgevingen kan communiceren. Of de robot nu in een winkel, een bank of een reisbureau is, deze wrapper zorgt ervoor dat de robot weet hoe hij om hulp moet vragen, gereedschap moet gebruiken en feedback moet krijgen. Het is alsof je de robot een standaard set regels geeft, zodat hij niet voor elk nieuw spel een nieuwe taal hoeft te leren.

2. De Groepsvergadering (GRPO)
Vervolgens veranderden ze de manier waarop de robot leert. Normaal gesproken heeft een robot om te leren misschien een aparte "coach" (een waardemodel) nodig om te vertellen hoe goed een zet was. Maar die coach neemt extra geheugen in beslag. In plaats daarvan gebruikt dit systeem een methode genaamd Group-Relative Policy Optimization (GRPO).

Stel je voor dat de robot hetzelfde spel 10 keer achter elkaar speelt, maar telkens met iets andere keuzes. In plaats van een coach te vragen, kijkt de robot naar alle 10 de versies van zichzelf. Hij zegt: "Hé, versie 3 behaalde een betere score dan versie 1, dus ik zal de zetten van versie 3 kopiëren." Hij vergelijkt zichzelf met zijn eigen groep om te ontdekken wat het beste werkte. Dit is als een studiegroep waarbij studenten elkaars antwoorden vergelijken om te zien wie het goed had, zonder dat er een docent nodig is om elk blaadje te nakijken. Dit bespaart een enorme hoeveelheid geheugen omdat ze geen aparte coach hoeven te trainen.

3. De Magische Spons (Sink-Aware FlexAttention)
Dit is het meest creatieve deel. De "aandacht" van de robot is hoe hij beslist welke woorden in het gesprek belangrijk zijn. In een lang gesprek probeert de robot meestal elk enkel woord te bekijken, wat traag en geheugenintensief is.

De onderzoekers realiseerden zich dat in lange gesprekken het begin van de chat fungeert als een "sink" (een put of verzamelpunt) — een plek waar de aandacht van de robot van nature naar toe stroomt om stabiel te blijven. Ze creëerden een speciale wiskundige truc (met behulp van iets genaamd FlexAttention) die de robot in staat stelt om deze "sink"-woorden anders te behandelen.

Denk er zo over na: als je een boek van 100 pagina's leest, hoef je niet de hele inhoud van het boek tegelijk in je handen te houden. Je kunt de eerste pagina (de sink) en de huidige pagina die je leest vasthouden, en de middelste pagina's laten vervagen totdat je ze weer nodig hebt. De "sink" is als een bladwijzer die de context van het verhaal levend houdt zonder dat je het hele boek hoeft te dragen. Het systeem gebruikt een "zero-value sink", wat een wiskundige manier is om te zeggen: "We hoeven de werkelijke data van de oude woorden niet op te slaan, we moeten alleen weten dat ze er waren om ons evenwicht te bewaren." Dit stelt de robot in staat om lange gesprekken (tot 8.192 tokens) aan te kunnen zonder dat het geheugen volloopt.

De Resultaten: Werkt het?

Het team heeft dit nieuwe systeem getest in een gesimuleerde winkelomgeving. Ze volgden de voortgang van de robot tijdens het leren over een bepaalde periode.

  • Leerproces: Aan het begin van de training was de score van de robot voor het helpen van klanten 0,25. Aan het einde van het geobserveerde trainingsvenster was de score gestegen naar 0,44. Het team zag ook dat de "training score" en de "trajectory reward" (wat als interne controlepunten zijn voor hoe goed de robot het doet) respectievelijk stegen van 0,18 naar 0,40 en 0,39. Dit suggereert dat de robot daadwerkelijk leert en beter wordt, hoewel de auteurs voorzichtig zijn in hun opmerking dat dit slechts een voorlopige blik is en geen definitief bewijs dat de methode perfect is.

  • Geheugenbesparing: Het meest opwindende resultaat ging over het geheugen. Ze testten het systeem met verschillende gespreklengtes:

    • Bij 4.096 tokens had de oude manier 28,06 GB aan geheugen nodig. Het nieuwe SINKFLEX-RL-systeem had slechts 22,52 GB nodig. Dat is een besparing van 5,54 GB, oftewel 19,7%.
    • Bij 8.192 tokens crashte de oude manier volledig (het liep zonder geheugen, of "OOM"). Het nieuwe systeem bleef echter gewoon draaien en gebruikte slechts 25,53 GB aan geheugen.

Wat dit betekent (en wat het niet betekent)

Het artikel laat zien dat het mogelijk is om door een standaard spelinterface, een slimme groepslernmethode en een geheugenbesparende aandachtstruc te combineren, robots te trainen voor zeer lange, complexe taken zonder dat er een supercomputer nodig is. De "sink"-truc werkt als een spons die de geheugendruk absorbeert, zodat de robot kan doorgaan.

De auteurs zijn echter ook heel eerlijk over wat ze nog niet hebben bewezen. Ze hebben niet getest of dit de beste manier is om te leren, of dat het voor elk type robot werkt. Ze hebben ook niet gemeten hoe veel sneller de robot leert, alleen dat de robot kan leren zonder te crashen. Ze merkten ook op dat dit een "proof of concept" is — een succesvolle testloop die laat zien dat het idee werkt, maar het is geen afgewerkt product dat klaar is voor de echte wereld.

Kortom, SINKFLEX-RL is een veelbelovend nieuw hulpmiddel dat AI-agenten helpt om lange gesprekken te onthouden zonder dat hun brein explodeert. Het suggereert dat we, met de juiste trucs, robots kunnen bouwen die slim genoeg zijn om complexe, meerdaagse taken aan te kunnen, zolang we ze een manier geven om met hun geheugen om te gaan.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →