← Nieuwste papers
💬 NLP

Recursive Agent Optimization

Het artikel introduceert Recursive Agent Optimization (RAO), een versterkingsleerframework dat agenten traint om subtaken recursief aan zichzelf toe te vertrouwen, waardoor de trainingsefficiëntie wordt verbeterd, schaalbaarheid buiten contextlimieten mogelijk wordt gemaakt en generalisatie naar complexe problemen wordt versterkt via verdeel-en-heers-strategieën.

Oorspronkelijke auteurs: Apurva Gandhi, Satyaki Chakraborty, Xiangjun Wang, Aviral Kumar, Graham Neubig

Gepubliceerd 2026-05-08
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Apurva Gandhi, Satyaki Chakraborty, Xiangjun Wang, Aviral Kumar, Graham Neubig

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je een zeer slim, maar licht vergeetachtig, persoonlijk assistent voor. Je geeft hen een enorme, ingewikkelde taak, zoals het plannen van een driedaagse reis naar Kyoto voor een gezin van vier, of het vinden van een specifiek feit dat verborgen ligt in een bibliotheek van een miljoen boeken.

Als je deze taak aan één enkele assistent geeft, kunnen twee dingen misgaan:

  1. Ze raken overweldigd: De instructies zijn te lang, en ze vergeten het begin van het plan tegen de tijd dat ze het einde bereiken.
  2. Ze raken vast: De taak is te groot om in één keer te doen, dus geven ze op of maken ze fouten.

Dit artikel introduceert een nieuwe manier om deze assistenten te trainen, genaamd Recursive Agent Optimization (RAO). In plaats van gewoon één assistent te trainen om alles alleen te doen, leert RAO hen een superkracht: het vermogen om zichzelf te klonen.

Hier is hoe het werkt, met behulp van eenvoudige analogieën:

1. De "Kloonleger"-strategie

Op de oude manier zou een assistent, als ze een onderwerp moesten onderzoeken, alles in één lange lijn lezen. Als de tekst te lang was, zouden ze details missen.

Met RAO kijkt de hoofdassistent (laten we haar de Manager noemen) naar een grote taak en zegt: "Dit is te groot om ik allemaal in mijn hoofd te houden. Ik ga het opsplitsen."

Ze spawn vervolgens Sub-Agenten (klonen van zichzelf).

  • Manager: "Jij, Sub-Agent A, zoek de beste plekken voor kersenbloesem."
  • Manager: "Jij, Sub-Agent B, zoek een rustige tempel en een kindvriendelijke activiteit."
  • Sub-Agent B: "Wacht, ik kan niet beide tegelijk doen. Ik spawn mijn eigen klonen! Sub-Agent B1, zoek de tempel. Sub-Agent B2, zoek de activiteit."

Dit creëert een boom van werknemers. Elke werknemer hoeft zich alleen te focussen op een klein, beheersbaar stukje van de puzzel. Ze hoeven niet de volledige geschiedenis van het project te onthouden; ze hoeven alleen hun specifieke kleine taak te onthouden.

2. Het "Teambonus"-systeem (Hoe ze leren)

De grote doorbraak van het artikel is niet alleen het gebruiken van klonen; het is hoe ze worden getraind om ze te gebruiken.

Stel je een videospel voor waarin je punten krijgt.

  • De oude manier: Je krijgt alleen punten als het hele spel wordt gewonnen. Als je een geweldige zet doet in het eerste level maar de eindbaas verliest, krijg je nul punten. Dit maakt het moeilijk om te leren hoe je de vroege levels goed speelt.
  • De RAO-methode: Je krijgt punten voor twee dingen:
    1. Heb jij je specifieke kleine taak opgelost? (Bijvoorbeeld: Heb je de tempel gevonden?)
    2. Hebben de mensen die je hebt ingehuurd (je sub-klonen) hun taken opgelost?

Als de Manager een Sub-Agent huurt die faalt, krijgt de Manager een "delegatieboete". Als de Manager een Sub-Agent huurt die slaagt, krijgt de Manager een "delegatiebonus".

Dit leert de Manager twee cruciale lessen:

  • Wanneer te klonen: Kloon niet voor een kleine taak (het is een tijdverspilling). Kloon wanneer de taak te groot is.
  • Hoe te klonen: Geef duidelijke instructies zodat je klonen kunnen slagen.

3. De resultaten: Wat het artikel vond

De onderzoekers testten dit op drie soorten "moeilijke taken":

  • Het "Crafting"-spel (TextCraft-Synth): Stel je een spel voor als Minecraft waarin je een complex item (zoals een bijenkorf) moet bouwen door veel kleinere items te combineren.

    • Resultaat: De met RAO getrainde agenten konden items bouwen die veel te complex waren voor een enkele agent om te hanteren. Ze konden zelfs "Moeilijk"-niveaupuzzels oplossen waar de single-agent-versie volledig in faalde.
    • Snelheid: Omdat de klonen tegelijkertijd aan verschillende onderdelen van het craftwerk konden werken (zoals één persoon hout zagen terwijl een ander schildert), voltooiden ze de taak veel sneller in werkelijke tijd, hoewel ze in totaal meer "stappen" zetten.
  • De "Lange Boek"-test (Oolong-Real): Stel je voor dat je een assistent vraagt om een specifieke zin te vinden in een boek van 55.000 woorden, maar de assistent kan maar 32.000 woorden "lezen" per keer.

    • Resultaat: De enkele assistent moest gokken of trucs gebruiken omdat het niet het hele boek kon lezen. De RAO-agent splitste het boek op in stukken, gaf elk stuk aan een andere kloon, en combineerde vervolgens de antwoorden. Het loste het probleem perfect op, terwijl de enkele agent faalde.
  • De "Diep Onderzoek"-test (DeepDive): Stel je voor dat je een assistent vraagt om een specifiek historisch feit te vinden dat vereist dat je het internet doorzoekt, vijf verschillende websites leest en de punten met elkaar verbindt.

    • Resultaat: De RAO-agent leerde het onderzoek op te splitsen in stappen (zoeken, verifiëren, synthetiseren) en deze te delegeren. Het was veel accurater dan de enkele agent, hoewel het langer duurde omdat de stappen achter elkaar gedaan moesten worden (je kunt niet tegelijkertijd naar twee verschillende feiten zoeken als ze van elkaar afhankelijk zijn).

De grote conclusie

Het artikel betoogt dat we niet gewoon geavanceerde tools (zoals klonen) moeten bouwen en hopen dat de AI uitzoekt hoe ze die moet gebruiken. In plaats daarvan moeten we de AI specifiek trainen om die tools te gebruiken.

Door de AI te leren grote problemen op te splitsen in kleine, deze te delegeren aan zijn eigen klonen, en de klonen te belonen voor goed werk, wordt de AI:

  1. Slimmer bij moeilijke problemen: Het kan dingen aanpakken die te groot zijn voor zijn geheugen.
  2. Sneller bij parallelle taken: Het kan veel dingen tegelijk doen.
  3. Beter in leren: Het leert sneller omdat het feedback krijgt op elke kleine stap, niet alleen op het eindresultaat.

Kortom, RAO verandert een enkele, overweldigde werknemer in een goed georganiseerd, zelfbeherend team dat problemen kan oplossen die geen enkele werknemer ooit alleen zou kunnen aanpakken.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →