← Nieuwste papers
💬 NLP

TRACE: A Unified Rollout Budget Allocation Framework for Efficient Agentic Reinforcement Learning

Dit artikel introduceert TRACE, een verenigd framework dat de allocatie van de rollout-budgetten in multi-turn agentic reinforcement learning optimaliseert door interacties te modelleren als boomstructuur-nodes en dynamisch zowel prompt-wortels als intermediaire prefixen te targeten met gemengde terminale beloningen om de beloningscontrast en de efficiëntie van beleidsleren te verbeteren.

Oorspronkelijke auteurs: Heming Zou, Qi Wang, Yun Qu, Yuhang Jiang, Lizhou Cai, Yixiu Mao, Ru Peng, Xin Xu, Weijie Liu, Kai Yang, Saiyong Yang, Xiangyang Ji

Gepubliceerd 2026-06-10
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Heming Zou, Qi Wang, Yun Qu, Yuhang Jiang, Lizhou Cai, Yixiu Mao, Ru Peng, Xin Xu, Weijie Liu, Kai Yang, Saiyong Yang, Xiangyang Ji

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een leraar bent die probeert een zeer slimme maar onervaren student (een AI) te leren hoe hij complexe puzzels moet oplossen, zoals wiskundeproblemen of het vinden van antwoorden in een enorme bibliotheek. De student leert door dingen uit te proberen, fouten te maken en aan het einde van de poging een simpel "Ja" of "Nee" te krijgen.

Het probleem is dat de leraar een beperkte hoeveelheid tijd (een "budget") heeft om de student te laten oefenen. Als de leraar de student 100 keer dezelfde makkelijke puzzel laat doen, of 100 keer dezelfde onmogelijke puzzel, leert de student niets. Ze moeten puzzels proberen die precies goed zijn — waar ze óf kunnen slagen óf kunnen falen, zodat ze het verschil kunnen leren.

Dit artikel introduceert een nieuwe methode genaamd TRACE om dit probleem op te lossen. Zo werkt het, met behulp van eenvoudige analogieën:

1. Het Probleem: Tijd Verspillen aan "Saai" Paden

In het verleden, wanneer onderzoekers AI aan het trainen waren, kozen ze een puzzel en lieten ze de AI de puzzel van begin tot eind oplossen.

  • Het Probleem: Als de puzzel te makkelijk is, wint de AI altijd. Als de puzzel te moeilijk is, verliest de AI altijd. In beide gevallen vertelt het "Ja/Nee"-antwoord aan het einde de AI niet waar het misging.
  • De Oude Manier: Onderzoekers probeerden betere puzzels te kiezen om mee te beginnen, maar zodra de AI begon met oplossen, lieten ze het proces gewoon tot het einde doorlopen. Ze stopten niet om te controleren of de AI halverwege vastliep.

2. De Oplossing: Het "Vertakkende Pad" (TRACE)

TRACE verandert het spel door de poging van de AI niet te zien als een rechte lijn, maar als een boom met veel takken.

Stel je voor dat de AI een berg beklimt om een schat (het juiste antwoord) te vinden.

  • De Wortels (Het Begin): Eerst kijkt TRACE naar het startpunt (de puzzel). Het voorspelt: "Is deze puzzel waarschijnlijk een mix van succes en falen?" Als het te makkelijk of te moeilijk is, slaat het de puzzel over. Als het een goede "leer-puzzel" is, stuurt het de AI de berg op.
  • De Takken (Het Midden): Dit is het magische deel. Terwijl de AI de berg beklimt, komt hij bij een splitsing in de weg (een "keerpunt" waar hij een beslissing neemt). TRACE stopt en vraat: "Als de AI dit specifieke pad neemt, leidt dat dan waarschijnlijk tot een overwinning of een verlies?"
    • Als het pad eruitziet alsof het zeker tot een overwinning of zeker tot een verlies zal leiden, verspilt TRACE geen tijd aan het verder verkennen ervan.
    • Als het pad onzeker lijkt (een 50/50 kans op succes of falen), zegt TRACE: "Laten we meer wandelaars over dit specifieke pad sturen om te zien wat er gebeurt!"

3. De "Glazen Bol" (De Voorspeller)

Hoe weet TRACE welke paden onzeker zijn? Het gebruikt een "Glazen Bol" (een voorspellingsmodel).

  • Deze Glazen Bol kijkt naar de geschiedenis van de klim tot nu toe (de gedachten en acties die de AI heeft ondernomen).
  • Het schat de kans op succes in.
  • Als de Glazen Bol zegt: "Er is hier een kans van 50% op succes," dan is dat de perfecte plek om meer tijd aan te besteden. Het betekent dat de AI zich in een "leerzone" bevindt waar hij een winnend pad kan vergelijken met een verliezend pad.

4. Het Resultaat: Slimmer Leren met Minder Inspanning

Door de beperkte tijd alleen te richten op de "onzekere" delen van de reis, creëert TRACE een rijke kaart van contrasten.

  • In plaats van alleen te weten "Ik heb gefaald," leert de AI: "Ik heb gefaald omdat ik het linkerpad bij de splitsing nam, maar ik zou geslaagd zijn als ik het rechterpad had genomen."
  • Dit creëert een veel sterker signaal waar de AI van kan leren, zelfs als de totale hoeveelheid tijd die aan oefenen wordt besteed (het budget) exact hetzelfde is als voorheen.

Samenvattend

Beschouw TRACE als een slimme coach die niet alleen een atleet willekeurig rondjes laat rennen.

  1. Selecteert de juiste race: Het kiest races die uitdagend maar winbaar zijn.
  2. Stopt bij de lastige bochten: Het observeert de atleet tijdens het rennen. Als de atleet een lastige bocht bereikt waar hij kan uitglijden of kan blijven staan, stuurt de coach meer atleten om die exacte bocht te proberen om het verschil te zien tussen uitglijden en op de voeten blijven staan.
  3. Bespaart tijd: Het negeert de makkelijke rechte stukken en de onmogelijke kliffen.

Het artikel laat zien dat door deze methode te gebruiken, AI-modellen (specifiek Qwen3) beter zijn geworden in wiskunde, meerstapsvragen en het gebruiken van tools, terwijl ze precies dezelfde hoeveelheid rekenkracht gebruikten als de oude methoden. Het verandert een vlakke, saaie oefensessie in een dynamische, vertakkende verkenning waarbij elke stap iets nieuws leert.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →