← Nieuwste papers
🤖 machine learning

Rollout Pass-Rate Control: Steering Binary-Reward RL Toward Its Most Informative Regime

Dit artikel stelt Prefix Sampling voor, een methode die trajectvoorvoegsels reconstrueert om agentic RL met binaire beloningen te sturen naar een optimale doorloopsnelheid van 50%, waardoor de entropie van de beloning en contrastieve signalen worden gemaximaliseerd om aanzienlijke versnellingen in werkelijke tijd en verbeterde prestaties op benchmarks zoals SWE-bench en AIME te bereiken.

Oorspronkelijke auteurs: Tianshu Zhu, Wenyu Zhang, Xiaoying Zuo, Lun Tian, Haotian Zhao, Yucheng Zeng, Jingnan Gu, Daxiang Dong, Jianmin Wu, Dawei Yin, Dou Shen

Gepubliceerd 2026-05-07
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Tianshu Zhu, Wenyu Zhang, Xiaoying Zuo, Lun Tian, Haotian Zhao, Yucheng Zeng, Jingnan Gu, Daxiang Dong, Jianmin Wu, Dawei Yin, Dou Shen

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Het Grote Probleem: Energie Verspillen aan "Te Makkelijke" of "Te Moeilijke" Taken

Stel je voor dat je een coach bent die een team van studenten-atleten traint om complexe puzzels op te lossen. Je geeft ze een batch van 8 puzzels per keer.

  • De "Te Makkelijke" Batch: 7 of 8 studenten lossen de puzzel direct op. Ze zijn verveeld, en je leert niets nieuws omdat ze het allemaal goed hebben.
  • De "Te Moeilijke" Batch: 0 of 1 student lost het op. Iedereen anders zit vast. Je leert niets omdat er geen succesvol voorbeeld is om te bestuderen.
  • De "Precies Goed" Batch: 4 studenten lossen het op, en 4 falen. Dit is het sweet spot. Je hebt een perfecte mix van succes en falen om van te leren. De studenten die faalden kunnen precies zien wat de succesvolle studenten anders deden.

In de wereld van AI heet dit Versterkend Leren (RL). De AI genereert veel "rollouts" (pogingen) om een probleem op te lossen. Het artikel stelt dat de huidige AI-training een enorme hoeveelheid computerkracht verspilt aan de "Te Makkelijke" en "Te Moeilijke" batches, omdat ze geen bruikbare leersignalen bieden.

De Oplossing: "Prefix Sampling" (De "Voorsprong" en "Handicap" Truc)

De onderzoekers stellen een slimme methode voor genaamd Prefix Sampling om dit op te lossen. In plaats van gewoon de slechte batches weg te gooien of de AI te vragen om vanaf nul opnieuw te proberen (wat traag en duur is), gebruiken ze een "tijdreizen"-truc.

Denk aan de poging van de AI als een lang verhaal dat wordt geschreven.

  1. Het "Te Moeilijke" Scenario: De AI probeert een moeilijk probleem op te lossen en faalt grotendeels.

    • De Truc: Het systeem vindt de ene succesvolle poging die de AI in die batch wel heeft gedaan. Het neemt het eerste deel van dat succesvolle verhaal (de "prefix") en dwingt de AI om de volgende poging vanaf dat exacte punt te starten.
    • De Analogie: Het is alsof je een worstelende student een voorsprong geeft. "Je kwam hier vast te zitten, maar kijk, je hebt het eerste deel eigenlijk correct opgelost. Start je volgende poging vanaf hier." Dit maakt het moeilijke probleem makkelijker en duwt het slagingspercentage omhoog naar 50%.
  2. Het "Te Makkelijke" Scenario: De AI lost het probleem te makkelijk op.

    • De Truc: Het systeem vindt de ene gefaalde poging in die batch. Het neemt het eerste deel van die mislukking en dwingt de AI om vanaf daar te starten.
    • De Analogie: Het is alsof je een genie-student een handicap geeft. "Je hebt dit te snel opgelost. Laten we doen alsof je aan het begin een fout maakte. Start je volgende poging vanaf deze fout." Dit maakt het makkelijke probleem moeilijker en duwt het slagingspercentage omlaag naar 50%.

Waarom 50% het Magische Getal is

Het artikel doet wat wiskunde om te bewijzen dat 50% succes het meest informatieve punt is.

  • Entropie (Verwarring): Als je weet dat een AI altijd zal winnen of altijd zal verliezen, is er geen verrassing. Als het de helft van de tijd wint, is er maximale "verrassing" of informatie om van te leren.
  • Contrast: Om te leren, moet je een "win" vergelijken met een "verlies". Als iedereen wint, heb je geen verliezen om mee te vergelijken. Als iedereen verliest, heb je geen winsten. Je hebt een 50/50-verdeling nodig om het beste contrast te krijgen.

Hoe Het Werkt in de Wereld (Het "Staat-gebaseerde" Deel)

Dit is het moeilijkste deel om uit te leggen, maar het is cruciaal. Bij eenvoudige wiskundeproblemen schrijft een AI gewoon tekst. Maar bij software-engineering (zoals het repareren van code) is de AI een "agent" die bestanden opent, commando's uitvoert en de staat van de computer verandert.

Normaal gesproken moet je, als je een eerdere poging wilt herhalen, de hele computeromgeving resetten, wat traag is.

  • De Innovatie: De onderzoekers bouwden een systeem dat de acties van de AI stap-voor-stap kan "herspelen" om de exacte staat van de computer (de code, de bestanden, de geschiedenis) te reconstrueren zonder opnieuw te beginnen.
  • Het Maskeren: Wanneer de AI doorgaat vanuit deze hergespeelde staat, vertelt het systeem de AI: "Jij hebt het eerste deel niet geschreven (we hebben dat voor je hergespeeld). Je krijgt alleen krediet voor het nieuwe deel dat je schrijft." Dit zorgt ervoor dat de AI leert van zijn eigen nieuwe beslissingen, niet van de oude.

De Resultaten: Sneller en Slimmer

De onderzoekers testten dit op twee soorten taken:

  1. Software Engineering (SWE-bench): Het oplossen van echte code-bugs.
  2. Wiskunde (AIME 2025): Het oplossen van moeilijke wiskundeolympiade-problemen.

De Winst:

  • Snelheid: De AI bereikte hetzelfde hoge prestatieniveau in de helft van de tijd (tot 2x sneller) bij de grotere modellen.
  • Efficiëntie: Het verspilde minder computerkracht aan nutteloze "allemaal-winst" of "allemaal-verlies" pogingen.
  • Prestatie: De uiteindelijke AI was eigenlijk beter in het oplossen van problemen dan de standaard trainingsmethode, en behaalde hogere scores.

Samenvatting

Het artikel introduceert een "verkeersregelaar" voor AI-training. In plaats van de AI wild rond te laten rennen en tijd te verspillen aan taken die te makkelijk of te moeilijk zijn, stuurt het de trainingsbatches actief aan naar een 50% slagingspercentage. Dit doet het door worstelende AI een "voorsprong" te geven vanuit een eerdere succespoging en oververzekerde AI een "handicap" te geven vanuit een eerdere mislukking. Dit houdt het leerproces in de "Goldilocks-zone", waardoor training aanzienlijk sneller en effectiever wordt.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →