← Nieuwste papers
🤖 AI

Where Rollouts Begin: Low-Load, High-Leverage First-Token Diversification for RLVR

Het artikel introduceert REFT, een lichtgewicht methode die Reinforcement Learning met Verifieerbare Beloningen (RLVR) verbetert door de eerste token na het redeneringsmarker te diversifiëren om de rollout-exploratie te verbreden, waardoor de modelprestaties over verschillende groottes en moeilijkheidsgraden worden versterkt zonder de kerntrainingspijplijn te wijzigen.

Oorspronkelijke auteurs: Soeun Kim, Albert No

Gepubliceerd 2026-05-28
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Soeun Kim, Albert No

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

`) is bijna altijd hetzelfde.

  • De Analogie: Stel je voor dat je een groep studenten vraagt een wiskundeprobleem op te lossen. Hoewel ze slim zijn, beginnen ze allemaal instinctief hun zin met "Eerst, laten we..." of "Om dit op te lossen...".
  • Het Probleem: De robot is zo zeker van deze openingswoorden dat hij bijna nooit probeert te beginnen met "Laten we...", "Gegeven dat..." of "Aanvankelijk...". Hij blijft vastzitten in een patroon en herhaalt steeds hetzelfde openingswoord.

De auteurs ontdekten iets verrassends: Het eerste woord verandert de wiskunde eigenlijk niet.

  • De Analogie: Het is alsof een reiziger kiest tussen een rode bus, een blauwe bus of een groene bus om naar dezelfde stad te gaan. De kleur van de bus (het eerste woord) verandert de bestemming of de route die binnen de bus wordt afgelegd niet. Als je echter alleen de robot de rode bus laat nemen, zie je nooit hoe de blauwe of groene bussen eruitzien.
  • De Ontdekking: Hoewel de robot denkt dat de "rode bus" (het meest voorkomende eerste woord) de beste keuze is, zijn de "blauwe" en "groene" bussen (minder voorkomende eerste woorden) even waarschijnlijk om tot het juiste antwoord te leiden. De robot is gewoon te kieskeurig over de kleur van de bus.

De Oplossing: REFT (Rollout Exploration with First-Token Diversification)

De auteurs creëerden een eenvoudige oplossing genaamd REFT. In plaats van de robot het eerste woord natuurlijk te laten kiezen (wat meestal leidt tot hetzelfde woord), dwingt REFT de robot om opzettelijk een paar verschillende openingswoorden te proberen.

  • Hoe het werkt:

    1. De robot bekijkt zijn 20 favoriete openingswoorden.
    2. REFT kiest 4 verschillende woorden uit die lijst (bijvoorbeeld "Eerst", "Laten", "Gegeven", "Aanvankelijk").
    3. Vervolgens stuurt het de robot langs 4 verschillende paden, één voor elk openingswoord.
    4. Zodra het eerste woord is vastgesteld, gaat de robot verder met het oplossen van de rest van het probleem precies zoals hij normaal zou doen.
  • De Analogie: Stel je voor dat een trainer een team hardlopers zegt: "In plaats van allemaal met hetzelfde opwarmliedje te beginnen, laten we vier groepen met vier verschillende liedjes beginnen." Zodra de muziek begint, rennen ze allemaal dezelfde race. De trainer verandert de race niet; hij zorgt er alleen voor dat het team verschillende startvibes verkent om te zien of één ervan leidt tot een betere finish.

Waarom Dit Belangrijk Is

Het artikel toont aan dat door de robot te dwingen deze verschillende "openingzinnetjes" te proberen, het meer correcte oplossingen ontdekt zonder dat er meer rekenkracht nodig is of de complexe wiskunde achter de training moet worden aangepast.

  • Beter Resultaat: De robot werd beter in het oplossen van wiskundeproblemen (gemeten aan de hand van hoe vaak hij het juiste antwoord kreeg in 1 poging, 8 pogingen of 64 pogingen).
  • Geen Extra Kosten: Het duurde niet langer om te trainen. Sterker nog, omdat de robot sneller het juiste antwoord vond, voltooide hij de taken soms iets sneller.
  • Vermijden van "Alles-Fout" Groepen: Soms faalt een hele groep pogingen omdat ze allemaal met dezelfde "verkeerde" mindset zijn begonnen. Door de start te diversifiëren, zorgt REFT ervoor dat ten minste één groep het juiste pad vindt.

Samenvatting

Het artikel betoogt dat we bij AI-redenering vaak zoeken naar diversiteit in het midden van het denkproces (de moeilijke wiskundestappen). Maar de auteurs ontdekten dat het zeer eerste woord een "laag-belaste, hoog-hefboom"-plek is. Het is makkelijk te veranderen (het is gewoon een woord), maar het heeft een enorm effect op de variëteit aan oplossingen die de AI verkent. Door simpelweg het eerste woord te schudden, wordt de AI een betere probleemoplosser.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →