← Nieuwste papers
🤖 machine learning

Rethinking Entropy Interventions in RLVR: An Entropy Change Perspective

Dit artikel introduceert STEER, een gestructureerde methode voor entropiemodulatie voor Reinforcement Learning met verifieerbare beloningen (RLVR) die entropiecollaps aanpakt door een theoretisch kader voor entropieveranderingen op token-niveau af te leiden en tokens adaptief te herwegen om te presteren boven bestaande heuristische ingrepen op wiskundige en programmeerbenchmarks.

Oorspronkelijke auteurs: Zhezheng Hao, Hong Wang, Haoyang Liu, Jian Luo, Jiarui Yu, Hande Dong, Qiang Lin, Can Wang, Jiawei Chen

Gepubliceerd 2026-04-29
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Zhezheng Hao, Hong Wang, Haoyang Liu, Jian Luo, Jiarui Yu, Hande Dong, Qiang Lin, Can Wang, Jiawei Chen

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een zeer slimme robot traint om complexe wiskundeproblemen op te lossen of code te schrijven. Je gebruikt een techniek genaamd Versterkend Leren met Verifieerbare Beloningen (RLVR). Denk hierbij aan een spel waarbij de robot verschillende oplossingen probeert; als het antwoord juist is, krijgt het een "gouden ster" (een beloning). Als het antwoord fout is, krijgt het niets. Na verloop van tijd leert de robot om meer gouden sterren te verzamelen.

Echter, de onderzoekers in dit artikel ontdekten een grote storing in dit trainingsproces, genaamd "Entropie-inzakking".

Het Probleem: De Robot Wordt Te Zeker (en Stuck)

Om "entropie" te begrijpen, stel je de geest van de robot voor als een enorme bibliotheek met mogelijke antwoorden.

  • Hoge Entropie: De bibliotheek zit vol met diverse, verschillende ideeën. De robot verkent, probeert vele verschillende paden en staat open voor nieuwe mogelijkheden.
  • Lage Entropie (Inzakking): De bibliotheek krimpt plotseling. De robot stopt met verkennen en kiest alleen het enige pad dat het het beste vindt. Het wordt stijf en repetitief.

Bij RLVR komt de robot vaak te snel vast te zitten in deze "Lage Entropie"-toestand. Het stopt met het proberen van nieuwe dingen omdat het bang wordt om fouten te maken. Het begint exact dezelfde "redenering" keer op keer te genereren. Als dat ene pad verkeerd is, faalt de robot en komt de training tot stilstand omdat het geen betere oplossingen kan ontdekken.

De Oude Oplossingen: Gissen en Controleren

Voordat dit artikel verscheen, probeerden wetenschappers dit probleem op te lossen door "heuristische" methoden te gebruiken – in feite gokten ze wat wel zou werken.

  • De "Clip-High"-methode: Ze probeerden de regels te versoepelen voor hoe sterk het vertrouwen van de robot mag veranderen, in de hoop dat dit de robot zou dwingen meer dingen te proberen.
  • De "Herschikking"-methode: Ze probeerden extra punten te geven aan zeldzame antwoorden of punten af te halen bij veelvoorkomende antwoorden.

Het probleem met deze oude methoden is dat ze probeerden een lekende boot te repareren door slechts één gat te dichten terwijl ze de andere negeerden. Ze begrepen niet volledig waarom de robot instortte, dus waren hun oplossingen een kwestie van raak of mis.

Het Nieuwe Inzicht: Een Wiskundige Kaart

De auteurs van dit artikel besloten om onder de motorkap te kijken. Ze creëerden een nauwkeurige wiskundige formule (een "strakke analytische benadering") om precies bij te houden hoe de "diversiteit" (entropie) van de robot verandert met elke enkele stap in zijn leerproces.

Ze ontdekten dat de verandering in diversiteit wordt beheerst door vier specifieke factoren:

  1. De Clipping-regel: Hoe sterk het trainingsalgoritme grote veranderingen beperkt.
  2. De Voordelenscore: Hoeveel beter een specifiek antwoord is vergeleken met het gemiddelde.
  3. De Kans: Hoe waarschijnlijk het was dat de robot dat antwoord in eerste instantie zou kiezen.
  4. De Huidige Entropie: Hoe divers de geest van de robot was op dat exacte moment.

Ze visualiseerden dit als een kaart met vier kwadranten. Afhankelijk van of een antwoord "juist/fout" en "waarschijnlijk/onwaarschijnlijk" was, zou de robot ofwel meer divers ofwel minder divers worden. Ze beseften dat eerdere methoden slechts naar één of twee van deze kwadranten keken, waardoor ze het grotere plaatje misten.

De Oplossing: STEER

Gebaseerd op deze kaart bouwden ze een nieuw hulpmiddel genaamd STEER (Stabilizing Token-level Entropy-changE via Reweighting).

Denk aan STEER als een slimme verkeersregelaar voor het leerproces van de robot.

  • In plaats van te gokken, berekent STEER precies hoeveel diversiteit verandert voor elk enkel woord (token) dat de robot genereert.
  • Als de robot op het punt staat een zet te doen die ervoor zorgt dat zijn diversiteit te snel instort (entropie-inzakking), legt STEER zachtjes de rem op die specifieke zet.
  • Het stopt de robot niet van leren; het vertraagt alleen de delen van het leren die te agressief zijn, waardoor de geest van de robot open en divers blijft.

De Resultaten

Het team testte STEER op zes verschillende wiskundebenchmarks en drie programmeeruitdagingen.

  • Het Resultaat: STEER hield de "geest" van de robot gedurende de hele training divers en verkennend.
  • De Score: Het sloeg consequent alle andere topmethodes, loste meer wiskundeproblemen op en schreef betere code.
  • Veelzijdigheid: Het werkte goed op robots van verschillende groottes (van kleine tot grote modellen) en verschillende soorten trainingsalgoritmen.

Samenvatting

Het artikel betoogt dat we om AI beter te leren redeneren niet zomaar kunnen gokken hoe we het creatief houden. We moeten de exacte wiskunde begrijpen van hoe het zijn creativiteit verliest. Door een nauwkeurige kaart van deze veranderingen te bouwen, creëerden ze STEER, een methode die fungeert als een fijn afgestelde regelaar, die ervoor zorgt dat de AI nieuwsgierig en verkennend blijft in plaats van vast te komen zitten in een stijve lus. Dit leidt tot slimmere, capabelere AI-modellen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →