← Nieuwste papers
💬 NLP

Back to Basics: Revisiting Exploration in Reinforcement Learning for LLM Reasoning via Generative Probabilities

Dit artikel stelt ProGRPO voor, een nieuwe Reinforcement Learning-benadering die een Advantage Re-weighting Mechanisme gebruikt om mode collapse te mitigeren en exploratie in LLM-redeneren te verbeteren door beloningssignalen dynamisch te hervormen om het vertrouwen over diverse correcte oplossingen te balanceren, waardoor zowel de nauwkeurigheid als de generatieve diversiteit op wiskundige en programmeerbenchmarks aanzienlijk wordt verbeterd.

Oorspronkelijke auteurs: Pengyi Li, Elizaveta Goncharova, Andrey Kuznetsov, Ivan Oseledets

Gepubliceerd 2026-02-09
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Pengyi Li, Elizaveta Goncharova, Andrey Kuznetsov, Ivan Oseledets

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Het Grote Plaatje: De "Overmoedige" Student

Stel je voor dat je een briljante student (de AI) traint om moeilijke wiskundeproblemen op te lossen of code te schrijven. Je gebruikt een systeem genaamd Reinforcement Learning with Verifiable Rewards (RLVR). Zie dit als een strenge leraar die alleen een gouden ster geeft wanneer de student het exact juiste antwoord geeft.

Het Probleem:
De huidige methode (genaamd GRPO) werkt als een leraar die alleen de meest zelfverzekerde gok van de student prijst.

  • Als de student zegt: "Het antwoord is 42," en ze zijn 99% zeker, krijgen ze een gouden ster.
  • Als de student zegt: "Het antwoord is 42," maar ze zijn slechts 60% zeker, krijgen ze niets.

Na verloop van tijd leert de student om alleen nog maar "42" te zeggen met maximale zelfverzekerdheid. Ze stoppen met het proberen van andere manieren om het probleem op te lossen. Als "42" fout is, heeft de student geen back-upplan. In AI-termen wordt dit entropy collapse of mode collapse genoemd. De AI wordt een saaie robot die alleen steeds dezelfde paar antwoorden herhaalt, zelfs als die antwoorden fout zijn of als er veel andere geldige manieren zijn om het probleem op te lossen.

De Oplossing: ProGRPO (De "Eerlijke" Leraar)

De auteurs stellen een nieuwe methode voor genaamd ProGRPO. In plaats van alleen de luidste stem te belonen, kijkt deze nieuwe leraar naar het volledige plaatje van hoe de student denkt.

Ze introduceren een mechanisme genaamd Advantage Re-weighting (ARM). Zo werkt het met een eenvoudige analogie:

1. De "Zelfvertrouwen Check"

Stel je voor dat de student een puzzel oplost.

  • Scenario A: De student ziet een zeer gemakkelijke puzzel en roept direct het antwoord met 100% zelfvertrouwen.
  • Scenario B: De student ziet een moeilijke puzzel, denkt er lang over na en komt tot het juiste antwoord, maar is er een beetje zenuwachtig over (lagere zelfverzekerdheid).

De oude leraar (GRPO) zou Scenario A zwaar belonen en Scenario B negeren.
De nieuwe leraar (ProGRPO) zegt: "Wacht, Scenario B is eigenlijk indrukwekkender omdat het moeilijk was! Laten we die student een beetje extra krediet geven voor hun inspanning, zelfs als ze niet 100% zeker waren."

Dit voorkomt dat de student zich alleen vastklampt aan de "gemakkelijke, zelfverzekerde" antwoorden en moedigt hen aan om verschillende, geldige manieren te verkennen om het probleem op te lossen.

2. Het negeren van de "Saai" Delen

Wanneer de student een lange uitleg schrijft (een "Chain of Thought"), zijn de meeste woorden overduidelijk.

  • Voorbeeld: "Eerst tel ik 2 en 2 op. Daarna vermenigvuldig ik met 2..."
  • De woorden "Eerst", "Daarna" en "vermenigvuldigen" zijn saai; de student kent ze perfect.

Het artikel stelt dat het tellen van deze saaie, hoog-zelfverzekerde woorden de beloning verwatert. Het is alsoं een toets nakijken en punten geven voor het correct schrijven van het woord "De".

ProGRPO gebruikt Low-Probability Token Length Normalization. Het negeert de saaie, gemakkelijke delen van het antwoord en focust alleen op de moeilijke delen waar de student echt moest nadenken en een keuze moest maken. Dit geeft een veel duidelijker signaal over hoe goed de redenering werkelijk is.

De Resultaten: Meer Variatie, Dezelfde Nauwkeurigheid

De auteurs testten deze nieuwe methode op wiskunde- en programmeertaken met modellen zoals Qwen en DeepSeek.

  • De Oude Manier (GRPO): De AI kreeg bij de eerste poging 37,6% van de tijd het juiste antwoord. Maar als je de AI vroeg om 32 keer te proberen, herhaalde het vooral dezelfde 3 of 4 antwoorden.
  • De Nieuwe Manier (ProGRPO):
    • Nauwkeurigheid: Het kreeg bij de eerste poging 43,3% van de tijd het juiste antwoord (een grote verbetering).
    • Diversiteit: Wanneer het 32 keer werd gevraagd, vond het 68,5% van de tijd correcte antwoorden. Cruciaal is dat deze antwoorden verschillend van elkaar waren.

De Metafoor:
Als de oude AI een chef-kok was die alleen maar één type pasta maakte omdat dat de veiligste gok was, dan is de nieuwe AI een chef die pasta, risotto en soep kan maken, en ze allemaal heerlijk smaken. Het heeft niet alleen geluk gehad; het heeft geleerd om de keuken effectiever te verkennen.

Samenvatting van Claims

Het artikel beweert dat door de manier waarop de AI zijn "zelfvertrouwen" berekent aan te passen en door de saaie delen van zijn eigen gedachten te negeren, ProGRPO:

  1. Voorkomt dat de AI vastloopt in een lus van het herhalen van dezelfde paar antwoorden.
  2. De nauwkeurigheid verbetert bij moeilijke wiskunde- en programmeerproblemen.
  3. Een grotere variëteit aan correcte oplossingen genereert (wat cruciaal is voor complexe taken waarbij er mogelijk meer dan één goed antwoord is).

De auteurs concluderen dat dit een betere balans is tussen exploratie (nieuwe dingen proberen) en exploitatie (gebruiken wat je weet te werken), waardoor het redeneren van AI robuuster en betrouwbaarder wordt.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →