← Nieuwste papers
🤖 machine learning

CE-GPPO: Coordinating Entropy via Gradient-Preserving Clipping Policy Optimization in Reinforcement Learning

Dit paper introduceert CE-GPPO, een nieuw algoritme dat de stabiliteit van de entropie tijdens het trainen van grote taalmodellen verbetert door de verwaarloosde gradiënten van geknipte tokens in PPO op een gecontroleerde manier te herstellen, wat leidt tot superieure prestaties op wiskundige redeneerbenchmarks.

Oorspronkelijke auteurs: Zhenpeng Su, Leiyu Pan, Minxuan Lv, Yuntao Li, Wenping Hu, Fuzheng Zhang, Kun Gai, Guorui Zhou

Gepubliceerd 2026-04-24
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Zhenpeng Su, Leiyu Pan, Minxuan Lv, Yuntao Li, Wenping Hu, Fuzheng Zhang, Kun Gai, Guorui Zhou

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een zeer slimme, maar nog wat onervaren robot (een "Large Language Model" of LLM) traint om wiskundige raadsels op te lossen. Je wilt dat deze robot niet alleen de juiste antwoorden leert, maar ook creatief genoeg is om nieuwe manieren van denken te ontdekken.

In de wereld van kunstmatige intelligentie noemen we dit versterkende leren (Reinforcement Learning). De robot probeert iets, krijgt een beloning als het goed is, en past zich aan. Maar er is een groot probleem: hoe houd je de balans tussen nadenken (exploitatie: het doen van wat je al weet werkt) en verkenning (exploratie: het proberen van nieuwe, misschien gekke ideeën)?

Deze balans wordt gemeten met iets dat entropie heet.

  • Hoge entropie: De robot is creatief, probeert van alles, maar is misschien niet precies.
  • Lage entropie: De robot is heel zeker van zichzelf, maar is vastgelopen in een routine en probeert niets nieuws meer.

Het Probleem: De "Kniptang" van de Oude Methode

Tot nu toe gebruikten wetenschappers een methode genaamd PPO. Stel je voor dat PPO een strenge leraar is die een kniptang (clipping) gebruikt.

  • Als de robot iets heel goed doet (een hoog waarschijnlijk antwoord), mag hij dat leren.
  • Maar als de robot iets doet wat hij niet vaak doet (een laag waarschijnlijk antwoord), snijdt de leraar de les eruit. Hij zegt: "Nee, dat is te riskant, we negeren dit."

Het probleem: De leraar snijdt per ongeluk de belangrijkste lessen weg!

  1. Soms probeert de robot iets nieuws en creatiefs (een laag waarschijnlijk antwoord) dat eigenlijk heel goed is. Omdat de leraar dit "knipt", leert de robot niet van deze creatieve sprong. De robot wordt saai en stopt met verkenning (dit heet entropie-instorting).
  2. Soms probeert de robot iets dat hij al te vaak doet, en dat slecht is. Als de leraar dit ook "knipt", blijft de robot doorgaan met zijn slechte gewoonten en probeert hij te veel van alles, waardoor hij nooit iets leert (dit heet entropie-explosie).

De Oplossing: CE-GPPO (De Slimme Coach)

De auteurs van dit paper, van Kuaishou Technology, hebben een nieuwe methode bedacht: CE-GPPO.

In plaats van de kniptang te gebruiken om lessen weg te gooien, zegt CE-GPPO: "Wacht even, we gooien die lessen niet weg. We geven ze gewoon een andere gewicht."

Stel je voor dat CE-GPPO een slimme coach is die een stop-gradient (een rem) gebruikt.

  • Als de robot iets nieuws probeert (een "PA&LP" token), geeft de coach een lichte duw in die richting. Hij zegt: "Goed zo, blijf even kijken of dit werkt," zonder de robot volledig los te laten.
  • Als de robot iets doet dat hij al te vaak doet (een "NA&LP" token), geeft de coach een lichte rem. Hij zegt: "Weet je zeker dat dit de beste weg is? Misschien moet je toch even rondkijken."

De analogie van de fiets:

  • Oude methode (PPO): Als je van het pad afwijkt, duwt de leraar je direct terug op het pad en zegt: "Doe dat nooit meer." Je leert nooit hoe je over obstakels springt.
  • Nieuwe methode (CE-GPPO): Als je van het pad afwijkt, zegt de leraar: "Hé, dat is interessant! Ga maar even een stukje door, maar houd je hand op de rem." Zo kun je nieuwe routes ontdekken, maar val je niet in de sloot.

Wat levert dit op?

De onderzoekers hebben dit getest op verschillende modellen (van klein tot groot) en op moeilijke taken zoals wiskunde en programmeren.

  1. Stabiliteit: De robot wordt niet gek van te veel vrijheid (explosie) en wordt niet saai van te veel controle (instorting). De "entropie" blijft op een gezond niveau.
  2. Beter presteren: Omdat de robot meer creatieve oplossingen durft te proberen en die ook leert, wordt hij beter in complexe taken. Op de tests (zoals de AIME wiskundewedstrijden) scoorde CE-GPPO hoger dan de beste bestaande methoden.
  3. Veiligheid: Het is alsof je de robot een veiligheidsriem geeft. Je kunt hem meer vrijheid geven om te verkennen, zonder dat hij de controle verliest.

Conclusie

Kortom: CE-GPPO is een nieuwe manier om AI te trainen die stopt met het "wegknippen" van interessante, maar onzeker aanvoelende antwoorden. In plaats daarvan geeft het die antwoorden een zachte, gecontroleerde kans. Hierdoor blijft de AI creatief én betrouwbaar, wat leidt tot slimmere en betere modellen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →