← Nieuwste papers
💬 NLP

GTPO and GRPO-S: Token and Sequence-Level Reward Shaping with Policy Entropy

Dit artikel introduceert GTPO en GRPO-S, twee nieuwe reinforcement learning-algoritmen die het redeneervermogen van Large Language Models verbeteren door het implementeren van dynamische entropie-gebaseerde beloningsvorming om fijnmazige, op tokens en sequenties gebaseerde credit assignment te bereiken, waardoor de grofmazige beperkingen van bestaande methoden zoals GRPO en DAPO worden overwonnen.

Oorspronkelijke auteurs: Hongze Tan, Zihan Wang, Jianfei Pan, Jinghao Lin, Hao Wang, Yifan Wu, Tao Chen, Zhihang Zheng, Zhihao Tang, Haihua Yang

Gepubliceerd 2026-02-06
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Hongze Tan, Zihan Wang, Jianfei Pan, Jinghao Lin, Hao Wang, Yifan Wu, Tao Chen, Zhihang Zheng, Zhihao Tang, Haihua Yang

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Het Grote Probleem: Het "Alles-of-Niets" Cijfer

Stel je voor dat je een leerling (de AI) leert om een zeer lange, complexe wiskundige som op te lossen. De leerling schrijft een oplossing van 50 stappen.

  • Stap 1 tot en met 49 zijn briljant, logisch en correct.
  • Stap 50 (het eindantwoord) is fout door een kleine rekenfout.

In de huidige mainstream methoden (zoals GRPO) kijkt de leraar naar het eindresultaat, ziet dat het fout is, en geeft het gehele essay van 50 stappen een onvoldoende (0 punten).

  • Het Resultaat: De leerling denkt: "O, ik neem aan dat stappen 1 tot en met 49 ook nutteloos waren." Ze vergeten de goede delen en proberen de volgende keer misschien een compleet andere, willekeurige aanpak.
  • De Fout: Dit wordt coarse-grained credit assignment genoemd. Het behandelt de hele keten van redeneringen als één enkel blok, waarbij wordt genegeerd dat het grootste deel eigenlijk perfect was.

De Oplossing: Het "Entropie" Kompas

De auteurs van dit artikel stellen een nieuwe manier voor om de leerling te beoordelen. Ze introduceren het concept Policy Entropy.

Denk aan Entropie als een maatstaf voor "hard nadenken" of "onzekerheid."

  • Lage Entropie: De leerling is zeer zelfverzekerd. Ze typen gewoon wat ze al weten (bijv. "1 + 1 = 2").
  • Hoge Entropie: De leerling pauzeert, overweegt meerdere opties en worstelt met een moeilijke keuze. Ze verkennen verschillende paden.

Het artikel stelt dat Hoge Entropie goed is wanneer je gelijk hebt (het betekent dat je het juiste pad zorgvuldig hebt verkend), maar Hoge Entropie is slecht wanneer je ongelijk hebt (het betekent dat je met veel zelfvertrouwen de verkeerde richting op gokte).

De Twee Nieuwe Algoritmen

Het artikel introduceert twee nieuwe "leraren" (algoritmen) die deze Entropie-kompas gebruiken om betere feedback te geven.

1. GTPO (Group Token Policy Optimization)

De Analogie: De "Markeerstift" Leraar
In plaats van het hele essay in één keer te beoordelen, beoordeelt GTPO elk afzonderlijk woord (token).

  • Als het essay Correct is: De leraar markeert de woorden waar de leerling aarzelde of verschillende opties verkende (Hoge Entropie) en geeft deze extra bonuspunten. Dit vertelt de leerling: "Goed gedaan, je hebt over die specifieke stap goed nagedacht!"
  • Als het essay Incorrect is: De leraar zoekt naar de woorden waar de leerling te zelfverzekerd maar fout was (Lage Entropie). Deze woorden krijgen een zware straf. Dit vertelt de leerling: "Je was hier te zeker van je zaak, en je zat ernaast. Wees de volgende keer niet zo zelfverzekerd."

Waarom het helpt: Het redt de goede delen van de redenering en straft de specifieke momenten van overmoed die tot de fout leidden.

2. GRPO-S (Sequence-Level GRPO)

De Analogie: De "Rapportcijfer" Leraar
Soms is het beoordelen van elk afzonderlijk woord te traag of rekenkundig te zwaar. GRPO-S is een lichtere versie.

  • In plaats van naar individuele woorden te kijken, kijkt het naar de gemiddelde "denkinspanning" van het hele essay.
  • Als het essay Correct is: Controleert het: "Heeft de leerling over het algemeen hard nagedacht en verkend?" Zo ja, dan krijgt het hele essay een boost.
  • Als het essay Incorrect is: Controleert het: "Was de leerling zelfverzekerd maar ongelijk?" Zo ja, dan krijgt het hele essay een grotere straf.

Waarom het helpt: Het is sneller maar nog steeds slimmer dan de oude "Alles-of-Niets" methode. Het is vooral goed in het stabiel houden van de leerling tijdens zeer lange redeneertaken.

De Resultaten: Wat is er Gebeurd?

De auteurs hebben deze nieuwe leraren getest op moeilijke wiskunde-benchmarks (zoals AIME en MATH).

  • De Oude Manier (GRPO/DAPO): De leerling kwam vaak vast te zitten. Ze gaven ofwel te snel op, of raakten "vast" in een lus van zelfverzekerde maar foute antwoorden (Policy Collapse).
  • De Nieuwe Manier (GTPO/GRPO-S):
    • Exploratie: De leerlingen bleven langer verschillende paden proberen omdat ze werden beloond voor "hard nadenken" (hoge entropie) wanneer ze gelijk hadden.
    • Precisie: Ze leerden te stoppen met zelfverzekerd ongelijk zijn.
    • Prestaties: Ze scoorden aanzienlijk hoger op moeilijke wiskundeproblemen en losten complexere ketens van redeneringen op dan voorheen.

Samenvatting in één zin

Dit artikel leert AI-modellen om te stoppen met het behandelen van een lange keten van gedachten als een enkel "geslaagd of gezakt" cijfer, en geeft ze in plaats daarvan een gedetailleerd rapport dat hen beloont voor hard nadenken wanneer ze gelijk hebben en voor bescheiden zijn wanneer ze ongelijk zijn, wat leidt tot veel slimmer redeneren.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →