← Nieuwste papers
🤖 machine learning

Self-Distilled Policy Gradient

Dit artikel stelt SDPG voor, een self-distilled policy gradient-framework dat on-policy self-distillatie via een full-vocabulary reverse KL-loss integreert met group-relative verifier advantages en reference-policy regularisatie om de stabiliteit en prestaties van sparse-reward reinforcement learning te verbeteren.

Oorspronkelijke auteurs: Yifeng Liu, Shiyuan Zhang, Yifan Zhang, Quanquan Gu

Gepubliceerd 2026-06-04
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Yifeng Liu, Shiyuan Zhang, Yifan Zhang, Quanquan Gu

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Het Grote Plaatje: Een Student Leren Beter Denken

Stel je voor dat je een briljante maar onervaren student (het AI-model) traint om moeilijke wiskundeproblemen op te lossen. De student is slim, maar raakt vaak verdwaald in de eigen redeneerstappen.

Momenteel is de standaardmanier om deze studenten te trainen Reinforcement Learning met Verifieerbare Beloningen (RLVR). Zie dit als een "Geslaagd/Gezakt"-examen. De student schrijft een volledige oplossing, en een strikte toezichthouder (de Verifier) controleert het uiteindelijke antwoord.

  • Als het antwoord juist is: Krijgt de student een gouden ster (+1).
  • Als het antwoord fout is: Krijgt hij een rood kruis (0).

Het Probleem: Dit "Geslaagd/Gezakt"-systeem is te vaag. Als de student het antwoord fout heeft, weet hij niet welke specifieke stap de fout heeft veroorzaakt. Maakte hij een fout in de algebra bij stap 3? Of in de logica bij stap 7? Omdat de feedback zo schaars is (alleen aan het einde), leert de student langzaam en raakt hij soms in de war, wat leidt tot instabiele training.

De Oplossing: De "Self-Distilled" Tutor

De auteurs stellen een nieuwe methode voor genaamd SDPG. In plaats van alleen te wachten op een eindcijfer, krijgt de student een "spiekbriefje" of een "bevoorrechte kijk" op de oplossing terwijl hij deze schrijft.

Zo werkt SDPG, opgedeeld in drie delen:

1. De Twee Hoeden: Student en Leraar

In traditioneel onderwijs heb je een grote, dure professor (Leraar) nodig om een kleine student te onderwijzen. Dit is lastig omdat je tegelijkertijd twee enorme computers moet draaien.
Bij Self-Distillation draagt de student twee hoeden:

  • De Student-hoed: Het model probeert het probleem op te lossen met alleen de vraag (zonder hints).
  • De Leraar-hoed: Het zelfde model probeert het probleem opnieuw op te lossen, maar dan heeft het een "bevoorrechte context" (een hint, een oplossingspad of een redeneerwijzer gegenereerd door een krachtige AI zoals Gemini).

Het model leert door te proberen de voorspellingen van de "Student-hoed" te laten overeenkomen met de voorspellingen van de "Leraar-hoed". Het is als een muzikant die een liedje oefent: ze luisteren naar de perfecte opname (Leraar) en proberen hun eigen spel (Student) noot voor noot te matchen. Dit geeft hen dichte, stap-voor-stap feedback in plaats van alleen een eindcijfer.

2. Het Veiligheidsnet: De "Goed Idee" Filter

Er is hier een risico. Als de student een totaal verkeerd pad inslaat (bijvoorbeeld: ze lossen het volledig verkeerde probleem op), kan de "Leraar-hoed" nog steeds een perfecte oplossing geven voor het verkeerde probleem. Als de student dit blindelings kopieert, wordt hij alleen maar beter in het zijn van fouten.

SDPG lost dit op met Positive Advantage Gating.

  • De Analogie: Stel je een coach voor die de student observeert. Als de student van het veld afwijkt (een slecht cijfer krijgt van de Verifier), zegt de coach: "Stop! Luister nog niet naar de perfecte oplossing, want je bent het verkeerde aan het oplossen."
  • Het systeem laat de student alleen leren van de "Leraar-hoed" als de "Student-hoed" al een pad heeft geproduceerd dat de Verifier als veelbelovend beschouwt (een positieve beloning). Dit zorgt ervoor dat de student alleen goede redeneringen internaliseert, en niet alleen perfecte antwoorden op slechte vragen.

3. De Opwarming en de Afkoeling

De auteurs realiseerden zich ook dat je een student niet direct of voor altijd kunt dwingen om naar de leraar te luisteren.

  • Opwarming: Aan het begin is de student te verward om van de leraar te leren. Daarom beginnen ze met alleen het "Geslaagd/Gezakt"-examen. Zodra ze enkele antwoorden goed krijgen, zetten ze de lessen van de "Leraar-hoed" langzaam aan.
  • Afkoeling: Tegen het einde van de training heeft de student de lessen geïnternaliseerd. Als ze te veel naar de leraar blijven luisteren, stoppen ze misschien met zelf nadenken (een probleem dat "mode collapse" wordt genoemd). Daarom zet het systeem de stem van de leraar geleidelijk uit, zodat de student op zijn eigen vaardigheden kan vertrouwen.

Het Resultaat

Door het eindcijfer (van de Verifier) te combineren met stap-voor-stap begeleiding (van de Self-Teacher), maar dit te filteren zodat de student alleen leert van goede paden, wordt de AI:

  1. Stabieler: Het crasht niet of raakt niet in de war tijdens de training.
  2. Slimmer: Het leert beter te redeneren omdat het feedback krijgt op elke stap, niet alleen aan het einde.
  3. Sneller: Het bereikt hoge prestatieniveaus in minder trainingsstappen dan eerdere methoden.

Kortom, SDPG is als het geven van een tutor aan een student die alleen zijn stem laat horen wanneer de student op het juiste pad is, en dan geleidelijk de student het werk alleen laat doen zodend de stof beheerst is.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →