← Nieuwste papers
🤖 machine learning

Rethinking the Divergence Regularization in LLM RL

Dit artikel stelt Divergence Regularized Policy Optimization (DRPO) voor, een nieuwe RL-methode voor LLM's die de harde gradiëntmaskering gebruikt in eerdere divergentie-gebaseerde benaderingen vervangt door een gladde, advantage-gewogen kwadratische regularisator om continue corrigerende signalen te bieden en de trainingsstabiliteit te verbeteren.

Oorspronkelijke auteurs: Jiarui Yao, Xiangxin Zhou, Penghui Qi, Wee Sun Lee, Liefeng Bo, Tianyu Pang

Gepubliceerd 2026-06-09
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Jiarui Yao, Xiangxin Zhou, Penghui Qi, Wee Sun Lee, Liefeng Bo, Tianyu Pang

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een zeer getalenteerde maar licht chaotische student (de AI) leert om een moeilijke toets te maken. De student heeft de basis al geleerd, maar nu wil je ze leren hoe ze specifieke, lastige problemen beter kunnen oplossen. Je doet dit door oefenvragen te geven, ze te laten antwoorden, en ze vervolgens te zeggen: "Goed gedaan!" of "Probeer het opnieuw!" op basis van hoe goed ze het deden. Dit proces wordt Reinforcement Learning (RL) genoemd.

Echter, er is een addertje onder het gras: de student oefent in een stille bibliotheek (training), maar maakt de werkelijke toets in een lawaaierige, chaotische examenzaal (inference). Omdat de omgevingen iets verschillend zijn, kan de student in de war raken of hun gewoontes te drastisch veranderen, wat kan leiden tot een meltdown waarbij ze alles wat ze wisten vergeten.

Om dit te voorkomen, gebruiken leraren een "veiligheidszone" (Trust Region). Deze zone zegt: "Je mag je antwoorden aanpassen om beter te worden, maar verander ze niet te veel, anders verlies je je evenwicht."

Het Probleem: De Oude Regels Waren Te Rigide

Lama tijd gebruikten leraren een methode genaamd PPO (Proximal Policy Optimization). Denk aan PPO als een strikt regelboek: "Als je antwoord met meer dan 20% verandert, stop! Trek alle krediet voor dat antwoord in."

Het paper wijst op twee grote gebreken bij deze aanpak:

  1. De "Ratio"-val: PPO meet verandering door te kijken naar hoeveel de kansen op een antwoord zijn veranderd. In een wereld met miljoenen mogelijke woorden (zoals een woordenboek met 50.000+ woorden), kan een klein, onwaarschijnlijk woord (zoals "xylofoon") springen van een 0,0001% kans naar een 0,001% kans. Dat is een enorme ratio-verandering (10x!), maar het doet er in het grote geheel nauwelijks toe. Ondertussen kan een veelvoorkomend woord (zoals "de") dalen van 90% naar 80%. Dat is een kleine ratio-verandering, maar een enorme verschuiving in betekenis. PPO raakt hierdoor in de war: het straft zeldzame woorden te hard af en laat de veelvoorkomende woorden ongecontroleerd rondgaan.
  2. Het "Hard Cut"-probleem: Nieuwere methoden (zoals DPPO) probeerden dit op te lossen door de werkelijke hoeveelheid verandering in waarschijnlijkheid te meten (zoals het meten van de afgelegde afstand in plaats van het percentage). Maar zij gebruikten een "Hard Mask". Stel je een muur voor. Als de student één inch voorbij de muur stapt, geeft de leraar direct een klap op de hand en zegt: "Stop! Geen verdere leerervaring voor deze stap." Het is een binaire schakelaar: je krijgt ofwel volledige credits, of je krijgt er nul. Dit creëert een schokkerig, instabiel leerproces. Als de student slechts iets voorbij de muur is, krijgt hij geen hulp om terug te lopen; hij wordt gewoon genegeerd.

De Oplossing: DRPO (De Soepele Gids)

De auteurs stellen een nieuwe methode voor genaamd DRPO (Divergence Regularized Policy Optimization).

In plaats van een harde muur of een strikte ratio-regel, stel je een slimme, verende trampoline voor die de veiligheidszone omringt.

  • Binnen de Zone: Als de student goede veranderingen maakt binnen de veiligheidszone, duwt de trampoline hen zachtjes vooruit, wat hen aanmoedigt om te blijven verbeteren.
  • Aan de Rand: Naarmate de student de rand nadert, wordt de trampoline zachter. Het stopt hen niet abrupt; het vertraagt hen slechts geleidelijk.
  • Buiten de Zone: Als de student per ongeluk te ver buiten de zone stapt (een "slechte" zet), snijdt de trampoline hen niet zomaar af. In plaats daarvan kaatst het hen terug. Het brengt een zachte, corrigerende kracht uit die zegt: "Oeps, je bent te ver gegaan. Laten we je terug naar het midden trekken."

Waarom Dit Beter Werkt

Het paper beweert dat DRPO werkt als een soepele, continue gids in plaats van een broze, aan/uit-schakelaar.

  1. Het gaat beter om met de "Long Tail": In de wereld van AI zijn er duizenden zeldzame woorden. DRPO meet de werkelijke "afstand" die een woord is bewogen, niet de "ratio". Dit betekent dat het niet in de war raakt wanneer een zeldzaam woord van bijna nul naar een klein getal springt. Het behandelt de verandering eerlijk, ongeacht hoe gebruikelijk het woord is.
  2. Het stopt nooit met leren: Zelfs wanneer de student een fout maakt en buiten de veiligheidszone stapt, gooit DRPO de les niet weg. Het gebruikt de fout om de student weer zachtjes in de juiste richting te sturen. Dit voorkomt dat het trainen instabiel wordt of "crasht".
  3. Het werkt overal: De auteurs hebben DRPO getest op verschillende formaten AI-modellen (van klein tot enorm), verschillende soorten computerchips en zelfs wanneer de computer met een lagere precisie werkt (zoals het gebruik van een iets wazige lens). In elk geval was DRPO stabieler en hielp het de AI sneller en beter te leren dan de oude methoden.

De Kernboodschap

Beschouw de oude methoden als een leraar die ofwel "STOP!" roept zodra je een kleine fout maakt, of je volledig negeert als je iets uit de bocht vliegt.

DRPO is als een wijze coach die zegt: "Je doet het geweldig, maar je komt wel een beetje te ver. Laten we even rustig aan doen. Als je te ver gaat, zal ik je zachtjes terugtrekken zodat je niet valt." Deze soepele, continue correctie maakt het hele leerproces veel veiliger, sneller en betrouwbaarder.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →