← Nieuwste papers
🤖 machine learning

Parameter Exploration for RLVR via Variational Learning

Dit artikel introduceert Perturbed Parameter Policy Optimization (3PO), een methode die reinforcement learning voor LLM's verbetert door de parameterruimte te verkennen om diverse beleidsregels te genereren, waardoor de prestaties bij downstream-taken en de trainingsstabiliteit worden verbeterd in vergelijking met standaard technieken voor exploratie in de actieruimte zoals GRPO.

Oorspronkelijke auteurs: Vatsal Venkatkrishna, Nico Daheim, Iryna Gurevych

Gepubliceerd 2026-08-11
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Vatsal Venkatkrishna, Nico Daheim, Iryna Gurevych

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een superintelligente robot probeert te leren hoe hij een lastige puzzel moet oplossen, zoals een complex wiskundig probleem of het schrijven van een stuk code. Je kunt niet simpelweg naast de robot zitten en het antwoord laten zien; in plaats daarvan laat je de robot het proberen, en als het hem lukt, geef je hem een high-five (een "beloning"). Als het hem niet lukt, zeg je zachtjes: "probeer het nog eens". Dit wordt Reinforcement Learning genoemd. Het lastige deel is dat de robot zelf moet uitzoeken hoe hij die high-five krijgt. Soms komt de robot in een sleur terecht, waarbij hij steeds dezelfde fouten herhaalt omdat hij te bang is om iets nieuws te proberen. Om dit op te lossen, proberen wetenschappers de robot meestal wat meer "chaotisch" of "willekeurig" te maken wanneer hij nadenkt, in de hoop dat hij zo per ongeluk op een briljante nieuwe oplossing stuit.

Lama een tijdlang was de standaardmanier om deze chaos toe te voegen het aanpassen van de "temperatuur" van de robot. Denk hierbij aan het harder zetten van het volume op de statische ruis van een radio: het maakt de keuzes van de robot een beetje onvoorspelbaarder, maar het verandert niet echt wat hij weet of hoe hij denkt; het schudt alleen de volgorde van zijn gokjes een beetje door elkaar. Het is alsof je een chef vertelt dat hij meer kruiden in de soep moet gooien zonder het recept zelf te veranderen. Het probleem is dat de soep soms nog steeds verschrikkelijk smaakt, en de robot dan steeds dezelfde slechte gokjes blijft doen, alleen in een andere volgorde. Dit artikel onderzoekt een ander, meer radicaal idee: wat als we niet alleen de kruiden door elkaar schudden, maar ook de hersenen van de chef aanpassen? Wat als we de robot voor elke poging een klein beetje "hersenenmist" of een lichte "persoonlijkheidsverandering" geven? Dit stelt de robot in staat om geheel nieuwe manieren van denken te verkennen, en niet alleen nieuwe manieren van gokken.

De onderzoekers achter deze studie, Vatsal Venkatkrishna, Nico Daheim en Iryna Gurevych, besloten dit "hersenen-tweak"-idee te testen op grote taalmodellen (de soorten AI die tekst schrijft en problemen oplost). Ze noemen hun nieuwe familie van methoden 3PO (Perturbed Parameter Policy Optimization). In plaats van alleen de gokjes van de robot willekeurig te maken (actieruimte-exploratie), passen ze eigenlijk een beetje ruis toe op de interne gewichten van de robot (parameterruimte-exploratie). Stel je voor dat je een team van 16 chefs hebt die een puzzel proberen op te lossen. De oude manier (genoemd GRATO) zou betekenen dat alle 16 chefs exact hetzelfde receptenboek gebruiken, terwijl ze willekeurig gokken. Als ze allemaal falen, zit het hele team vast.

Het 3PO-team probeerde drie verschillende manieren om de boel op te schudden. Ten eerste is B3PO alsof je het hele team één licht afwijkende, mistige versie van het receptenboek geeft voor de gehele ronde. Ten tweede is M3PO alsof het team vier verschillende mistige versies van het boek probeert, één na de andere, en de resultaten middelt. Maar de echte ster van de show is C3PO. Bij C3PO wordt het team opgedeeld. In plaats van dat iedereen hetzelfde boek gebruikt, verdelen ze de 16 chefs in kleinere groepen, en elke groep krijgt een volledig andere mistige versie van het receptenboek. Dit betekent dat het team tegelijkertijd veel verschillende "universums" van oplossingen verkent.

De resultaten waren zeer veelbelovend. Wanneer ze deze methoden testten op moeilijke wiskundeproblemen (zoals de AIME-competitie) en programmeeruitdagingen, presteerde de C3PO-methode consequent beter dan de standaardmethoden. Het onderzoek suggereert dat door deze verschillende "mistige" versies van het model te gebruiken, het team correcte antwoorden vond die de standaardmethode miste. Specifiek slaagde C3PO erin om meer groepen pogingen te "redden" die anders doodlopende wegen zouden zijn geweest (waarbij elke enkele poging hetzelfde foute antwoord kreeg). Het produceerde ook minder "misvormde" antwoorden—dat zijn die vreemde, kapotte reacties waarbij de robot gewoon onzin herhaalt.

Interessant genoeg betoogt het artikel dat het simpelweg willekeuriger maken van de robot (zoals het verhogen van de temperatuur) niet genoeg is. Sterker nog, ze ontdekten dat het te willekeurig maken van de robot vaak juist tot meer waardeloze antwoorden leidde. De sleutel was de structuur van de exploratie: het hebben van meerdere verschillende versies van het model die samenwerken in dezelfde groep. Hoewel het artikel niet beweert dat dit een wondermiddel is dat alles oplost, suggereert het sterk dat het aanpassen van de interne parameters van het model een krachtig nieuw hulpmiddel is. Het is alsof je beseft dat om een verborgen schat te vinden, je niet alleen in willekeurige richtingen moet lopen; je moet een heel team van ontdekkingsreizigers uitsturen, elk met een iets andere kaart, om meer terrein te dekken. De onderzoekers vonden dat deze aanpak goed werkt zonder dat er aanzienlijk meer computerkracht voor nodig is, wat het een praktische upgrade maakt voor het trainen van intelligentere AI.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →