← Nieuwste papers
💬 NLP

Constrained Group Relative Policy Optimization

Dit artikel introduceert Constrained GRPO, een op Lagrange gebaseerde uitbreiding van Group Relative Policy Optimization die de handhaving van beperkingen en de trainingsstabiliteit verbetert door gestandaardiseerde voordelen in plaats van ruwe beloningen te scalariseren om de schadelijke koppelingseffecten te elimineren die worden veroorzaakt door normalisatie binnen groepen.

Oorspronkelijke auteurs: Roger Girgis, Rodrigue de Schaetzen, Luke Rowe, Azalée Robitaille, Christopher Pal, Liam Paull

Gepubliceerd 2026-09-03
📖 6 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Roger Girgis, Rodrigue de Schaetzen, Luke Rowe, Azalée Robitaille, Christopher Pal, Liam Paull

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

In de snel evoluerende wereld van kunstmatige intelligentie leren onderzoekers grote computermodellen om complexe problemen op te lossen, van het navigeren van zelfrijdende auto's tot het oplossen van moeilijke wiskundige puzzels. Deze modellen leren door middel van vallen en opstaan, een proces dat bekend staat als reinforcement learning (versterkend leren). Stel je een student voor die een doolhof probeert op te lossen; deze krijgt een beloning voor het bereiken van de uitgang en een straf voor het raken van een muur. Na verloop van tijd leert de student om beloningen te maximaliseren en straffen te vermijden. Er ontstaat echter een grote uitdaging wanneer we willen dat het model strikte regels volgt, zoals "raak nooit een voetganger" of "gebruik altijd de juiste grammatica", terwijl het nog steeds nuttig probeert te zijn. Als de regels te rigide zijn, kan het model nutteloos worden; als ze te los zijn, kan het de regels overtreden. Om dit op te lossen, gebruiken wetenschappers een wiskundig kader dat de drang om te slagen afweegt tegen de noodzaak om beperkingen te respecteren, waarbij de belangrijkheid van elke regel wordt aangepast terwijl het model leert.

Een populaire methode om deze modellen te onderwijzen, genaamd Group Relative Policy Optimization, is een favoriet geworden omdat het efficiënt is en geen apart "beoordelingsmodel" vereist om elke stap te evalueren. In plaats daarvan vergelijkt het een groep antwoorden die voor dezelfde vraag zijn gegenereerd om te beslissen welke beter zijn. Hoewel deze methode goed werkt voor algemene taken, ontdekten onderzoekers dat het toepassen ervan op strikte veiligheidsregels lastig was. In een nieuwe studie ontdekten een team van het Mila – Quebec AI Institute en École Polytechnique Montréal dat de standaardmanier om verschillende doelen in één enkele score te combineren, het vermogen van het systeem om regels te volgen, feitelijk kapot maakte. Ze introduceerden een nieuwe aanpak, Constrained Group Relative Policy Optimization, die dit gebrek herstelt en modellen in staat stelt om complexe gedragingen te leren terwijl ze zich strikt aan veiligheidslimieten houden.

Het kernprobleem dat de onderzoekers identificeerden, was hoe de computer tegelijkertijd met meerdere doelen omgaat. In de standaardbenadering neemt het model al zijn beloningen en straffen, mengt ze samen tot één enkel getal, en normaliseert dat getal vervolgens om het gemakkelijker te maken om ervan te leren. De onderzoekers toonden aan dat dit mengproces een verborgen interferentie creëert. Wanneer de computer het gewicht van één regel aanpast, verandert het onbedoeld de relatieve belangrijkheid van alle andere regels eveneeld. Het is alsof je probeert het volume van een enkel instrument in een orkest af te stemmen door aan een knop te draaien die ook de balans van de hele band verandert; je probeert misschien de violen luider te maken, maar daarmee maak je per ongeluk de drums te zacht en de fluiten te hard. Dit maakt het voor het model erg moeilijk om precies te leren welke regel het moet volgen, wat er vaak toe leidt dat het veiligheidsbeperkingen negeert of instabiel wordt tijdens de training.

Om dit op te lossen, veranderden de onderzoekers de volgorde van de operaties. In plaats van de beloningen en straffen eerst te mengen, lieten ze het model de waarde van elke regel afzonderlijk berekenen en deze individueel normaliseren. Pas nadat elke regel op zichzelf eerlijk is behandeld, combineren ze deze met behulp van de geleerde gewichten. Deze eenvoudige omschakeling verwijdert de verborgen interferentie. Door de signalen tot het allerlaatste moment gescheiden te houden, kan het model duidelijk zien hoeveel het op een specifieke regel verbetert. Het resultaat is een leerproces dat veel stabieler en voorspelbaarder is. De onderzoekers testten deze nieuwe methode in drie zeer verschillende omgevingen: een eenvoudig rastergebaseerd spel waarbij een agent lava moet vermijden en een batterij moet beheren, een realistische simulatie van autonoom rijden met duizenden complexe verkeersscenario's, en een wiskundige redentaak bestaande uit rekenproblemen voor basisschoolkinderen.

In het rastergebaseerde spel zorgde de nieuwe methode ervoor dat de agent veel soepeler kon leren. De standaardbenadering zorgde ervoor dat de agent overdreven voorzichtig werd, waarbij hij de lava zo agressief vermeed dat hij nauwelijks bewoog, terwijl de nieuwe methode de agent in staat stelde om zijn beschikbare "budget" aan risico effectief te gebruiken, waardoor hij de bestemming bereikte terwijl hij veilig bleef. In de simulatie van autonoom rijden produceerde de nieuwe aanpak bestuurders die niet alleen veiliger maar ook effectiever waren in het voltooien van hun routes. De modellen die met de nieuwe methode werden getraind, behaalden hogere scores in naleving van de veiligheid en voortgang van de route vergeleken met eerdere methoden die de signalen eerst mengden. Ze slaagden erin botsingen te vermijden en de verkeersregels te volgen zonder hun vermogen om vooruit te rijden op te offeren, een balans waar andere methoden moeite mee hadden.

De laatste test hield in dat een taalmodel werd onderwezen om wiskundeproblemen op te lossen terwijl ervoor werd gezorgd dat de antwoorden kort zijn, correct geformatteerd zijn en geldige getallen bevatten. Hier bewees de nieuwe methode opnieuw superieur te zijn. Modellen die getraind werden met de standaard mengbenadering, offerden vaak de juistheid op om hun antwoorden korter te maken of om in een specifiek formaat te passen. In contrast hiermee zorgde de nieuwe methode ervoor dat het model prioriteit gaf aan het juist uitvoeren van de wiskunde, terwijl het nog steeds hoge standaarden handhaafde voor de opmaak en lengte. Over verschillende groottes van computermodellen heen, van kleinere met 1,5 miljard parameters tot grotere met 7 miljard, produceerde de nieuwe aanpak consequent nauwkeurigere resultaten zonder dat er dure extra trainingscomponenten nodig waren.

De bevindingen suggereren dat de manier waarop we verschillende leer-signalen combineren net zo belangrijk is als de signalen zelf. Door simpelweg de volgorde te veranderen waarin de computer zijn beloningen en regels verwerkt, konden de onderzoekers een systeem creëren dat beperkingen veel betrouwbaarder respecteert. Dit werk biedt niet alleen een kleine verbetering; het biedt een duidelijker pad voor het trainen van kunstmatige intelligentie om veilig te opereren in de echte wereld, waar het volgen van de regels vaak net zo belangrijk is als het bereiken van het doel. De studie bevestigt dat wanneer we willen dat AI zowel bekwaam als veilig is, we voorzichtig moeten zijn dat de manier waarop we succes meten het model niet in verwarring brengt over wat het eigenlijk moet doen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →