← Nieuwste papers
🤖 machine learning

Off-Context GRPO: Learning to Reason on Hard Problems using Privileged Information

Dit artikel introduceert Off-Context GRPO (OC-GRPO), een reinforcement learning-algoritme dat geprivilegieerde begeleiding tijdens de training benut om leerplateaus op moeilijke redeneerproblemen te overwinnen, terwijl het belangscorrectie gebruikt om ervoor te zorgen dat het model optimaliseert voor de oorspronkelijke ongebegeleide doelstelling, wat resulteert in significante prestatiewinsten op wiskundige benchmarks.

Oorspronkelijke auteurs: Priyank Agrawal, Ankur Samanta, Shervin Ghasemlou, Jalaj Bhandari, Kavosh Asadi, Daniel Jiang, Aditya Modi

Gepubliceerd 2026-07-22
📖 3 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Priyank Agrawal, Ankur Samanta, Shervin Ghasemlou, Jalaj Bhandari, Kavosh Asadi, Daniel Jiang, Aditya Modi

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je een robot voor die getraind wordt om ingewikkelde wiskundepuzzels op te lossen, samen met een leraar die direct kan controleren of een antwoord goed of fout is. Deze opstelling, een leerling plus een automatische rechter die een duidelijk goed-of-fout verdict geeft, is wat AI-onderzoekers "Reinforcement Learning with Verifiable Rewards" noemen. De robot probeert een puzzel, krijgt een duim omhoog als hij het goed heeft en een duim omlaag als dat niet zo is, en leert door vele pogingen steeds meer duimen omhoog te verzamelen.

Het addertje onder het gras is dat sommige puzzels zo ver buiten het bereik van de robot liggen dat elke enkele poging mislukt. Wanneer elke poging faalt, zijn alle oordelen identiek, is er niets om mee te vergelijken en heeft de leraar geen signaal om mee te werken. Het lijkt op het proberen te leren fietsen terwijl je eraf valt op het moment dat de pedalen draaien: zonder ooit het gevoel van evenwicht te hebben ervaren, is er niets om op voort te bouwen. Dit wordt een "leerklif" genoemd.

De voor de hand liggende oplossing is een spiekbriefje, een hint of de eerste paar stappen van de uitgewerkte oplossing, zodat de robot tenminste af en toe slaagt. Dat werkt, maar het roept een lastige vraag op: hoeveel krediet verdient een robot eigenlijk voor een overwinning die hem is aangereikt?

Dit artikel beantwoordt die vraag op de juiste manier. De methode, Off-Context GRPO (OC-GRPO), past een correctie toe die vraagt hoe waarschijnlijk het was dat de robot precies die oplossing had bereikt zonder het spiekbriefje. Krediet wordt nooit volledig gegeven; een deel behoort altijd toe aan de hint, en hoeveel er overblijft hangt af van hoe bekwaam de robot al was. Een robot die er bijna in slaagde het alleen op te lossen, behoudt het meeste krediet, omdat het spiekbriefje slechts een vaardigheid naar boven bracht die er al was. Een robot die eigenlijk geen enkele kans maakte, behoudt bijna niets, omdat het spiekbriefje de vaardigheid verving in plaats van deze te onthullen. Een spiekbriefje kan geen vooruitgang creëren uit een vaardigheid die er niet is. Fouten werken omgekeerd: een puzzel fout hebben terwijl de helft van het antwoord al voor je ligt, leidt tot een zwaardere straf dan een gewone misser, aangezien falen met hulp een sterker bewijs is dan falen zonder hulp. Bij de moeilijkste puzzels, waarbij de onbegeleide bekwaamheid bijna nul is, komt het meeste echte leren voort uit die versterkte straf in plaats van door de geassisteerde overwinningen. De robot wordt weggeduwd van wat hij aantoonbaar nog niet kan, in plaats van dat hij wordt gecongratuleerd met het volgen van instructies.

Het resultaat is dat de robot altijd wordt beoordeeld op de echte puzzel, niet op de geprinte versie met hints, ondanks het feit dat hij met hulp heeft geoefend.

Op standaard wiskundige benchmarks verhoogde OC-GRPO de gemiddelde nauwkeurigheid van 27,8% naar 31,7% ten opzichte van de standaard trainingsmethode, een relatieve winst van 13,8%, tegen nagenoeg geen extra kosten. De correctie is het belangrijkst voor kleinere modellen: daar presteren oudere hint-gebaseerde methoden zelfs slechter dan gewone training, omdat een zwakkere leerling de discrepantie tussen de met hint en de zonder hint gepresenteerde puzzel niet kan absorberen, terwijl OC-GRPO zijn winst behoudt bij elke geteste grootte. De bredere les is dat geprivilegieerde hints een uitstekende manier zijn om exploratie te sturen. Het krediet moet alleen eerlijk worden toegewezen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →