Le Critique: Privileged Value Functions for LLM Reinforcement Learning
Het artikel introduceert "Le Critique", een framework dat het reinforcement learning van Large Language Models verbeteren door Privileged Value Functions (PVF) te combineren voor het injecteren van taakrelevante token-niveau signalen en TETHER voor het adaptief interpoleren tussen groep-relatieve en waarde-baselines, waardoor superieure prestaties worden behaald ten opzichte van standaard waarde-functie baselines en competitieve resultaten worden behaald met GRPO, terwijl problemen zoals straggler rollouts en hoge variantie worden gemitigeerd.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
In de wereld van kunstmatige intelligentie is er een constante strijd om computersystemen te leren hoe ze beter kunnen denken. Stel je een student voor die een toets maakt. Als ze het uiteindelijke antwoord goed hebben, krijgen ze een goed cijfer. Als ze het fout hebben, krijgen ze een slecht cijfer. Dit is hoe veel moderne AI-systemen leren: ze proberen vele verschillende manieren om een probleem op te lossen, en de computer past zijn brein aan op basis van of het uiteindelijke resultaat een succes of een mislukking was. Deze methode wordt reinforcement learning genoemd. Er zit echter een addertje onder het gras. Als de student een lang, ingewikkeld essay schrijft en het uiteindelijke cijfer fout krijgt, weet de computer niet welke specifieke zin de fout heeft veroorzaakt. Hij weet alleen dat het hele essay slecht was. Dit maakt het leren traag en inefficiënt, zoals proberen een automotor te repareren door te gokken welk onderdeel kapot is zonder gereedschap te gebruiken.
Om dit op te lossen, hebben onderzoekers lang geprobeerd een "critic" (criticus) voor de AI te bouwen. Dit is een tweede computerprogramma dat de student observeert terwijl deze schrijft, zin voor zin, en voorspelt hoe goed het uiteindelijke antwoord zal uitpakken. Als de criticus vroegtijdig het uiteindelijke cijfer kan raden, kan hij de student onmiddellijk vertellen wanneer hij een verkeerde afslag neemt, wat zorgt voor veel sneller en nauwkeuriger leren. Een tijdlang raakte deze aanpak uit de mode omdat het bouwen en trainen van dit tweede programma moeilijk en vaak onbetrouwbaar was. Recentelijk is het veld verschoven naar methoden die de criticus volledig overslaan door in plaats daarvan groepen antwoorden met elkaar te vergelijken. Maar dit nieuwe artikel suggereft dat het oude idee van de criticus niet dood is; het had alleen een nieuwe manier nodig om de wereld te zien.
De onderzoekers, werkend bij Mistral AI en andere instellingen, ontdekten dat de criticus faalt, niet omdat het een slecht idee is, maar omdat er vaak het onmogelijke van hem wordt gevraagd. Ze ontdekten dat als ze de criticus een klein beetje extra informatie gaven die de hoofd-AI-student niet mocht zien, de criticus ongelooflijk accuraat werd. Ze noemen dit een "privileged value function" (geprivilegieerde waardefunctie). Om te begrijpen hoe dit werkt, stel je een student voor die een wiskundetoets maakt. De student lost een probleem stap voor stap op. De criticus kijkt toe. Normaal gesproken moet de criticus het uiteindelijke cijfer raden op basis van alleen wat de student tot nu toe heeft geschreven. Maar in deze nieuwe opstelling krijgt de criticus stiekem het juiste antwoordmodel voorgelegd. Het laat het antwoord niet aan de student zien, maar gebruikt die geheime kennis om de huidige voortgang van de student veel nauwkeuriger te beoordelen. Als de huidige stap van de student ver van het juiste pad afwijkt, weet de criticus dat onmiddellijk en geeft hij een duidelijk signaal om koers te wijzigen. Dit signaal helpt de student om veel sneller te leren dan wanneer de criticus blind zou moeten gokken.
Het team testte dit idee op verschillende moeilijke redeneertaken, waaronder het oplossen van logische puzzels en het schrijven van computercode. In één experiment gebruikten ze een Sudoku-puzzel, waarbij de AI een raster één getal per keer moest invullen. De hoofd-AI kon alleen de getallen zien die hij al had geplaatst. De geprivilegieerde criticus kreeg echter het volledig opgeloste raster te zien. Dit stelde de criticus in staat om de AI onmiddellijk te vertellen of een zet leidde tot een doodlopend pad, zelfs als de AI pas een paar zetten had gedaan. De resultaten waren opmerkelijk. In elke taak die ze probeerden, hielp het gebruik van deze "geprivilegieerde" criticus de AI om sneller te leren en hogere scores te behalen dan de standaardmethoden. De AI had niet alleen geluk; de AI leerde betere beslissingen te nemen omdat het een duidelijkere kaart had van waar het naartoe ging.
De onderzoekers realiseerden zich ook dat de criticus soms nog aan het leren is en nog niet perfect is. Als de criticus te zelfverzekerd is maar het fout heeft, kan dit de AI in de war brengen. Om dit op te lossen, bouwden ze een tweede hulpmiddel genaamd "Tether". Dit systeem fungeert als een slimme schakelaar. Aan het begin van de training, wanneer de criticus nieuw en onbetrouwbaar is, vertrouwt het systeem voornamelijk op het vergelijken van groepen antwoorden, wat een veilige maar tragere methode is. Naarmate de criticus beter wordt en nauwkeuriger advies begint te geven, verschuift het Tether-systeem het vertrouwen langzaam naar de criticus. Het combineert de twee methoden en beweegt vloeiend van de ene naar de andere, zonder dat menselijke technici instellingen hoeven aan te passen. Dit zorgt ervoor dat de AI altijd de beste mogelijke begeleiding heeft, of de criticus nu een beginner of een expert is.
De studie laat zien dat het oude idee om een tweede programma te gebruiken om het leren te begeleiden niet alleen geldig, maar zelfs superieur is, mits het de juiste instrumenten krijgt. Door de criticus toe te staan dingen te zien die de hoofd-AI niet kan zien, hebben de onderzoekers de giswerkzaamheid uit het leerproces verwijderd. Ze toonden ook aan dat deze aanpak robuust en automatisch kan worden gemaakt, waarbij deze zich aanpast aan het eigen vaardigheidsniveau van de criticus. Hoewel dit werk aanzienlijke rekenkracht en zorgvuldige engineering vereiste, suggereren de resultaten een duidelijke weg vooruit. In plaats van de criticus op te geven, ligt de toekomst van het aanleren van redeneren aan AI in het geven van een beter zicht op de oplossing, waardoor het uit zijn fouten kan leren met een helderheid die voorheen onbereikbaar was.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.