A Regret Minimization Framework on Preference Learning in Large Language Models
Dit artikel introduceert Regret-based Preference Optimization (RePO), een nieuw raamwerk dat reinforcement learning van menselijke feedback herformuleert door middel van regret-minimalisatie om de prospectieve en contrafactische aard van menselijke voorkeuren beter te vatten, wat resulteert in consistente prestatieverbeteringen op redeneer- en voorkeursbenchmarks.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een robot leert om een wiskundig probleem op te lossen of een behulpzame e-mail te schrijven. Je wilt dat de robot leert van menselijke feedback, maar mensen zeggen meestal niet: "Deze zin is precies 7,5 punten waard." In plaats daarvan zeggen we: "Ik geef de voorkeur aan dit antwoord boven dat antwoord."
Lange tijd hebben informaticus robots geleerd om te leren door te proberen een score te maximaliseren. Ze behandelden elke stap die de robot zette alsof hij onmiddellijk punten verdiende, zoals het verzamelen van munten in een videogame. Als de robot een stap "goed" uitvoerde, kreeg hij een munt. Als hij het "fout" deed, verloor hij een munt. Het doel van de robot was simpelweg om zoveel mogelijk munten te pakken.
Het probleem met de "Muntverzamelaar"-aanpak
Het artikel betoogt dat deze "muntverzamelaar"-mentaliteit eigenlijk een slechte manier is om te begrijpen hoe mensen denken. Mensen kijken niet alleen naar de onmiddellijke stap; we kijken vooruit en we kijken terug naar wat er had kunnen gebeuren.
De auteurs gebruiken een geweldige analogie: het "Wat als"-spel.
Stel je voor dat je naar een schaker kijkt die een zet doet.
- De oude manier (Beloningsmaximalisatie): Je kijkt naar die enkele zet. Heeft hij een stuk geslagen? Zo ja, goed! Zo nee, slecht. Je beoordeelt de zet in isolatie.
- De nieuwe manier (Regret Minimalisatie): Je kijkt naar de zet en vraagt je af: "Als ze hier een andere zet hadden gedaan, zou het spel dan beter zijn verlopen?" Of: "Als ze zo blijven spelen, zullen ze dan over 10 zetten winnen?"
Mensen zijn slecht in het beoordelen van een stap in isolatie. We beoordelen het op basis van prospectieve anticipatie (wat we denken dat er hierna zal gebeuren) en counterfactuale vergelijking (wat ze anders hadden kunnen doen).
De oplossing van het artikel: "Regret-Based Preference Optimization" (RePO)
De auteurs introduceren een nieuwe methode genaamd RePO. In plaats van te proberen punten te maximaliseren, leert RePO de robot om spijt te minimaliseren (regret minimization).
Denk aan "Spijt" (Regret) als het gevoel dat je krijgt wanneer je zegt: "Ik had de andere weg moeten nemen; ik had dan de file vermeden."
- In de oude methode geeft de robot alleen om het feit of de weg die hij nam op dit moment soepel verloopt.
- In de nieuwe methode (RePO) vraagt de robot: "Vergeleken met de beste weg die ik had kunnen nemen, hoeveel heb ik de fout in gegaan?"
Hoe het werkt in begrijpelijke taal
- Vooruitkijken: Wanneer een mens naar een gedeeld antwoord kijkt (zoals de eerste helft van een wiskundige oplossing), maakt die persoon de som in gedachten af. Als zij denken: "O, dit pad leidt uiteindelijk tot een fout antwoord," dan vinden ze de eerste helft niet goed, zelfs als de eerste helft er prima uitziet. RePO bootst dit na door de toekomst te simuleren om te zien of de huidige stap tot een doodlopende weg leidt.
- Alternatieven vergelijken: Mensen beoordelen een actie vaak door deze te vergelijken met een "betere" versie die niet heeft plaatsgevonden. RePO berekent de "afstand" tussen wat de robot deed en wat de "perfecte" robot zou hebben gedaan. Het probeert die kloof te verkleinen.
- De "Spijt"-score: In plaats van een positieve score voor het zijn van "goed", berekent RePO een "spijt"-score. Het doel is om deze spijt zo dicht mogelijk bij nul te krijgen. Als de spijt hoog is, betekent dit dat de robot een keuze heeft gemaakt die leidde tot een slechter resultaat dan hij had kunnen bereiken.
Waarom dit belangrijk is (volgens het artikel)
De onderzoekers hebben dit getest op wiskundige problemen en algemene conversatietaken. Ze ontdekten dat robots getraind met RePO beter waren in:
- Het oplossen van wiskunde: Ze begrepen dat een stap alleen "goed" is als deze leidt tot het juiste uiteindelijke antwoord, en niet alleen als de stap zelf logisch lijkt.
- Het volgen van menselijke smaak: Ze stemden beter af op menselijke voorkeuren omdat ze stopten met proberen het systeem te "bespelen" voor onmiddellijke punten en begonnen na te denken over de hele reis, net zoals mensen dat doen.
De "Magische Truc" (Sample Efficiëntie)
Een van de coolste bevindingen is dat RePO "slimmer" is in hoe het leert.
- Oude methode (DPO): Als je de robot een wiskundig probleem laat zien waarbij het antwoord verborgen is (gemaskeerd), raakt de robot in de war en presteert hij slecht. Hij moet vele malen het volledige, correcte antwoord te zien krijgen om het patroon te leren.
- Nieuwe methode (RePO): Omdat RePO gebouwd is op het idee van "spijt" (nadenken over wat er had kunnen gebeuren), begrijpt het van nature dat een verborgen antwoord verdacht is. Het heeft niet veel extra training nodig om te begrijpen dat onvolledige paden slecht zijn. Het heeft de les "geïnternaliseerd" dat "als je de finishlijn niet kunt zien, ben je waarschijnlijk een verkeerde afslag genomen."
In het kort
Het artikel zegt: Stop met het leren aan robots om hebzuchtige muntverzamelaars te zijn die alleen om de volgende stap geven. Leer ze in plaats daarvan om reflectieve reizigers te zijn die vragen: "Heb ik het beste pad mogelijk genomen, en hoeveel spijt heb ik van mijn keuzes vergeleken met de weg die ik niet heb genomen?" Door dit te doen, worden de robots beter in redeneren en stemmen ze beter af op hoe mensen daadwerkelijk denken.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.