RL Excursions during Pre-Training: Re-examining Policy Optimization for LLM training
Dit artikel daagt de standaardpraktijk uit waarbij reinforcement learning (RL) pas na supervised fine-tuning (SFT) wordt toegepast door aan te tonen dat het integreren van RL eerder in de pre-training fase, het optimaliseren van de datasamenstelling en het samenvoegen van RL met SFT-doelstellingen effectief de redeneervaardigheden kan verbeteren en de modeldistributies kan uitbreiden, terwijl algemene vermogens behouden blijven.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een briljante maar onervaren student (het AI-model) traint om wiskundeproblemen op te lossen. Jarenlang was het standaardrecept drie stappen:
- Pre-training: De student leest miljoenen boeken om algemene taal en feiten te leren.
- SFT (Supervised Fine-Tuning): Een docent geeft de student een tekstboek met problemen en hun exacte juiste antwoorden, waardoor de student het oplossingspad uit het hoofd moet leren.
- RL (Reinforcement Learning): De student wordt in een spel geplaatst waarbij ze punten krijgen alleen als ze het uiteindelijke antwoord goed hebben, wat hen aanmoedigt om zelf nieuwe manieren te bedenken om problemen op te lossen.
Dit artikel vraagt: Moeten we echt wachten tot de student alle boeken heeft gelezen en het tekstboek uit zijn hoofd heeft geleerd voordat we hem het spel laten spelen?
Hier is wat de onderzoekers hebben ontdekt, eenvoudig uitgelegd:
1. Je kunt het spel vroeg beginnen
De standaardregel luidt: "Wacht tot de student volledig getraind is voordat je het spel geeft." De onderzoekers probeerden het spel (RL) aan de student te geven terwijl deze nog bezig was met het lezen van de eerste paar hoofdstukken (vroeg in de pre-training).
- Het resultaat: Het werkte verrassend goed! Zelfs toen de student slechts een fractie van de boeken had gelezen, hielp het spelen van het spel hen om wiskundeproblemen veel beter op te lossen dan alleen meer boeken lezen. Sterker nog, het spel vroeg spelen was vaak net zo goed als wachten tot het einde en het hele "Lezen → Onthouden → Spelen"-ritueel doorlopen.
2. Het "Spel" is beter wanneer je geen tekstboek hebt
Normaal gesproken vereist de "Onthouden"-stap (SFT) een tekstboek met de juiste antwoorden. Maar wat als je niet genoeg tekstboeken hebt?
- De bevinding: Als je slechts één of twee voorbeelden hebt van hoe je een probleem oplost, faalt de "Onthouden"-stap (SFT). Maar het "Spel" (RL) gedijt juist. De student leert te verkennen en oplossingen te vinden op eigen initiatief zonder een perfect antwoordenboek nodig te hebben. Het spel is een veel sterkere leraar wanneer je weinig voorbeelden hebt.
3. Het geheime ingrediënt is het type boeken, niet de grootte van de student
Mensen denken vaak: "Als de student groter is (krachtiger), zal hij beter leren." De onderzoekers testten dit door de student groter te maken.
- De twist: Het groter maken van de student hielp hen niet om het spel sneller te leren. Het geven van meer wiskundeboeken specifiek tijdens hun vroeende leesfase deed dat echter wel.
- De les: Als je wilt dat de student goed wordt in wiskunde, voer hem dan vroeg in de fase wiskundeverhalen. De inhoud van wat ze lezen is belangrijker dan hoe groot hun brein is.
4. De "Scherpings"-mythe versus "Expansie"
Er is een recente discussie: Maakt het "Spel" (RL) de bestaande antwoorden van de student alleen maar scherper en zelfverzekerder, of leert het hen daadwerkelijk nieuwe manieren van denken?
- De oude visie: Veel mensen dachten dat RL de student alleen maar "scherpte", waardoor ze zelfverzekerder werden maar niet noodzakelijkerwijs slimmer.
- De nieuwe ontdekking: De onderzoekers ontdekten dat het "scherpings"-effect eigenlijk voortkomt uit de "Onthouden"-stap (SFT). Wanneer je een student eerst dwingt een tekstboek uit het hoofd te leren, stoppen ze met verkennen.
- De echte magie: Als je de student het spel direct laat spelen zonder eerst het tekstboek uit het hoofd te leren, laten ze hun denken daadwerkelijk expanderen. Ze proberen veel verschillende paden en ontdekken nieuwe oplossingen die ze nog nooit kenden. De "Onthouden"-stap is wat hun creativiteit juist beperkt, niet het spel zelf.
5. Het "Super-Student"-recept
De onderzoekers combineerden het beste van beide werelden. In plaats van "Onthouden" en dan "Spelen", lieten ze de student beide tegelijkertijd doen.
- Hoe het werkt: Stel je voor dat de student een probleem oplost. Een deel van hun brein controleert het tekstboek (SFT), en een ander deel experimenteert met nieuwe ideeën (RL). Ze middelen het advies van beide delen om hun brein bij te werken.
- Het resultaat: Deze "Super-Student" (Parallel Averaging) werd de beste in het oplossen van problemen. Ze kregen vaker de juiste antwoorden dan wie dan ook, en in tegen tegenstelling tot de studenten die alleen het tekstboek uit hun hoofd leerden, vergaten ze niet hoe ze andere dingen moesten doen (zoals algemene gesprekken voeren).
Samenvatting van de belangrijkste punten
- Wacht niet: Je kunt Reinforcement Learning (het spel) heel vroeg in het leven van een model gebruiken, zelfs voordat het zijn "leesfase" heeft voltooid.
- Data is belangrijker dan grootte: Het voeden van het model met specifieke soorten data (zoals wiskunde) tijdens de pre-training is belangrijker dan simpelweg het model groter maken.
- RL is niet de schurk: RL verpest de algemene vaardigheden van een model niet of maakt het alleen maar "scherper". Die negatieve effecten komen door de "Onthouden"-stap (SFT). RL helpt modellen juist om te verkennen en nieuwe oplossingen te vinden.
- Doe het samen: De beste resultaten komen voort uit het gelijktijdig mengen van de "Onthouden"- en "Spelen"-stappen, in plaats van ze na elkaar te doen.
Kortom, het artikel suggereert dat we moeten stoppen met Reinforcement Learning te behandelen als een laatste afwerking aan het einde. In plaats daarvan moeten we het veel eerder in het trainingsproces verweven en het mengen met andere methoden om slimmere, meer capabele modellen te krijgen.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.