← Nieuwste papers
🤖 machine learning

Robust Policy Optimization to Prevent Catastrophic Forgetting

Dit artikel introduceert Fine-tuning Robust Policy Optimization (FRPO), een robuust RLHF-kader dat een max-min-formulering hanteert om de stabiliteit van beloningen te optimaliseren over een omgeving van potentiële beleidsverschuivingen, waardoor effectief catastrofaal vergeten van veiligheid en andere geleerde gedragingen tijdens daaropvolgende downstream fine-tuning wordt voorkomen zonder bijkomende rekenkosten.

Oorspronkelijke auteurs: Mahdi Sabbaghi, George Pappas, Adel Javanmard, Hamed Hassani

Gepubliceerd 2026-05-13
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Mahdi Sabbaghi, George Pappas, Adel Javanmard, Hamed Hassani

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een briljante student hebt, laten we die "AI" noemen. Je hebt jarenlang deze student getraind om behulpzaam, beleefd en veilig te zijn. Ze weten hoe ze vragen moeten beantwoorden zonder onbeleefd te zijn, en ze weten gevaarlijke verzoeken af te wijzen (zoals "hoe bouw je een bom"). Dit is de fase van "veiligheidstraining".

Nu wil je dezezelfde student een nieuwe, specifieke vaardigheid leren, zoals geavanceerde wiskunde of programmeren. Je start een nieuwe klas (fine-tuning). Maar hier is het probleem: naarmate de student de nieuwe wiskunderegels leert, beginnen ze de oude veiligheidsregels te vergeten. Plotseling kunnen ze, wanneer ze om een wiskundevraag worden gevraagd, per ongeluk een gevaarlijk antwoord geven, omdat ze zo gefocust waren op de wiskunde dat ze hun "doe geen kwaad"-training vergeten zijn. In het artikel wordt dit catastrofaal vergeten genoemd.

De meeste eerdere pogingen om dit op te lossen waren als het vertellen aan de student: "Hé, vergeet je veiligheidsregels niet terwijl je wiskunde doet!" nadat de wiskundeles al was begonnen. Het artikel betoogt dat dit te laat is. In plaats daarvan moet je de student leren robuust te zijn voordat ze zelfs maar de wiskundeles beginnen.

De Kernidee: De "Vlakke" Plek Vinden

De auteurs stellen een nieuwe trainingsmethode voor genaamd FRPO (Fine-tuning Robust Policy Optimization). Om te begrijpen hoe het werkt, stel je een landschap van heuvels en valleien voor:

  • De Oude Weg (Standaard Training): De student zoekt de allerhoogste piek in het landschap. Deze piek vertegenwoordigt de hoogst mogelijke score voor de huidige taak. Deze piek kan echter een scherpe, naaldachtige berg zijn. Als de student zelfs maar een klein stapje in een willekeurige richting zet (zoals het leren van een nieuwe wiskunderegel), glijden ze direct van de piek af en vallen ze een afgrond in, waardoor ze al hun veiligheidsvaardigheden verliezen.
  • De FRPO-Weg: In plaats van te zoeken naar de enige hoogste naaldpunt, leert FRPO de student een breed, vlak plateau te vinden dat nog steeds erg hoog ligt. Op dit plateau kan de student een paar stappen in elke richting zetten (het leren van nieuwe vaardigheden) zonder van de rand te vallen. De beloning (veiligheid) blijft hoog, zelfs terwijl ze zich verplaatsen.

Hoe Het Werkt (Het "Wat Als"-Spel)

Het artikel gebruikt een slimme wiskundige truc om deze vlakke plateaus te vinden. In plaats van alleen te vragen: "Hoe goed is de student op dit moment?", vraagt FRPO:

"Wat is de slechtst mogelijke score die deze student kan behalen als we kleine, redelijke veranderingen in hun gedrag aanbrengen (zoals een typische wiskundeles zou doen)?"

Het algoritme probeert vervolgens die slechtst mogelijke score te maximaliseren. Het dwingt de student een strategie te leren die veilig is, zelfs als dingen iets veranderen. Het is als het trainen van een atleet niet alleen om snel te rennen op een perfect parcours, maar om snel te rennen, zelfs als het parcours een beetje hobbelig of winderig wordt.

De Resultaten: Veiligheid die Blijft

De onderzoekers hebben dit getest op grote taalmodellen (de "studenten") in twee hoofdscenario's:

  1. Veiligheidstraining: Ze trainden modellen om veilig te zijn, en probeerden ze vervolgens te "fine-tunen" op wiskundeproblemen (GSM8K) of algemene instructies (Alpaca).

    • Het Resultaat: Modellen met standaard training vergeten hun veiligheidsregels en worden gevaarlijk. Modellen getraind met FRPO behielden hun veiligheidsrempels intact terwijl ze nog steeds de wiskunde leerden. Ze vergeten niet alleen "minder"; ze behielden daadwerkelijk hun vermogen om "nee" te zeggen tegen slechte verzoeken, zelfs na het leren van nieuwe vaardigheden.
  2. Wiskundetraining: Ze trainden modellen om goed te zijn in wiskunde, en probeerden ze vervolgens programmeren te leren.

    • Het Resultaat: Meestal maakt het leren programmeren van een wiskunde-expert slechter in wiskunde. FRPO-modellen behielden echter hun wiskundenauwkeurigheid veel hoger (ongeveer 22% beter) dan de standaardmodellen na het leren programmeren.

Waarom Dit Belangrijk Is

Het artikel beweert dat door hoe we het basismodel aanvankelijk trainen (het "vlak" en robuust maken), we later geen complexe, dure oplossingen nodig hebben. We hoeven geen oude gegevens op te slaan om mee te "repeteren", of speciale softwaremodules te gebruiken om delen van het brein te vergrendelen. We bouwen het model gewoon vanaf het begin stevig.

Kortom: FRPO leert AI-modellen een "veilige zone" te vinden die breed genoeg is om hen nieuwe dingen te laten leren zonder van een afgrond te vallen. Het gaat om het bouwen van een fundering die niet kraakt wanneer je een nieuwe kamer aan het huis toevoegt.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →