Beyond Reasoning Gains: Mitigating General-Capability Forgetting in Large Reasoning Models
Dit artikel introduceert RECAP, een end-to-end replay-strategie met dynamische herweging van doelstellingen die effectief het verlies van algemene capaciteiten bij grote redeneermodellen getraind met reinforcement learning mitigeert, terwijl het tegelijkertijd de redeneerprestaties verbetert door middel van flexibele beloningsafwegingen.
Oorspronkelijk artikel vrijgegeven aan het publieke domein onder CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Het Grote Probleem: De "Specialist"-valstrik
Stel je voor dat je een briljante, veelzijdige chef inhuurt die alles kan koken: ze kunnen een perfecte taart bakken, groenten met precisie snijden en zelfs een lekkende kraan in de keuken repareren (een metafoor voor het vermogen van een model om wiskunde, visie en algemene kennis te combineren).
Vervolgens besluit je deze chef specifal te trainen om te winnen in een hoogwaardige taarten eetwedstrijd. Je plaatst hen in een kamer met alleen maar ta рецепten en strikte regels over hoe ze de vork moeten vasthouden.
Wat gebeurt er?
Na een paar weken van intensieve training is de chef een wereldklasse taarteneter geworden. Ze volgen de regels voor het gebruik van de vork perfect. Maar omdat ze al hun tijd hebben besteed aan het oefenen van de taart, beginnen ze te vergeten hoe ze groenten moeten snijden of een kraan moeten repareren. Als je hen vraagt om een ui te snijden, staren ze je misschien alleen maar glazig aan of proberen ze de ui in zijn geheel op te eten.
In de wereld van AI is dit precies wat er gebeurt. Onderzoekers gebruiken een techniek genaamd RLVR (Reinforcement Learning with Verifiable Rewards) om Large Language Models (LLM's) te leren hoe ze moeten "redeneren" (wiskundige problemen oplossen, complexe logica volgen). Terwijl de modellen uitblinken in redeneren, beginnen ze hun andere vaardigheden te vergeten, zoals het herkennen van objecten in een afbeelding, het lezen van tekst in een afbeelding of het veilig en eerlijk blijven.
De Oplossing van het Papier: "RECAP"
De auteurs stellen een nieuwe methode voor genaamd RECAP (Replay-Enhanced CApability Preservation). Denk aan RECAP als een slim trainingsschema voor die chef.
In plaats van de chef de hele dag alleen maar ta рецепten te voeren, doet RECAP twee dingen:
- Herhaalt de Basis: Het brengt af en toe de oude "groentesnij-" en "kraanreparatie"-recepten terug, zodat de chef deze niet vergeet.
- Dynamische Weging: Het werkt als een slimme coach die de voortgang van de chef in realtime volgt.
Hoe de "Slimme Coach" Werkt (De Analogie)
Stel je voor dat de chef tegelijkertijd drie dingen oefent:
- De Vorkregel (Formaat): Hoe je de vork vasthoudt.
- De Smaak (Nauwkeurigheid): Smaakt de taart goed?
- De Opruiming (Algemene Vaardigheden): De keuken netjes houden.
In een normale trainingssessie zou de coach kunnen zeggen: "Oefen alle drie evenveel!" Maar dat is inefficiënt.
- De Vorkregel is makkelijk. De chef beheerst dit binnen 5 minuten. Als de coach hen dwingt om hier een uur lang op te oefenen, is dat verspilling van tijd.
- De Smaak is moeilijk. De chef worstelt hiermee.
- De Opruiming wordt een rommeltje omdat de chef afgeleid is.
De RECAP-coach kijkt naar de data en zegt:
"Hé, de chef heeft de Vorkregel al onder de knie. Laten we daar minder aandacht aan besteden (lagere weging). Laten we meer tijd besteden aan de Smaak en de Opruiming, omdat dat de onderdelen zijn waar ze nog mee worstelen of waar de resultaten instabiel zijn."
RECAP detectert automatisch welke vaardigheden "verzadigd" zijn (al geleerd) en welke "volatiel" zijn (worstelen of veranderen snel). Het verschuift de focus van de training naar de vaardigheden waar men mee worstelt, zodat het model niet te veel leert van de makkelijke zaken terwijl het de moeilijke zaken vergeet.
Wat Ze Hebben Ontdekt (De Resultaten)
De onderzoekers hebben dit getest op krachtige AI-modellen (specifiek de Qwen2.5-VL familie). Dit is wat zij ontdekten:
- Het "Vergeten" is Echt: Wanneer ze modellen uitsluitend trainden op redeneertaken, werden de modellen beter in wiskunde, maar werden ze aanzienlijk slechter in zaken zoals het lezen van tekst in afbeeldingen of het herkennen van objecten.
- RECAP Redt de Dag: Door hun dynamische schema te gebruiken, behielden de modellen hun redeneervaardigheden (soms verbeterden ze zelfs) maar verloorden ze niet hun algemene vaardigheden. Sterker nog, ze presteerden vaak beter op algemene taken dan modellen die met standaardmethoden zijn getraind.
- Efficiëntie: De modellen die met RECAP zijn getraind, werden niet alleen slimmer; ze werden ook efficiënter. Ze begonnen kortere, directere antwoorden te geven in plaats van te blijven rondzweten, omdat het systeem stopte met hen te dwingen om te "denken" (lange tekstketens te schrijven) bij taken die dat niet nodig hadden.
De Kernboodschap
Dit artikel betoogt dat we AI-modellen niet alleen moeten dwingen om "redeneermachines" te worden door alles wat eromheen komt te negeren. Als we dat doen, worden ze een eendimensionale specialist die vergeet hoe ze nuttig kunnen zijn in de echte wereld.
RECAP is een eenvoudige, plug-in tool die werkt als een gebalanceerd dieet voor AI-training. Het zorgt ervoor dat terwijl het model complexe puzzels oplost, het niet vergeet hoe het moet zien, lezen en de wereld om zich heen begrijpen. Het gaat erom de AI weloverwogen en veelzijdig te houden, terwijl het tegelijkertijd een genie wordt in zijn specifieke taak.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.