← Nieuwste papers
🤖 machine learning

Leveraging Instruction Tuning and Merging for Reasoning Model Adaptation

Dit artikel stelt een kosteneffectieve methode voor die redeneermodellen voor taal verbetert in zowel verifieerbare als onverifieerbare domeinen door eerst klassieke instructie-afstemming toe te passen op door mensen geschreven oplossingen en vervolgens het resulterende model te fuseren met het oorspronkelijke redeneermodel om domeinspecifieke redeneercapaciteiten te herstellen.

Oorspronkelijke auteurs: Yu-Du Feng, Niels Mündler-Sasahara, Mark Vero, Martin Vechev

Gepubliceerd 2026-07-17
📖 3 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Yu-Du Feng, Niels Mündler-Sasahara, Mark Vero, Martin Vechev

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een briljante, overdenkende student probeert te leren hoe hij een nieuw type puzzel moet oplossen. Deze student, een "Reasoning Language Model", is een speciaal soort computerprogramma dat getraind is om zijn werk te laten zien. Voordat het een antwoord geeft op een wiskundig probleem of een programmeeruitdaging, schrijft het een lang, stapsgewijs denkproces uit, zoals een detective die een mysterie oplost. Deze gewoonte van "hardop denken" is wat het zo goed maakt in lastige taken.

Maar er is een addertje onder het gras. Om deze student nieuwe vaardigheden te leren, heb je meestal een manier nodig om direct te controleren of zijn antwoord juist is (zoals een antwoordenboek bij wiskunde) of een superintelligente leraar om hem te laten zien hoe hij moet denken. Maar wat als je hem iets wilt leren waarvoor geen antwoordenboek bestaat, zoals het schrijven van een grappige samenvatting van een verhaal of het oplossen van een specifieke bug in een computerprogramma die geen test heeft? Je hebt wel heel veel voorbeelden van de juiste antwoorden geschreven door mensen, maar geen van die voorbeelden laat het "denkproces" zien. Als je de student alleen dwingt om deze antwoorden uit het hoofd te leren zonder de denkstappen, kan hij wel het juiste antwoord geven voor die specifieke puzzel, maar vergeet hij hoe hij algemeen moet denken. Hij wordt dan een papegaai die antwoorden herhaalt in plaats van een detective die problemen oplost.

Dit is de puzzel die onderzoekers aan de ETH Zürich aanpakten in hun nieuwe paper. Ze ontdekten een slimme tweestaps-truc om deze "denkende" modellen nieuwe vaardigheden te leren zonder dat ze vergeten hoe ze moeten denken. Eerst laten ze het model leren van de eenvoudige "alleen-het-antwoord"-voorbeelden, net zoals een student die voor een toets staat te stampen. Dit maakt het model beter in de specifieke taak, maar het begint zijn gewoonte om zijn werk te tonen te verliezen. Daarna voeren ze een magische "merge" uit. Ze nemen dit nieuw getrainde model en mengen het terug met het oorspronkelijke, slimme denkmodel. Het is alsof je een kop verse, taakspecifieke koffie mengt met een kop van de oorspronkelijke, sterke espresso. Door de verhouding van de mix zorgvuldig aan te passen, ontdekten ze een "sweet spot" waarbij het model zijn nieuwe vaardigheden behoudt, maar ook weer onthoudt hoe het problemen moet doordenken.

De onderzoekers testten dit op vier verschillende slimme modellen en twee zeer verschillende taken: het schrijven van code in de programmeertaal Rust en het samenvatten van lange nieuwsartikelen. Ze ontdekten dat hun methode wonderen deed. De modellen werden veel beter in de specifieke taken (met verbeteringen in codingscores tot wel 12 punten en licht hogere scores voor samenvattingen), terwijl ze bijna volledig hun vermogen om te redeneren herstelden, wat normaal gesproken door standaard training wordt vernietigd. Nog beter is dat dit hele proces ongelooflijk goedkoop en snel was. De onderzoekers berekenden dat ze een model konden aanpassen voor minder dan $3 en in minder dan een uur, terwijl andere methoden die proberen hetzelfde probleem op te lossen, aanzienlijk meer kosten en langer duren.

Kortom, de paper suggereert dat je geen superdure "antwoordcontrole"-systemen of een geniale leraar nodig hebt om deze reasoning-modellen te upgraden. Je kunt de enorme hoeveelheden eenvoudige "vraag-en-antwoord"-data die al bestaan gebruiken, en met een beetje wiskundig mengen, kun je deze modellen nieuwe vaardigheden geven zonder hun brein te breken. Het is een goedkope manier met een hoog rendement om onze AI-detectives scherp te houden, zelfs wanneer ze leren om mysteries op te lossen die geen voor de hand liggende oplossingen hebben.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →