← Nieuwste papers
🤖 machine learning

RASFT: Rollout-Adaptive Supervised Fine-Tuning for Reasoning

Het artikel stelt RASFT voor, een beleidsbewust framework voor supervised fine-tuning dat de balans tussen expertimitatie en zelfgegenereerde redenering dynamisch aanpast op basis van de oplosbaarheid van problemen en beleidsvertrouwen, waarmee het een superieure prestatie levert op benchmarks voor wiskundige en programmeerredenering vergeleken met bestaande SFT- en RL-methoden.

Oorspronkelijke auteurs: Yongliang Miao, Fengyuan Liu, Wei Shi, Yanguang Liu, Fei Sun, Na Zou, Mengnan Du

Gepubliceerd 2026-06-08
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Yongliang Miao, Fengyuan Liu, Wei Shi, Yanguang Liu, Fei Sun, Na Zou, Mengnan Du

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een briljante maar lichtelijk koppige student leert hoe je complexe puzzels oplost, zoals geavanceerde wiskundeproblemen of het schrijven van computercode.

De Oude Manier: "Kopieer de Meester"

Traditioneel trainen we deze AI-modellen (genaamd Large Language Models) met een methode die Supervised Fine-Tuning (SFT) wordt genoemd. Zie dit als het overhandigen van een enkele, perfecte oplossing aan de student, geschreven door een meesterleraar, met de woorden: "Memoriseer dit exacte pad. Doe precies wat ik deed, woord voor woord."

Het probleem is dat redeneren niet alleen draait om kopiëren. Een puzzel kan vaak op veel verschillende geldige manieren worden opgelost. Als de student star de ene specifieke weg van de meester kopieert, kan hij:

  1. Zijn eigen intuïtie vergeten: Hij stopt met het gebruiken van zijn eigen denkkracht omdat hij te druk is met het imiteren van de leraar.
  2. Overfitten op de oppervlakte: Hij leert de stijl van het antwoord in plaats van de logica erachter.
  3. Falen wanneer hij vastloopt: Als het pad van de leraar te moeilijk is voor het huidige vaardigheidsniveau van de student, raakt de student simpelweg in de war en geeft hij het op.

De Nieuwe Manier: RASFT (De "Slimme Coach")

Het paper introduceert een nieuwe methode genaamd RASFT (Rollout-Adaptive Superized Fine-Tuning). In plaats van een rigide leraar, stel je een Slimme Coach voor die de student ziet oefenen voordat hij besluit hoeveel hij moet ingrijpen.

Zo werkt de Coach stap voor stap:

1. De "Probeer-het-eens"-fase (Rollouts)

Voordat de les begint, vraagt de Coach de student om een paar keer te proberen de problemen op eigen kracht op te lossen (dit worden "rollouts" genoemd).

  • Als de student het goed doet: De Coach zegt: "Goed gedaan! Je begrijpt dit duidelijk. Ik hoef je niet te dwingen om mijn oplossing te kopiëren. Laten we naar jouw eigen juiste antwoord kijken."
  • Als de student faalt: De Coach zegt: "Oké, je hebt moeite met deze. Ik moet even ingrijpen en je de oplossing van de meester laten zien om je te begeleiden."

Dit is het Adaptieve deel. De mate van "begeleiding door de leraar" verandert op basis van hoe goed de student op dit moment presteert.

2. Het "Veiligheidsnet" (Inverse Ratio)

Er is een risico dat als de Coach te behulpzaam is, de student volledig zijn eigen unieke manier van denken kan vergeten en slechts een robot wordt die alleen de weg van de leraar kent.

Om dit te voorkomen, gebruikt RASFT een Veiligheidsnet. Het controleert constant: "Wijkt de student te ver af van zijn oorspronkelijke, natuurlijke manier van denken?"

  • Als de student zijn stijl te drastisch verandert om bij de leraar te passen, trekt het Veiligheidsnet hem voorzichtig terug.
  • Dit zorgt ervoor dat de student zijn eigen "redeneerpersoonlijkheid" behoudt terwijl hij nieuwe trucjes leert, in plaats van simpelweg zijn brein te overschrijven met de data van de leraar.

Waarom het beter werkt

Het paper heeft deze "Slimme Coach" getest tegenover de oude "Rigide Leraar" en andere methoden op wiskunde- en coderingstests.

  • Het resultaat: De studenten die getraind zijn met RASFT werden veel beter in het oplossen van problemen. Ze kopieerden niet alleen; ze leerden om de wijsheid van de leraar te combineren met hun eigen groeiende vaardigheden.
  • De analogie: Stel je een muzikant voor die een liedje leert.
    • Oude SFT: De student wordt gedwongen om de bladmuziek exact te spelen zoals geschreven, zelfs als hij een jazzmuzikant is. Hij verliest zijn improvisatievaardigheden.
    • RASFT: De leraar luistert naar de student die improviseert. Als de student goed speelt, laat de leraar hem zijn jazzstijl behouden. Als de student een valse noot speelt, laat de leraar hem de bladmuziek zien om de specifieke fout te corrigeren. De student eindigt als een betere, veelzijdiger muzikant.

De Addertjes onder het gras (Beperkingen)

Het paper geeft toe dat deze methode niet gratis is.

  • Het kost meer tijd: De "Coach" moet de student zien oefenen (rollouts genereren) en controleren of hij het goed heeft voordat er onderwezen wordt. Dit is langzamer dan simpelweg het antwoordmodel uitdelen.
  • Het heeft een duidelijke antwoordsleutel nodig: Dit werkt geweldig voor wiskunde (waar het antwoord een specifiek getal is) en coderen (waar de code ofwel werkt, ofwel niet werkt). Het is moeilijker te gebruiken voor open vragen zoals "Schrijf een gedicht", omdat er geen gemakkelijke manier is om automatisch te verifiëren of een gedicht "correct" is.

Samenvatting

RASFT is een slimmere manier om AI te trainen. In plaats van de AI blindelings te dwingen om een enkele expert te kopiëren, controleert het de huidige capaciteiten van de AI. Als de AI worstelt, leunt het zwaar op de expert. Als de AI goed presteert, laat het de AI op zijn eigen redeneren vertrouwen. Dit creëert een model dat zowel deskundig als flexibel is.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →