← Nieuwste papers
🤖 machine learning

Good SFT Optimizes for SFT, Better SFT Prepares for Reinforcement Learning

Het artikel introduceert PEAR, een methode voor het SFT-fase die gebruikmaakt van importance sampling om trainingsverliezen opnieuw te wegen op basis van het verschil tussen offline data en toekomstige RL-beleid, waardoor de prestaties van downstream versterkt leren op redeneertaken aanzienlijk worden verbeterd in vergelijking met standaard SFT.

Oorspronkelijke auteurs: Dylan Zhang, Yufeng Xu, Haojin Wang, Qingzhi Chen, Hao Peng

Gepubliceerd 2026-05-29
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Dylan Zhang, Yufeng Xu, Haojin Wang, Qingzhi Chen, Hao Peng

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Het Grote Idee: Een Student Trainen voor het Foute Toets

Stel je voor dat je een briljante student (een AI) traint om complexe logische puzzels op te lossen. Het trainingsproces vindt plaats in twee distincte fasen:

  1. Fase 1 (SFT - Supervised Fine-Tuning): De student zit in een klaslokaal en bestudeert een handboek vol met opgeloste voorbeelden. Ze onthouden de stappen en proberen de antwoorden van de leraar perfect na te bootsen.
  2. Fase 2 (RL - Reinforcement Learning): De student wordt de echte wereld ingestuurd om nieuwe puzzels op te lossen, alleen. Ze krijgen directe feedback: "Goed!" of "Fout, probeer opnieuw." Ze leren door te experimenteren en hun strategie aan te passen op basis van wat op dat moment echt werkt.

Het Probleem:
Meestal proberen onderzoekers de student perfect te maken in Fase 1. Ze passen de lessen in het handboek aan zodat de student de hoogst mogelijke score haalt op de oefentoets. Ze gaan uit van het volgende: "Als de student een genie is in het kopiëren van het handboek, zal het ook een genie zijn in het oplossen van nieuwe problemen later."

De Ontdekking van het Paper:
De auteurs ontdekten dat deze aanname vaak fout is.
Soms presteert een student die een perfecte score haalt op het handboek (het "Sterke SFT"-model) in de echte wereld slechter dan een student die een iets lagere score haalde op het handboek.

Waarom? Omdat het handboek (Fase 1) en de echte wereld (Fase 2) verschillend zijn.

  • Het Handboek (Behavior Policy): De voorbeelden in het boek zijn geschreven door een specifieke leraar. Soms koos die leraar een rare, omwegachtige route naar het antwoord, of maakte een kleine fout die de student overnam.
  • De Echte Wereld (Target Policy): In Fase 2 moet de student zijn eigen route genereren. Als ze te star hebben geleerd om de rare route van de leraar te volgen, komen ze vast te zitten wanneer ze zelf moeten denken.

De Analogie:
Stel je een dansinstructeur voor die een student traint.

  • Standaard Training: De instructeur toont een beweging. De student oefent deze totdat hij de exacte voetbewegingen van de instructeur perfect kan nabootsen.
  • Het Probleem: De voetbewegingen van de instructeur kunnen gebaseerd zijn op zijn eigen unieke lichaamstype of een specifieke stijl die niet werkt voor het lichaam van de student. Als de student de stappen van de instructeur te perfect uit het hoofd leert, kan hij struikelen wanneer hij probeert te dansen op een ander nummer of met een andere partner.
  • Het Resultaat: De student die de stappen perfect uit het hoofd leerde (Hoge SFT-score) valt in de wedstrijd. De student die het ritme begreep en de stappen aanpaste (Lagere SFT-score, maar betere voorbereiding) wint.

De Oplossing: PEAR (De "Toekomstbestendige" Leraar)

De auteurs stellen een nieuwe methode voor genaamd PEAR (Policy Evaluation–inspired Algorithm for Offline Learning Loss Reweighting).

In plaats van de student alleen te zeggen: "Kopieer dit antwoord perfect", treedt PEAR op als een slimme coach die vooruitkijkt.

Hoe PEAR Werkt:

  1. De Coach Checkt de Toekomst: Voordat de student een specifieke stap uit het handboek oefent, vraagt de coach: "Als de student deze stap neemt, zal dat dan zinvol zijn voor de rest van de dans?"
  2. Herverdeling van de Lessen:
    • Als een stap in het handboek leidt tot een doodlopende weg (een route die de student in de echte wereld waarschijnlijk niet zal nemen), zegt de coach: "Maak je niet te veel zorgen over dit deel." (Ze verlagen het belang van die les).
    • Als een stap in het handboek leidt tot een succesvol resultaat dat de student later waarschijnlijk zal gebruiken, zegt de coach: "Focus hier hard op!" (Ze verhogen het belang).

De Metafoor:
Stel je het handboek voor als een kaart getekend door een toerist die verdwaald raakte.

  • Standaard SFT dwingt de student om de verkeerde bochten van de toerist uit het hoofd te leren.
  • PEAR kijkt naar de kaart en zegt: "Dit deel van het pad van de toerist loopt af in een afgrond. Laten we dat deel van de les negeren. Maar dit deel leidt naar de schat? Laten we dat deel twee keer bestuderen."

De Resultaten

De auteurs testten dit op wiskundeproblemen en logische spellen met verschillende AI-modellen.

  • De Uitkomst: Modellen getraind met PEAR kregen niet noodzakelijkerwijs de hoogste scores op de initiële oefentoets. Echter, toen ze naar de "Echte Wereld" (Reinforcement Learning) stapten, verbeterden ze veel sneller en eindigden ze met veel hogere eindscores.
  • De Winst: Bij sommige moeilijke wiskundewedstrijden verbeterden de met PEAR getrainde modellen hun succespercentage met wel 30 procentpunten in vergelijking met modellen die met standaardmethoden waren getraind.

De Kernboodschap

"Good SFT Optimizes for SFT, Better SFT Prepares for Reinforcement Learning."

Train je AI niet alleen om het beste te zijn in het kopiëren van het verleden. Train hem om klaar te zijn voor de toekomst. Het doel van de eerste fase is niet om een perfecte score te halen op het huiswerk; het is om een fundament te bouwen dat de volgende leerfase (de echte uitdaging) makkelijker en effectiever maakt. PEAR is het hulpmiddel dat de AI helpt de "slechte gewoonten" van het verleden te negeren, zodat het de "goede gewoonten" van de toekomst kan leren.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →