← Nieuwste papers
🤖 machine learning

SFT-then-RL Outperforms Mixed-Policy Methods for LLM Reasoning

Dit onderzoek toont aan dat de standaard "SFT-then-RL"-methode superieur is aan recente gemengde methoden voor LLM-redeneren, omdat eerdere studies gebaseerd waren op foutieve resultaten door softwarebugs in optimalisatie- en verliesberekeningen.

Oorspronkelijke auteurs: Alexis Limozin, Eduard Durech, Torsten Hoefler, Imanol Schlag, Valentina Pyatkin

Gepubliceerd 2026-04-28
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Alexis Limozin, Eduard Durech, Torsten Hoefler, Imanol Schlag, Valentina Pyatkin

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een nieuwe chef-kok wilt opleiden om de moeilijkste wiskundige gerechten ter wereld te maken. In de wereld van AI (kunstmatige intelligentie) zijn er momenteel twee manieren om dit te doen:

  1. De Klassieke Methode (SFT-then-RL): Eerst geef je de kok een perfect kookboek met alle recepten (Supervised Fine-Tuning). Daarna laat je hem zelf experimenteren in de keuken, waarbij hij alleen feedback krijgt of het gerecht lekker is of niet (Reinforcement Learning).
  2. De "Moderne" Mix-Methode: Je probeert de kok tegelijkertijd het kookboek te laten lezen terwijl hij al aan het experimenteren is. Het idee is dat hij sneller leert door de theorie en de praktijk te mengen.

De laatste tijd beweerden veel slimme onderzoekers dat die Mix-Methode veel beter werkte dan de klassieke methode. Maar dit nieuwe onderzoek zegt: "Ho even, dat klopt niet! De klassieke methode is eigenlijk veel beter, maar we dachten dat hij slecht was omdat de meetlat kapot was."

Hier is de uitleg van wat er echt aan de hand is, in begrijpelijke taal:

1. De "Kapotte Meetlat" (De Bugs)

De onderzoekers ontdekten dat de wetenschappers die beweerden dat de Mix-Methode beter was, eigenlijk een fout maakten in hun basis-training. Het was alsof je een atleet probeert te trainen, maar je geeft hem per ongeluk een gewicht dat elke vijf minuten een stukje lichter wordt zonder dat je het doorhebt.

Er waren twee grote "bugs" (foutjes in de software):

  • De "Vergeten Hapjes" Bug: Tijdens het oefenen met het kookboek (SFT) werden er door een fout in de software stukjes informatie simpelweg overgeslagen. De AI leerde dus een incompleet recept. Het was alsof je een kok leert hoe je een taart bakt, maar de software vergeet halverwege de instructie voor de suiker te geven.
  • De "Gemiddelde van Gemiddelden" Bug: De AI kreeg verkeerde feedback over hoe goed hij het deed. In plaats van te kijken naar het hele gerecht, keek de software naar kleine hapjes en rekende de score verkeerd uit. Het was alsof een proever zegt: "Dit hapje is een 10, dat hapje is een 0, dus het gemiddelde is een 5," terwijl het hele gerecht eigenlijk een ramp was.

Omdat deze foutjes in de "klassieke methode" zaten, leek die methode opeens heel zwak. De Mix-Methode leek daardoor de winnaar, maar dat was een vals gevoel.

2. De Ontdekking: De Klassieke Methode is de Kampioen

Toen de onderzoekers de foutjes in de software repareerden, gebeurde er iets opmerkelijks: de klassieke methode (eerst het boek, dan de praktijk) schoot opeens met een raket omhoog!

De klassieke methode presteerde niet alleen beter dan de Mix-Methode, maar hij was ook veel efficiënter.

De metafoor:
De Mix-Methode is als een student die probeert te leren door tegelijkertijd een tekst te lezen en een examen te maken. Dat is verwarrend en kost enorm veel energie (rekenkracht).
De klassieke methode is als een student die eerst rustig de stof leert en daarna pas het examen oefent. Die student begrijpt de basis veel beter en heeft veel minder tijd nodig om een topcijfer te halen.

3. Waarom is dit belangrijk?

Dit onderzoek is een belangrijke waarschuwing voor de hele AI-wereld. Het laat zien dat:

  1. Details ertoe doen: Zelfs de meest geavanceerde AI-modellen kunnen falen als de software die ze traint een klein foutje bevat.
  2. Soms is "simpel" beter: We proberen vaak heel ingewikkelde nieuwe methodes uit (zoals de Mix-Methode), maar soms is de oude, bewezen manier (eerst leren, dan oefenen) simpelweg superieur.

Kortom: De onderzoekers hebben de "meetlat" weer rechtgezet en laten zien dat de traditionele manier van AI trainen eigenlijk de absolute kampioen is in het oplossen van moeilijke problemen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →