← Nieuwste papers
🤖 machine learning

Why Does RL Generalize Better Than SFT? A Data-Centric Perspective on VLM Post-Training

Dit paper stelt dat Reinforcement Learning (RL) beter generaliseert dan Supervised Fine-Tuning (SFT) omdat het impliciet data filtert op moeilijkheidsgraad, en introduceert daarom *Difficulty-Curated SFT* (DC-SFT), een efficiëntere methode die door het selecteren van middelmatige voorbeelden superieure prestaties behaalt.

Oorspronkelijke auteurs: Aojun Lu, Tao Feng, Hangjie Yuan, Wei Li, Yanan Sun

Gepubliceerd 2026-02-12
📖 3 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Aojun Lu, Tao Feng, Hangjie Yuan, Wei Li, Yanan Sun

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

De Metafoor: De Student en de Examenstress

Stel je voor dat je een student bent die zich voorbereidt op een groot examen. Er zijn twee manieren om te studeren:

  1. De "SFT-methode" (De Overwerkte Student): Je krijgt een enorme stapel oefenvragen. Je probeert elke vraag op te lossen, ook de vragen die zo absurd moeilijk zijn dat zelfs de professor ze nauwelijks begrijpt. Omdat je zo hard je best doet om die onmogelijke vragen goed te krijgen, raak je in de war. Je gaat patronen zien die er niet zijn en je leert de stof uit je hoofd in plaats van het echt te begrijpen. Als het echte examen dan een beetje anders is ingestoken, raak je volledig in paniek.
  2. De "RL-methode" (De Slimme Strategist): Deze student is slimmer. Hij kijkt naar de vragen en zegt: "Als ik deze makkelijke vragen al weet, en die supermoeilijke vragen toch nooit ga snappen, dan focus ik mijn energie op de vragen die net een beetje uitdagend zijn." Hij leert van zijn fouten bij de gemiddelde vragen. Hierdoor begrijpt hij de logica van het vak echt, en kan hij ook met nieuwe, onverwachte vragen op het examen omgaan.

Wat zegt dit onderzoek nu echt?

Wetenschappers hebben ontdekt dat grote AI-modellen (die zowel plaatjes als tekst begrijpen, de zogenaamde VLMs) precies dit gedrag vertonen.

Het probleem met de huidige methode (SFT):
Normaal gesproken trainen we AI door hem simpelweg alle beschikbare data te voeren. Het probleem is dat er in die data altijd "extreem moeilijke" voorbeelden zitten. Deze voorbeelden zijn als een soort 'ruis' of 'verwarrende puzzels'. De AI probeert deze te hard te begrijpen, waardoor hij gaat "overfitten": hij leert de specifieke voorbeelden uit zijn hoofd, maar verliest het overzicht. Hierdoor presteert hij slecht zodra hij iets ziet dat net even anders is (dit noemen we Out-of-Distribution of OOD).

De ontdekking over Reinforcement Learning (RL):
Men dacht altijd dat de "slimme" manier van trainen (RL) beter was vanwege de ingewikkelde wiskunde erachter. Maar dit onderzoek zegt: "Nee, het is eigenlijk een slimme filter!" RL negeert de te makkelijke vragen (want die weet hij al) en de te moeilijke vragen (want daar leert hij niets van). RL focust zich automatisch op de "gouden middenweg": de vragen die precies moeilijk genoeg zijn om iets nieuws te leren.

De oplossing van de auteurs: DC-SFT
De onderzoekers hebben een nieuwe, veel simpelere methode bedacht: DC-SFT. In plaats van ingewikkelde wiskundige trucjes te gebruiken, doen ze gewoon aan "data-dieet".

Voordat de training begint, kijken ze naar de data en gooien ze de extreem moeilijke, verwarrende vragen er simpelweg uit. Ze houden alleen de makkelijke en de gemiddelde vragen over.

Het resultaat?

  • Beter: De AI begrijpt de wereld beter en kan beter omgaan met nieuwe situaties dan de "slimme" RL-methode.
  • Sneller: Het kost veel minder rekenkracht (geen eindeloos gepuzzel van de AI).
  • Stabieler: De training verloopt rustig en voorspelbaar, zonder dat de AI plotseling "in de war" raakt tijdens het leren.

Samenvatting in één zin:

In plaats van een AI te dwingen om alles te leren (inclusief de onmogelijke onzin), is het veel slimmer om de AI alleen te laten oefenen met vragen die hij écht kan begrijpen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →