← Nieuwste papers
💬 NLP

LP-SFT: Local-Preserving Supervised Fine-Tuning via Multimodal Entropy Structure

Dit artikel stelt LP-SFT voor, een methode voor supervised fine-tuning die de inherente multimodale entropiestructuur van het voorgetrainde model tussen niet-doeltokens behoudt via een lokaal genormaliseerde KL-divergentie, waardoor de prestaties bij downstream-taken worden verbeteren terwijl de degradatie van bestaande capaciteiten en de diversiteit van de bemonstering wordt beperkt.

Oorspronkelijke auteurs: Yueyang Wang, Baolong Bi, Shuo Lu, Jingyuan Zhang, Jiajun Shi

Gepubliceerd 2026-07-22
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Yueyang Wang, Baolong Bi, Shuo Lu, Jingyuan Zhang, Jiajun Shi

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een briljante, hoogopgeleide robot leert om instructies op te volgen. Deze robot heeft al bijna het hele internet gelezen en daarmee het ritme van taal, de logica van wiskunde en de structuur van code geleerd. Deze initiële leerfase wordt "pretraining" genoemd. Nu wil je de robot een specifieke taak leren, zoals het oplossen van wiskundige problemen of het schrijven van computercode. Je laat het hem voorbeelden zien van de juiste antwoorden, en de robot past zijn brein aan om overeen te komen met die voorbeelden. Dit proces wordt "Supervised Fine-Tuning" (SFT) genoemd.

Er zit echter een addertje onder het gras. Wanneer de robot leert om perfect te worden in de nieuwe taak, vergeet hij soms hoe hij een goede algemene gesprekspartner moet zijn. Hij wordt zo geobsedeerd door het enkele "juiste" antwoord dat hij vergeet dat er nog veel andere interessante, geldige manieren zijn om een zin te laten eindigen. Het is alsof een student één specifiek antwoord op een wiskundevraag zo goed uit het hoofd leert dat hij een iets andere versie van die vraag niet meer kan oplossen, of een schrijver die slechts één manier kent om een verhaal te beginnen. De grote vraag in dit vakgebied is: Hoe leren we de robot de nieuwe taak zonder dat hij zijn oude, rijke kennis vergeet?

Dit is precies waar het artikel "LP-SFT" zich mee bezighoudt. De auteurs, een team van onderzoekers van topuniversiteiten, merkten op dat de standaardmanier waarop deze robots worden onderwezen (genaamd "cross-entropy") een beetje te lomp is. Het vertelt de robot: "Kijk alleen naar dit ene woord dat ik je laat zien; negeer de rest." Het probleem is dat het oorspronkelijke brein van de robot eigenlijk een kaart bevat van vele mog{elijke} "goede" volgende woorden, niet slechts één. Door de robot te dwingen zich alleen op het enkele doelwoord te concentreren, wissen we per ongeluk de kaart van alle andere mogelijkheden uit, wat leidt tot een verlies aan creativiteit en een fenomeen dat bekend staat als "catastrophic forgetting", waarbij de robot vaardigheden vergeet die hij eerder bezat.

De onderzoekers ontdekten iets fascinerends over hoe deze robots denken. Ze ontdekten dat het brein van de robot niet zomaar één woord kiest; het zweeft vaak tussen een paar even goede opties, wat een "multimodale entropiestructuur" creëert. Denk aan een splitsing in de weg. Soms ziet de robot twee of drie paden die allemaal even geldig zijn. De standaard trainingsmethode dwingt de robot om slechts één pad te kiezen en de andere paden te verbranden, zelfs als die andere paden volkomen redelijk waren.

Om dit op te lossen, stelde het team een nieuwe methode voor genaamd LP-SFT (Local-Preserving Supervised Fine-Tuning). In plaats van alleen maar te schreeuwen "Kies dit woord!" tegen de robot, zegt LP-SFT: "Kies dit woord, maar vergeet alsjeblieft de andere drie of vier woorden die ook best goed waren niet."

Zo werkt het, met behulp van een eenvoudige analogie: Stel je voor dat je een hond traint om een specifieke bal te halen. De standaardmethode is om de hond alleen te belonen wanneer hij precies die bal terugbrengt en de rest te negeren. Uiteindelijk zal de hond misschien stoppen met het zoeken naar andere speeltjes. LP-SFT is als zeggen: "Breng me de rode bal (het doel), maar terwijl je bezig bent, onthoud dan dat de blauwe bal en de groene bal ook leuk waren om te halen." De methode creëert een kleine "veilige zone" van de top 10 meest waarschijnlijke woorden die de robot had kunnen kiezen. Het verwijdert het ene woord dat je aan de robot leert (zodat hij niet in de war raakt) en duwt de robot vervolgens voorzichtig om de relatieve populariteit van de resterende negen woorden hetzelfde te houden als die voorheen was.

De resultaten van deze aanpak zijn zeer veelbelovend. Wanneer de onderzoekers LP-SFT testten op verschillende modellen (zoals Qwen en Llama) en taken (wiskunde, coderen en algemene chat), kwamen ze tot de conclusie dat het de oude methoden beter doet. De robots die met LP-SFT getraind werden, waren niet alleen goed in de specifieke taak die ze leerden (hoge scores behalen op wiskunde- en coderingstests), maar behielden ook hun vermogen om divers en creatief te zijn. Ze vergaten hun algemene kennis niet zozeer als de anderen. Sterker nog, de methode bereikte de beste balans tussen het krijgen van het juiste enkele antwoord en het behouden van een grote variëteit aan mogelijke oplossingen.

Het artikel suggereert dat door de oorspronkelijke "kaart" van mogelijkheden van de robot te respecteren, we hem nieuwe vaardigheden kunnen aanleren zonder zijn brein te beschadigen. Het is een herinnering aan het feit dat je, om een machine perfect te leren, soms een beetje van zijn onzekerheid moet laten behouden. De onderzoekers laten zien dat deze lokale preservatie helpt om te voorkomen dat de robot instort tot een saaie, eenduidige geest, waardoor hij slim, flexibel en klaar blijft voor wat er ook volgt.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →