← Nieuwste papers
💻 computer science

SHIFT-LLM: Distribution Shift Correction in Depth-Pruned LLMs

SHIFT-LLM is een trainingsvrij post-pruning framework dat de nauwkeurigheid herstelt in op diepte geprunede grote taalmodellen door lichtgewicht Lineaire Residuele Adapters in te voegen, gekalibreerd via closed-form regressie om de distributionele verschuivingen te corrigeren die worden veroorzaakt door het verwijderen van Transformer-blokken.

Oorspronkelijke auteurs: Ali Bahri, Hang Li, Hongliang Li, Zhitang Chen

Gepubliceerd 2026-08-27
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Ali Bahri, Hang Li, Hongliang Li, Zhitang Chen

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Grote taalmodellen zijn de motoren achter veel van de meest geavanceerde kunstmatige intelligentie-instrumenten van vandaag, in staat om verhalen te schrijven, problemen op te lossen en complexe vragen te beantwoorden. Deze systemen zijn gebouwd uit lagen digitale verwerkingseenheden die op elkaar zijn gestapeld, vergelijkbaar met een meerverdiepinggebouw waarbij elke verdieping de informatie die van de verdieping eronder wordt doorgegeven, verfijnt. Hoe meer verdiepingen een gebouw heeft, hoe gedetailleerder en geavanceerder de uiteindelijke output kan zijn, maar dit maakt de structuur ook ongelooflijk zwaar en duur in gebruik. Voor veel praktische toepassingen, vooral op apparaten met beperkte stroom of geheugen, zijn deze enorme modellen simpelweg te groot om te gebruiken. Om ze kleiner te maken, hebben onderzoekers methoden ontwikkeld om hele verdiepingen uit het gebouw te verwijderen, een proces dat bekend staat als diepte-pruning (depth pruning). Hoewel dit de belasting verlicht en de snelheid van het model verhoogt, zorgt het er vaak voor dat de resterende verdiepingen struikelen. Omdat de verwijderde verdiepingen ontworpen waren om specifieke soorten informatie naar de verdiepingen erboven door te geven, zorgt het weghalen ervan ervoor dat de bovenliggende lagen in de war raken; ze ontvangen signalen die niet langer overeenkomen met wat ze getraind zijn te verwachten. Deze mismatch, bekend als een distributieverschuiving (distribution shift), zorgt ervoor dat het model aan nauwkeurigheid verliest en fouten maakt, waardoor ontwikkelaars aanzienlijke tijd en rekenkracht moeten besteden aan het hertrainen van het model om de fouten te herstellen.

Een team van onderzoekers bij Huawei Noah's Ark Lab heeft een nieuwe aanpak geïntroduceerd genaamd SHIFT-LLM die dit probleem oplost zonder de noodzaak van hertraining. In plaats van te proberen de ontbrekende verdiepingen te herbouwen of de overgebleven verdiepingen opnieuw te onderwijzen, voegt hun methode een kleine, lichtgewicht correctiemodule toe op elke plek waar een laag is verwijderd. Stel je voor dat als je een verdieping uit een gebouw zou verwijderen, je een eenvoudige, op maat gemaakte helling zou installeren die de kloof perfect overbrugt, zodat de mensen op de bovenliggende verdiepingen nog steeds exact dezelfde instructies ontvangen als wanneer de ontbrekende verdieping er nog zou zijn. In de digitale wereld is deze helling een lineaire adapter die het directe pad van de informatie behoudt terwijl het een kleine, berekende aanpassing toevoegt. Deze aanpassing is ontworpen om de specifieke bijdrage na te bootsen die de verwijderde laag zou hebben geleverd, waardoor het de rest van het model effectief voor de gek houdt door te laten geloven dat de ontbrekende verdieping nog steeds aanwezig is.

De genialiteit van deze methode ligt in de manier waarop die aanpassing wordt berekend. In plaats van duizenden uren aan training te draaien om te achterhalen wat de ontbrekende laag had moeten doen, gebruiken de onderzoekers een kleine set steekproefgegevens om precies te meten welke informatie verloren is gegaan. Vervolgens gebruiken ze een eenvoudige wiskundige berekening om de exacte correctie te bepalen die nodig is om die verloren informatie te herstellen. Dit proces is volledig automatisch en vereist geen gradiënt-gebaseerde optimalisatie, wat het complexe, iteratieve leerproces is dat gewoonlijk nodig is om defecte modellen te repareren. Door deze closed-form berekening te gebruiken, kan het team de interne staat van het model in enkele minuten corrigeren met slechts een paar honderd voorbeelden, in plaats van dagen aan rekentijd. Het resultaat is een gepruned model dat de snelheid en efficiëntie behoudt van minder lagen, maar presteert met een nauwkeurigheid die bijna identiek is aan het oorspronkelijke, enorme model.

In hun experimenten testten de onderzoekers deze techniek op vijf verschillende families van grote taalmodellen, variërend van kleinere modellen met 1,5 miljard parameters tot grotere versies van 14 miljard parameters. Ze pasten zes verschillende methoden toe om te beslissen welke lagen verwijderd moesten worden en evalueerden de resultaten op zeven verschillende benchmarks die ontworpen zijn om algemene kennis en redeneren te testen. De bevindingen waren consistent: de correctiemodules slaagden erin de nauwkeurigheid die tijdens het prunen verloren ging te herstellen in bijna elke configuratie. In één opmerkelijk geval met een model van 8 miljard parameters, herstelde de methode een verbazingwekkende 15,7 punten aan nauwkeurigheid op een standaard benchmark, een winst die normaal gesproken uitgebreide en dure hertraining zou vereisen. Zelfs toen de modellen na het prunen al werden bijgesteld (fine-tuning), zorgde het toevoegen van deze correctiemodule voor een extra boost, wat suggereert dat de twee benaderingen goed samenwerken om de prestaties nog verder te verhogen.

De onderzoekers hebben ook aangetoond dat deze correctiemodules verder kunnen worden gecomprimeerd om ruimte te besparen en kunnen worden samengevoegd wanneer meerdere lagen achter elkaar worden verwijderd, zodat de efficiëntiewinst van het prunen niet verloren gaat aan de overhead van de oplossing zelf. Dit werk suggereert dat de primaire hindernis om grote taalmodellen kleiner te maken niet alleen het verwijderen van onderdelen is, maar de verstoring van de informatiestroom tussen hen. Door zich te richten op het repareren van die stroom met eenvoudige, gerichte aanpassingen, biedt SHIFT-LLM een algemene en efficiënte manier om krachtige AI-modellen praktisch bruikbaar te maken voor dagelijks gebruik. De studie bevestigt dat we met de juiste correctie de zware, redundante delen van deze digitale breinen kunnen wegsnijden zonder hun vermogen om helder na te denken te verliezen, wat de deur opent naar snellere, goedkopere en meer toegankelijke kunstmatige intelligentie.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →