← Nieuwste papers
🤖 machine learning

Ghosted Layers: Unconstrained Activation Alignment for Recovering Layer-Pruned LLMs

Het artikel stelt "Ghosted Layers" voor, een trainingsvrije methode die de prestaties van gepruneerde grote taalmodellen herstelt door een gesloten-vorm optimale lineaire operator af te leiden om activatiedistributies tussen overlevende lagen af te stemmen, waardoor bestaande beperkte baselines worden overtroffen terwijl de winst in efficiëntie behouden blijft.

Oorspronkelijke auteurs: Vincent-Daniel Yun, Junhyuk Jo, Sai Praneeth Karimireddy, Sunwoo Lee

Gepubliceerd 2026-05-18
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Vincent-Daniel Yun, Junhyuk Jo, Sai Praneeth Karimireddy, Sunwoo Lee

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een zeer getalenteerde, hoogopgeleide chef-kok hebt (een Groot Taalmodel) die jarenlang heeft geleerd om complexe gerechten te bereiden. Deze chef werkt in een enorme keuken met 32 verschillende stations, die elk een specifieke smaak of textuur aan het gerecht toevoegen.

Het Probleem: Het Weglaten van het Midden
Om de keuken sneller en goedkoper te laten draaien, besluit iemand een groot blok stations in het midden te verwijderen – zeg maar 7 of 11 stations tegelijk. Dit heet "layer pruning" (lagen snoeien).

Het probleem is dat de stations voor de snede en de stations na de snede zijn getraind om met elkaar te communiceren via die ontbrekende stations. Als je het midden verwijdert, ontvangt het station direct na de snede een ingrediënt dat er totaal anders uitziet dan wat het verwacht. Het is alsof een bakker een perfect gekneed deeg verwacht, maar in plaats daarvan een rauw, klontig puinhoop krijgt. De bakker (de volgende laag) raakt in de war, het recept valt uit elkaar en het eindgerecht (het antwoord van de AI) smaakt vreselijk.

De Oude Oplossingen: Proberen het Gat te Dichtmaken
Eerdere pogingen om dit op te lossen waren als proberen een vierkante pen in een rond gat te forceren.

  • Sommige methoden probeerden gewoon de bestaande ingrediënten "uit te rekken" om ze iets meer te laten lijken op wat er verwacht werd, maar ze waren te stijf.
  • Anderen probeerden een zeer specifiek, symmetrisch gereedschap te gebruiken om het mismatch op te lossen. Het artikel stelt dat dit is als proberen een scheef hangend fotolijstje te repareren met alleen een liniaal die alleen omhoog en omlaag kan bewegen, niet zijwaarts. Het is een beperkt gereedschap dat de perfecte oplossing niet kan bereiken.

De Nieuwe Oplossing: "Ghosted Layers" (Geestlagen)
De auteurs stellen een nieuwe methode voor genaamd Ghosted Layers. Denk hierbij aan een "geestchef" of een magische brug die precies verschijnt waar de ontbrekende stations vroeger waren.

Zo werkt het in eenvoudige bewoordingen:

  1. De Kalibratie (De Proeverij): Voordat de keuken permanent wordt veranderd, neemt het team een kleine steekproef van ingrediënten (een paar zinnen tekst) en voert ze door de originele volledige keuken. Ze registreren precies hoe het ingrediënt eruitzag voordat het de ontbrekende stations binnenkwam en precies hoe het eruitzag nadat het ze had verlaten.
  2. De Wiskundige Magie: Ze berekenen het exacte verschil tussen de "voor" en "na" toestanden. In plaats van te gokken of een beperkt gereedschap te gebruiken, gebruiken ze een wiskundige formule om de perfecte, onbeperkte transformatie te vinden die nodig is om de "voor"-toestand om te zetten in de "na"-toestand.
    • Analogie: Als de ontbrekende stations een rode appel in een groene appel veranderden, zou een beperkt gereedschap de appel misschien slechts iets groener kunnen verven. De "Ghosted Layer" berekent de exacte chemische verandering die nodig is om die rode appel perfect in een groene appel te veranderen, ongeacht hoe complex de verandering is.
  3. Het Resultaat: Ze voegen deze perfecte "Ghosted Layer" in de gesnoeide keuken in. Nu, wanneer het ingrediënt stroomt van het station voor de snede naar het station na de snede, passeert het deze geest, wordt het direct omgezet in precies wat het volgende station verwacht, en gaat het koken soepel door.

Waarom Het Beter Is
Het artikel beweert dat eerdere methoden waren als proberen een puzzel op te lossen met slechts de helft van de stukjes of met een gereedschap dat te simpel was. De "Ghosted Layer" lost de puzzel op met de volledige set stukjes en het meest flexibele gereedschap dat mogelijk is.

  • Geen Opnieuw Trainen: Je hoeft de chef niet opnieuw te leren koken. Je installeert gewoon deze nieuwe "geestbrug" en de keuken werkt weer.
  • Zelfde Snelheid: Hoewel de wiskunde om de geest te ontwerpen complex is, vertraagt het de keuken niet zodra het is gebouwd. Het draait even snel als de oude, beperkte oplossingen.
  • Betere Smaak: In tests leverde deze methode veel betere resultaten op (hogere nauwkeurigheid en minder verwarring) dan eerdere methoden, vooral wanneer een groot blok van de keuken werd verwijderd.

Samenvattend
Wanneer je delen van een slimme AI verwijdert, raken de resterende delen in de war omdat de stroom van informatie wordt onderbroken. "Ghosted Layers" fungeert als een perfecte, onzichtbare vertaler die de onderbroken stroom direct repareert, waardoor de AI blijft werken op volle snelheid zonder opnieuw getraind te hoeven worden.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →