← Neueste Arbeiten
🤖 machine learning

Ghosted Layers: Unconstrained Activation Alignment for Recovering Layer-Pruned LLMs

Das Papier schlägt „Ghosted Layers" vor, eine trainingsfreie Methode, die die Leistung von layer-geprunten großen Sprachmodellen wiederherstellt, indem ein geschlossener optimaler linearer Operator abgeleitet wird, um Aktivierungsverteilungen zwischen verbleibenden Schichten auszurichten, wodurch bestehende eingeschränkte Basismodelle übertroffen werden, während Effizienzgewinne erhalten bleiben.

Ursprüngliche Autoren: Vincent-Daniel Yun, Junhyuk Jo, Sai Praneeth Karimireddy, Sunwoo Lee

Veröffentlicht 2026-05-18
📖 4 Min. Lesezeit☕ Kaffeepausen-Lektüre

Ursprüngliche Autoren: Vincent-Daniel Yun, Junhyuk Jo, Sai Praneeth Karimireddy, Sunwoo Lee

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie haben einen sehr talentierten, hochqualifizierten Koch (ein Large Language Model), der jahrelang gelernt hat, komplexe Gerichte zuzubereiten. Dieser Koch arbeitet in einer riesigen Küche mit 32 verschiedenen Stationen, die jeweils einen spezifischen Geschmack oder eine bestimmte Textur zum Gericht hinzufügen.

Das Problem: Das Entfernen der Mitte
Um die Küche schneller und kostengünstiger zu betreiben, entscheidet sich jemand, einen ganzen Block von Stationen in der Mitte zu entfernen – sagen wir, 7 oder 11 Stationen auf einmal. Dies wird als „Layer-Pruning" (Schichtenbeschneidung) bezeichnet.

Das Problem besteht darin, dass die Stationen vor dem Schnitt und die Stationen nach dem Schnitt darauf trainiert waren, über diese fehlenden Stationen miteinander zu kommunizieren. Wenn Sie die Mitte entfernen, erhält die Station unmittelbar nach dem Schnitt eine Zutat, die überhaupt nicht dem entspricht, was sie erwartet. Es ist, als würde ein Bäcker perfekt gekneteten Teig erwarten, stattdessen aber eine rohe, klumpige Masse erhält. Der Bäcker (die nächste Schicht) gerät in Verwirrung, das Rezept fällt auseinander, und das Endgericht (die Antwort der KI) schrecklich.

Die alten Lösungen: Der Versuch, das Loch zu flicken
Frühere Versuche, dies zu beheben, waren wie der Versuch, einen quadratischen Pflock in ein rundes Loch zu zwängen.

  • Einige Methoden versuchten, die vorhandenen Zutaten einfach nur zu „strecken", damit sie ein wenig mehr dem Erwarteten ähnelten, doch sie waren zu starr.
  • Andere versuchten, ein sehr spezifisches, symmetrisches Werkzeug zu verwenden, um die Diskrepanz zu beheben. Das Papier argumentiert, dies sei wie der Versuch, einen schiefen Bilderrahmen nur mit einem Lineal zu reparieren, das sich nur auf und ab, nicht aber seitwärts bewegen lässt. Es ist ein eingeschränktes Werkzeug, das die perfekte Lösung nicht erreichen kann.

Die neue Lösung: „Ghosted Layers" (Geisterschichten)
Die Autoren schlagen eine neue Methode namens Ghosted Layers vor. Stellen Sie sich dies als einen „Geisterkoch" oder eine magische Brücke vor, die genau dort erscheint, wo die fehlenden Stationen früher waren.

So funktioniert es in einfachen Worten:

  1. Die Kalibrierung (Der Geschmackstest): Bevor die Küche dauerhaft verändert wird, nimmt das Team eine kleine Probe von Zutaten (ein paar Sätze Text) und führt sie durch die ursprüngliche, vollständige Küche. Sie notieren genau, wie die Zutat aussah, bevor sie in die fehlenden Stationen eintrat, und genau, wie sie aussah, nachdem sie diese verlassen hatte.
  2. Die mathematische Magie: Sie berechnen den exakten Unterschied zwischen dem „Vorher"- und dem „Nachher"-Zustand. Anstatt zu raten oder ein eingeschränktes Werkzeug zu verwenden, nutzen sie eine mathematische Formel, um die perfekte, uneingeschränkte Transformation zu finden, die erforderlich ist, um den „Vorher"-Zustand in den „Nachher"-Zustand zu verwandeln.
    • Analogie: Wenn die fehlenden Stationen einen roten Apfel in einen grünen Apfel verwandelten, könnte ein eingeschränktes Werkzeug ihn vielleicht nur leicht grüner anmalen. Die „Ghosted Layer" berechnet jedoch die exakte chemische Veränderung, die nötig ist, um diesen roten Apfel perfekt in einen grünen zu verwandeln, egal wie komplex die Veränderung ist.
  3. Das Ergebnis: Sie fügen diese perfekte „Ghosted Layer" in die beschnittene Küche ein. Jetzt, wenn die Zutat von der Station vor dem Schnitt zur Station nach dem Schnitt fließt, passiert sie diesen Geist, wird sofort in genau das verwandelt, was die nächste Station erwartet, und das Kochen läuft wieder reibungslos weiter.

Warum es besser ist
Das Papier behauptet, dass frühere Methoden wie der Versuch waren, ein Puzzle nur mit der Hälfte der Teile oder mit einem zu einfachen Werkzeug zu lösen. Die „Ghosted Layer" löst das Puzzle mit dem vollständigen Satz an Teilen und dem flexibelsten möglichen Werkzeug.

  • Kein Nachtrainieren: Sie müssen dem Koch nicht beibringen, wie er kocht. Sie installieren einfach diese neue „Geisterbrücke", und die Küche funktioniert wieder.
  • Gleiche Geschwindigkeit: Obwohl die Mathematik zur Konstruktion des Geistes komplex ist, verlangsamt sie die Küche, sobald sie gebaut ist, nicht. Sie läuft genauso schnell wie die alten, eingeschränkten Lösungen.
  • Besserer Geschmack: In Tests erzeugte diese Methode deutlich bessere Ergebnisse (höhere Genauigkeit und geringere Verwirrung) als frühere Methoden, insbesondere wenn ein großer Teil der Küche entfernt wurde.

Zusammenfassung
Wenn Sie Teile einer intelligenten KI herausschneiden, geraten die verbleibenden Teile in Verwirrung, weil der Informationsfluss unterbrochen ist. „Ghosted Layers" fungiert als perfekter, unsichtbarer Übersetzer, der den unterbrochenen Fluss sofort repariert und es der KI ermöglicht, mit voller Geschwindigkeit weiterzuarbeiten, ohne dass sie nachtrainiert werden muss.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →