← Neueste Arbeiten
🤖 machine learning

Generalized Fisher-Weighted SVD: Scalable Kronecker-Factored Fisher Approximation for Compressing Large Language Models

Dieses Paper schlägt die Generalized Fisher-Weighted SVD (GFWSVD) vor, eine skalierbare Post-Training-Kompionsmethode für große Sprachmodelle, die eine Kronecker-faktorisierte Approximation der vollständigen Fisher-Informationsmatrix nutzt, um Parameterkorrelationen zu erfassen und bestehende auf Diagonalen basierende Kompressionstechniken signifikant zu übertreffen.

Ursprüngliche Autoren: Viktoriia Chekalina, Daniil Moskovskiy, Tatiana Matveeva, Andrey Kuznetsov, Evgeny Frolov

Veröffentlicht 2026-07-17
📖 5 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Viktoriia Chekalina, Daniil Moskovskiy, Tatiana Matveeva, Andrey Kuznetsov, Evgeny Frolov

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie versuchen, eine riesige, komplexe Bibliothek so weit zu schrumpfen, dass sie in einen Rucksack passt, ohne die Geschichten darin zu verlieren. Dies ist die tägliche Herausforderung für Wissenschaftler, die im Bereich der künstlichen Intelligenz arbeiten, speziell mit „neuronalen Netzen“ – Computerprogrammen, die wie Gehirne lernen sollen. Diese Programme bestehen aus Millionen winziger Schalter, den sogenannten „Parametern“. Um diese Programme schneller und auf kleineren Geräten laufen zu lassen, versuchen Forscher, die Schalter herauszuschneiden, die nicht viel Arbeit leisten. Aber hier liegt der Haken: Die Schalter arbeiten nicht allein. Sie sind wie eine komplexe Tanzgruppe; wenn man einen Tänzer herauszieht, kann die gesamte Choreografie zusammenbrechen, weil dieser Tänzer mit jemand anderem Händchen hielt.

Jahrelang war die Standardmethode, um zu entscheiden, welche Tänzer ausscheiden sollten, die jeden einzeln zu betrachten, ohne das Händchenhalten zu berücksichtigen. Es war, als würde man prüfen, ob ein Tänzer müde ist, ohne zu bemerken, dass er einen Partner stützt. Diese Methode war schnell, aber sie ruinierte oft die Aufführung. Das Papier, das Sie gleich lesen werden, widmet sich diesem Problem und stellt einen neuen Weg vor, den „Tanz“ der Parameter zu sehen. Es verwendet ein mathematisches Werkzeug namens „Fisher-Informationsmatrix“, das wie eine Karte fungiert, die zeigt, wie jeder Schalter mit jedem anderen verbunden ist. Das Ziel ist es, die Bibliothek (das KI-Modell) zu schrumpfen, während die Geschichten (die Intelligenz) perfekt intakt bleiben.

Die große Idee: Den ganzen Tanz sehen, nicht nur die Tänzer

Die Autoren dieses Papers, Viktoriia Chekalina und ihr Team, erkannten, dass die alten Karten zu verschwommen waren. Sie wollten eine Karte, die nicht nur zeigt, welche Tänzer wichtig sind, sondern auch, wie sie miteinander verknüpft sind. Um dies zu erreichen, erfanden sie einen neuen Algorithmus namens Matrix-free Fisher Factorization (MFF).

Stellen Sie sich die Fisher-Informationsmatrix wie einen riesigen, dichten Nebel vor, der die gesamte Tanzfläche bedeckt. In der Vergangenheit war der Versuch, durch diesen Nebel zu sehen, um die Verbindungen zu finden, unmöglich, weil der Nebel zu dicht und die Tanzfläche zu groß war. Die alten Methoden nahmen einfach an, dass die Verbindungen simpel seien (wie eine gerade Linie), was die komplexen Kurven des echten Tanzes übersah.

Der Trick des Teams, MFF, ist wie das Besitzen einer speziellen Brille, die es ermöglicht, die Struktur des Nebels zu sehen, ohne jemals den gesamten Nebel wegzuräumen. Anstatt zu versuchen, jede einzelne Verbindung aufzuschreiben (was zu viel Speicherplatz beanspruchen würde), berechnet ihr Algorithmus die Verbindungen „on the fly“ und konzentriert sich dabei nur auf die spezifischen „Schichten“ des Tanzes. Es ist ein „matrixfreier“ Ansatz, was bedeutet, dass er die riesige, schwere Karte niemals tatsächlich erstellt; er nutzt lediglich die Form der Karte, um die Schnitte zu leiten.

Die Lösung: Ein neuer Weg, das Modell zu schrumpfen

Unter Verwendung dieser neuen Art, Verbindungen zu sehen, entwickelte das Team eine Methode namens GFWSVD (Generalized Fisher-Weighted SVD). Wenn Sie sich das KI-Modell als einen Klumpen Ton vorstellen, würden Standardmethoden vielleicht einfach nur die Kanten abschneiden. GFWSVD hingegen versteht die interne Maserung des Tons. Es weiß, dass einige Teile des Tons fest miteinander verwoben sind und auf eine bestimmte Weise geschnitten werden müssen, um die Form zu bewahren.

Das Paper beweist, dass unter bestimmten mathematischen Bedingungen (speziell, wenn die Verbindungen einem Muster namens „Matrix-Variate Normalverteilung“ folgen), ihre Methode der einzigartige, optimale Weg ist, um das Modell zu schrumpfen. Es ist nicht bloß eine Vermutung; es ist der mathematisch perfekte Weg, um den Schaden an der Leistung des Modells zu minimieren, wenn man Parameter entfernt.

Was sie herausfanden: Die Hälfte des Modells wegzufeitern

Das Team testete seine neue Methode an einigen der berühmtesten KI-Modelle, darunter Llama 2 und Llama 3.1, die massiven Sprachmodelle, die für alles Mögliche eingesetzt werden – vom Schreiben von Code bis hin zum Chatten. Sie testeten es auch auf BERT, einem Modell zum Verständnis von Texten.

Hier ist, was sie entdeckten:

  • Die Kompressionskraft: Sie konnten diese riesigen Modelle um bis zu 50 % schrumpfen. Das bedeutet, die Anzahl der Parameter zu halbieren.
  • Die Leistung: Selbst mit der halben Größe lieferten die Modelle eine ebenso gute oder manchmal sogar bessere Leistung als die Originalversionen. In vielen Tests schlug GFWSVD die derzeit besten Methoden (wie diagonale Approximationen und aktivierungsbasierte Methoden) flächendeckend.
  • Vermeidung des Zusammenbruchs: Als sie versuchten, die Modelle um 40 % zu komprimieren, begannen Standardmethoden zu versagen, was dazu führte, dass die KI ihre Fähigkeit verlor, zu schlussfolgern oder Fragen korrekt zu beantworten. GFWSVD hingegen blieb robust und zuverlässig.
  • Die Geschwindigkeit: Da die Modelle kleiner sind, laufen sie schneller. Auf einem leistungsstarken Computerchip (einem NVIDIA A100) verarbeiteten die komprimierten Modelle Text 1,34-mal schneller als die ursprünglichen, unkomprimierten Modelle.

Warum das wichtig ist

Die Autoren zeigten, dass man durch das Beachten der verborgenen Verbindungen zwischen den Parametern (die Off-Diagonal-Elemente) KI-Modelle viel aggressiver schrumpfen kann, ohne sie zu beschädigen. Sie bewiesen, dass das Ignorieren dieser Verbindungen, wie es die meisten anderen Methoden tun, viel Potenzial bei der Leistung liegen lässt.

Sie zeigten auch, dass diese Methode als hervorragender „Starter“ für andere Trainingsprozesse dient. Wenn man zuerst GFWSVD nutzt, um ein Modell zu schrumpfen, und das Modell dann noch ein wenig weiterlernen lässt (Fine-Tuning), behält es seine Genauigkeit viel besser bei, als wenn man Standardmethoden zur Schrumpfung verwendet hätte.

Kurz gesagt: Dieses Paper liefert eine mathematisch fundierte „Schere“, um riesige KI-Modelle zuzuschneiden. Es ermöglicht uns, die Intelligenz zu behalten, während wir die Masse wegwerfen – was mächtige KI auf kleineren Geräten zugänglich und kostengünstiger im Betrieb macht, ohne den Zauber des ursprünglichen Modells zu verlieren.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →