← Neueste Arbeiten
🤖 machine learning

PATCH: Learnable Tile-level Hybrid Sparsity for LLMs

PATCH ist ein hybrides Sparsitäts-Framework, das LLM-Gewichtsmatrizen in Kacheln mit lernbaren dichten oder 2:4-sparsen Zuordnungen partitioniert, um kontinuierliche Sparsitätsverhältnisse zwischen 0 % und 50 % zu ermöglichen und damit im Vergleich zu bestehenden unstrukturierten oder starren semi-strukturierten Pruning-Methoden eine überlegene Genauigkeit sowie praktische GPU-Geschwindigkeitssteigerungen zu erreichen.

Ursprüngliche Autoren: Younes Hourri, Mohammad Mozaffari, Maryam Mehri Dehnavi

Veröffentlicht 2026-04-30
📖 3 Min. Lesezeit☕ Kaffeepausen-Lektüre

Ursprüngliche Autoren: Younes Hourri, Mohammad Mozaffari, Maryam Mehri Dehnavi

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich ein Large Language Model (LLM) als eine riesige, hyper-organisierte Bibliothek vor, die Milliarden von Büchern (Parameter) enthält. Um diese Bibliothek auf einem Standardcomputer schnell laufen zu lassen, müssen Sie einige Bücher entfernen. Sie stehen jedoch vor einem kniffligen Dilemma:

  1. Der „unordentliche" Ansatz (Unstrukturierte Sparsität): Sie werfen zufällige Bücher von überall in den Regalen weg. Dies hält das Wissen der Bibliothek sehr genau, da Sie sehr selektiv sein können, erzeugt aber ein chaotisches Durcheinander. Eine Bibliothekarin (die GPU des Computers), die versucht, Bücher zu finden, muss überall herumhüpfen, was den Prozess langsam und ineffizient macht.
  2. Der „strenge" Ansatz (2:4-Sparsität): Sie entscheiden, einer strengen Regel zu folgen: „In jeder Gruppe von vier Büchern müssen Sie genau zwei entfernen." Dies macht die Arbeit der Bibliothekarin einfach und schnell, da das Muster vorhersehbar ist. Diese Regel ist jedoch zu starr. Manchmal sind die zwei Bücher, die Sie müssen entfernen, tatsächlich die wichtigsten, was dazu führt, dass die Bibliothek ihre Intelligenz und Genauigkeit verliert.

Hier kommt PATCH ins Spiel: Der „intelligente Fliesen"-Bibliothekar

Die Arbeit stellt eine neue Methode namens PATCH (Pruning with a Learnable Tile-level Configuration for Hybrid Sparsity) vor. Anstatt sich zwischen dem „unordentlichen" und dem „strengen" Ansatz zu entscheiden, agiert PATCH wie ein intelligenter Bibliothekar, der die Bibliothek in Fliesen (kleine, überschaubare Regalsektionen) unterteilt.

So funktioniert es, mithilfe einer einfachen Analogie:

  • Das Fliesensystem: Stellen Sie sich vor, die Bibliothek ist in quadratische Fliesen unterteilt, wie ein Mosaik.
  • Die Entscheidung: Für jede Fliese lernt das PATCH-System, eine Wahl zu treffen:
    • Option A (Dicht): Halten Sie diese Fliese vollständig mit Büchern gefüllt. Dies ist für die „kritischen" Bereiche der Bibliothek gedacht, wo Genauigkeit am wichtigsten ist.
    • Option B (2:4-Spars): Wenden Sie die strenge Regel „zwei von vier entfernen" auf diese Fliese an. Dies ist für Bereiche gedacht, in denen die Bibliothek zusätzliche, redundante Bücher hat, die sicher entfernt werden können, um Platz zu sparen und die Geschwindigkeit zu erhöhen.
  • Der Lernprozess: Das System rät nicht. Es „trainiert" sich selbst, um genau herauszufinden, welche Fliesen voll und welche spärlich sein sollten. Es lernt, die wichtigen Teile dicht und die redundanten Teile spärlich zu halten, während es gleichzeitig hardwarefreundliche Regeln befolgt.

Warum ist das eine große Sache?

  • Das Beste aus beiden Welten: PATCH überbrückt die Lücke. Es hält die Bibliothek genau (wie der unordentliche Ansatz), organisiert sie aber so, dass Computer sie schnell lesen können (wie der strenge Ansatz).
  • Flexible Geschwindigkeit: Sie können PATCH sagen: „Ich möchte, dass die Bibliothek 25 % kleiner ist" oder „50 % kleiner". Es passt die Anzahl der „vollen Fliesen" gegenüber den „spärlichen Fliesen" an, um dieses Ziel perfekt zu erreichen, anstatt bei einer festen 50 %-Reduzierung stecken zu bleiben.
  • Realwelt-Ergebnisse: Die Autoren testeten dies an Modellen von klein bis sehr groß (bis zu 13 Milliarden Parameter).
    • Geschwindigkeit: Auf einer Standard-Konsumenten-Grafikkarte (eine A6000-GPU) ließen PATCH die Modelle 1,18- bis 1,38-mal schneller laufen als die ursprünglichen, unbeschnittenen Modelle.
    • Intelligenz: Im Gegensatz zu anderen Methoden, die das Modell „dümmer" machen, wenn sie es beschleunigen, machte PATCH die Modelle tatsächlich genauer (um 0,37 % bis 2,96 %) im Vergleich zur aktuellen state-of-the-art-strengen Methode (MaskLLM).

Zusammenfassung

Denken Sie an PATCH als eine Möglichkeit, ein riesiges Lagerhaus aufzuräumen. Anstatt zufällig Dinge wegzuwerfen (was die Gabelstapler verlangsamt) oder einer dummen Regel zu folgen, die wichtige Gegenstände wegwirft, weist PATCH intelligent bestimmte Zonen zu, die voll gehalten werden sollen, und andere Zonen, die nach einem Muster geräumt werden sollen, das Gabelstapler lieben. Das Ergebnis ist ein Lagerhaus, das schneller zu navigieren ist und dennoch alle wesentlichen Kenntnisse enthält.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →