← Neueste Arbeiten
💬 NLP

WIDE: Boosting Adaptive LLM Inference via Token-level Dynamic Width Pruning

Das Paper stellt WIDE vor, das erste end-to-end differenzierbare Framework, das ein Token-Level Dynamic Width Pruning für LLMs ermöglicht, indem es eine feingranulare Auswahl von Attention-Heads und FFN-Kanälen erlaubt, gekoppelt mit einem spezialisierten Kernel-Co-Design, um eine signifikante End-to-End-Inferenzbeschleunigung bei gleichbleibend hoher Genauigkeit zu erreichen.

Ursprüngliche Autoren: Haozhe Hu, Hao Wu, Peiran Yin, Chao Han, Yunpu Ma, Xiaoyu Shen

Veröffentlicht 2026-07-31
📖 7 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Haozhe Hu, Hao Wu, Peiran Yin, Chao Han, Yunpu Ma, Xiaoyu Shen

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie versuchen, ein riesiges, unglaublich intelligentes Robotergehirn auf einem winzigen, batteriebetriebenen Gerät laufen zu lassen. Dieses Robotergehirn ist ein Large Language Model (LLM), eine Art künstliche Intelligenz, die Geschichten schreiben, Matheaufgaben lösen und wie ein Mensch chatten kann. Aber es gibt einen Haken: Diese Gehirne sind riesig. Sie sind so groß und hungrig nach Energie, dass man Supercomputer braucht, um sie zu betreiben, was sie auf Ihrem Telefon oder Laptop langsam und teuer macht.

Um dies zu beheben, versuchen Wissenschaftler, diese Gehirne zu „beschneiden“ (pruning). Denken Sie an das Beschneiden wie beim Trimmen einer riesigen, überwucherten Hecke. Man schneidet die Zweige ab, die nicht viel Arbeit leisten, um die Pflanze kleiner und schneller zu machen. Lange Zeit war die beste Methode hierfür, ganze Abschnitte der Hecke permanent abzuschneiden, egal was die Pflanze an diesem Tag gerade zu tun hatte. Das ist jedoch etwas ungeschickt; manchmal schneidet man einen Zweig ab, der für eine bestimmte Aufgabe eigentlich gebraucht worden wäre, was den Roboter vergesslich macht. Kürzlich wurden intelligentere Methoden erfunden, die es dem Roboter erlauben, selbst während des Denkprozesses zu entscheiden, welche Teile er nutzt. Diese smarten Methoden waren jedoch immer noch etwas zu grob – sie nutzten entweder einen ganzen Abschnitt oder ließen ihn ganz aus, als müsste man sich entscheiden, ob man ein ganzes Zimmer nutzt oder das ganze Haus leer lässt, anstatt nur ein paar spezifische Lichter einzuschalten.

Dieses Paper stellt ein neues System namens WIDE (Width-based Inference with Dynamic Execution) vor. Es ist, als würde man dem Roboter einen superpräzisen Dimmer für jede einzelne Glühbirne in seinem Gehirn geben. Anstatt ganze Räume ein- oder auszuschalten, erlaubt WIDE dem Modell, für jedes einzelne Wort (Token), das es verarbeitet, exakt zu entscheiden, welche kleinen Gruppen von Neuronen (den Zellen des Gehirns) aufleuchten sollen und welche dunkel bleiben. Die Forscher haben einen speziellen „Verkehrskontrolleur“ (einen Router) gebaut, der lernt, diese blitzschnellen Entscheidungen zu treffen. Sie haben auch eine neue Art entwickelt, wie die Hardware des Computers diese Entscheidungen handhaben kann, ohne verwirrt zu werden oder langsamer zu werden. Das Ergebnis: Der Roboter bleibt genauso intelligent wie zuvor, läuft aber viel schneller und verbraucht weniger Energie, selbst wenn man die Kapazität seines Gehirns um die Hälfte reduziert hat.

Das Problem: Die „Alles-oder-Nichts“-Falle

Stellen Sie sich vor, Sie sind ein Chefkoch, der eine riesige Küche leitet. Sie haben hunderte von Köchen (Neuronen), die zusammenarbeiten, um eine Mahlzeit zu kochen. Früher, wenn Sie Zeit sparen wollten, hätten Sie vielleicht die Hälfte Ihres Küchenpersonals dauerhaft entlassen. Das funktioniert gut, wenn Sie immer das gleiche einfache Gericht kochen, aber wenn Sie plötzlich einen komplexen Kuchen backen müssen, haben Sie Ihnen vielleicht gerade den einzigen Bäcker weggeschnitten, den Sie gebraucht hätten. Das ist das, was bei statischer Pruning passiert: Das Modell wird einmalig und endgültig gestutzt, unabhängig von der spezifischen Frage, die es beantwortet.

Dann kam das dynamische Pruning, was so war, als würde man einen Manager einstellen, der den Köchen sagen kann: „Hey, für diese spezielle Bestellung wird nur die Grillstation benötigt; die Bäckerei kann Pause machen.“ Das war besser, aber der Manager war immer noch etwas tollpatschig. Er würde sagen: „Überspringe die ganze Bäckerei“, selbst wenn die Bäckerei nur zwei von zehn Öfen gebraucht hätte. Es war eine „Alles-oder-Nichts“-Entscheidung für große Teile der Küche.

Das Problem ist, dass moderne KI-Modelle so komplex sind, dass das Überspringen eines ganzen Blocks oft nützliche Informationen wegwirft, was die Qualität der Antwort beeinträchtigt. Zudem: Wenn der Manager den Zeitplan jede Sekunde ändert, wird das Küchenpersonal verwirrt, und die eigentliche Kochgeschwindigkeit wird nicht viel schneller, weil der ganze Wechselaufwand (Overhead) zu hoch ist.

Die Lösung: WIEDEs „Dimmer-Schalter“

Die Autoren dieses Papers, die am Ningbo Institute of Digital Twin und der LMU München arbeiten, haben WIDE entwickelt. Anstatt ganze Abteilungen zu entlassen oder ganze Räume zu überspringen, lässt WIDE das Modell entscheiden, für jedes einzelne Wort (Token), das es verarbeitet, exakt welche kleinen Gruppen von Neuronen aktiviert werden sollen.

Stellen Sie sich das Gehirn des Modells wie ein riesiges Gitter aus Lichtschaltern vor.

  • Alte dynamische Methoden: „Schalte den gesamten linken Flügel des Hauses aus.“
  • WIDE: „Für dieses spezifische Wort schalte das Licht in der Küche an, aber nur die Lampen über dem Herd und dem Kühlschrank. Lass den Rest der Küche dunkel.“

WIDE macht dies durch den Einsatz eines leichtgewichtigen „Routers“ (eines kleinen Entscheidungsträgers), der an jeder Schicht des Modells angebracht ist. Dieser Router betrachtet das aktuelle Wort und fragt: „Brauche ich diese Gruppe von Attention Heads (die Teile, die auf andere Wörter achten)?“ und „Brauche ich diese Gruppe von FFN-Kanälen (die Teile, die die Bedeutung verarbeiten)?“ Er trifft eine binäre Entscheidung: Nutze diese Gruppe oder überspringe sie.

Entscheidend ist, dass WIEDE nicht bei der Entscheidung stehen bleibt; es löst auch das Hardware-Problem. Normalerweise wird ein Computer sehr langsam, wenn man ihm sagt, er solle zufällige Teile einer Berechnung überspringen, da er dann Schwierigkeiten hat, die Daten zu finden. WIEDE nutzt einen cleveren Trick namens Mask Reordering (Masken-Neuordnung). Stellen Sie sich vor, Sie haben einen unordentlichen Stapel Post, wobei einige Briefe zur Zustellung bestimmt sind und andere Müll sind. Anstatt den Müll erst wegzuschmeißen und dann die Post zu sortieren, sortiert WIEDE den Stapel zuerst so um, dass alle „behalten“-Briefe in einem ordentlichen Block oben liegen und alle „Müll“-Briefe unten. Dies ermöglicht es dem Computer, den „Behalten“-Block sehr effizient zu verarbeiten, ohne ständig nach jedem einzelnen Stück Post suchen zu müssen.

Was sie herausgefunden haben: Geschwindigkeit und Intelligenz

Die Forscher testeten WIEDE auf populären KI-Modellen wie Llama 3.1 (8 Milliarden Parameter) und Llama 3.2 (3 Milliarden Parameter). Sie verglichen es mit den besten existierenden Methoden sowohl für statisches als auch für dynamisches Pruning.

Hier ist, was die Zahlen aussagen:

  • Intelligentes Pruning: Als sie die Kapazität des Modells um 50 % reduzierten (ein sehr aggressiver Schnitt), behielt WIEDE die Intelligenz des Modells viel besser als alle anderen Methoden bei. Zum Beispiel behielt WIEDE beim Llama 3.1-Modell 86,42 % der ursprünglichen Genauigkeit nach dem Pruning bei, während die nächstbeste dynamische Methode (SkipGPT) nur 59,42 % erreichte. Selbst ohne zusätzliches Fine-Tuning war WIEDE bereits besser als die besten statischen Methoden.
  • Reale Geschwindigkeit: Das Paper hat gemessen, wie viel schneller das Modell tatsächlich lief. In der „Prefill“-Phase (beim Lesen eines langen Prompts) war WIEDE 1,68-mal schneller als das Originalmodell. In der „Decode“-Phase (beim Generieren der Antwort Wort für Wort) war es 1,55-mal schneller.
  • Magie auf Kernel-Ebene: Wenn man nur die mathematischen Berechnungen betrachtet (und andere Overheads ignoriert), war der Geschwindigkeitsvorteil noch dramatischer und erreichte bis zu 1,98x beim Prefill und 4,95x beim Decoding. Dies deutet darauf hin, dass der Flaschenhals die ineffiziente Art und Weise war, wie frühere Methoden das „Überspringen“ handhabten, und dass WIEDEs neues Hardware-Design dieses Problem gelöst hat.

Die Autoren fanden auch heraus, dass das Modell lernte, sehr strategisch vorzugehen. Es übersprang nicht einfach zufällige Teile, sondern lernte, die „langweiligen“ Wörter (wie „der“, „die“, „das“) zu überspringen und die „wichtigen“ Wörter (wie „laufen“ oder „Spur“) beizubehalten. In einem Test übersprang das Modell 66 % der Attention-Arbeit, aber nur 28 % der Verarbeitungsarbeit, was zeigt, dass es genau wusste, wo es Energie sparen konnte.

Das Fazit

WIDE legt nahe, dass die Zukunft effizienter KI nicht nur darin besteht, das Modell kleiner zu schneiden, sondern das Modell klüger darin zu machen, wie es seine verbleibenden Teile nutzt. Indem die Autoren vom „ganzen Raum überspringen“ zum „spezifischen Licht dimmen“ übergingen und das System so umgestalteten, dass die Hardware diese Dimmer effizient handhaben kann, haben sie ein Framework geschaffen, das große KI-Modelle signifikant schneller und effizienter macht, ohne sie vergesslich zu machen.

Obwohl die Ergebnisse vielversprechend sind, merkt das Paper an, dass dies eine spezifische Lösung für GPU-Hardware (die Chips in Computern) ist und auf einem zweistufigen Trainingsprozess basiert, bei dem das Modell zuerst lernt, Entscheidungen zu treffen, und dann ein kurzes „Tuning“ erhält, um eventuell verlorene Genauigkeit zurückzugewinnen. Es ist ein bedeutender Schritt nach vorn, um leistungsstarke KI auf alltäglichen Geräten zugänglich zu machen, und beweist, dass man kein riesiges Gehirn braucht, um intelligent zu sein – man muss nur wissen, welche Teile des Gehirns man zum richtigen Zeitpunkt nutzt.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →