← Neueste Arbeiten
🤖 AI

TileFuse: A Fused Mixed-Precision Kernel Library for Efficient Quantized LLM Inference on AMD NPUs

Dieses Paper führt TileFuse ein, eine „Close-to-Metal“-Mixed-Precision-Kernel-Bibliothek für AMD XDNA2 NPUs, die Unpacking, Dequantisierung und Matrixoperationen fusioniert, um eine effiziente, native Unterstützung für populäre AWQ-Stil quantisierte LLM-Inferenz zu ermöglichen und signifikante Leistungs- sowie Energieeffizienzgewinne gegenüber bestehenden Baselines auf Client-Edge-Geräten zu erzielen.

Ursprüngliche Autoren: Wesley Pang, Gregory Hyegang Jun, Feiyang Liu, Deming Chen

Veröffentlicht 2026-06-11
📖 5 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Wesley Pang, Gregory Hyegang Jun, Feiyang Liu, Deming Chen

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie haben einen brandneuen, superschnellen Lieferwagen (die NPU) in Ihrer Garage stehen, aber die einzige Landkarte, die Sie haben (die Software), beschreibt, wie man ein langsames, altes Fahrrad fährt. Sie können die Geschwindigkeit des Lastwagens nicht nutzen, weil die Karte nicht weiß, wie sie seine Fahrspuren navigieren soll.

Dies ist das Problem beim Ausführen moderner KI-Chatbots (LLMs) auf neuen Laptop-Chips von heute. Diese Chips besitzen leistungsstarke „KI-Motoren“ (NPUs), die darauf ausgelegt sind, den Akku zu schonen und schnell zu arbeiten, aber die Software zwingt die KI meist dazu, ihre Form anzupassen, damit sie in den Motor passt, anstatt den Motor die KI anpassen zu lassen.

TileFuse ist ein neues Set an Werkzeugen, das dieses Problem löst. Es ist wie der Bau einer maßgeschneiderten, Hochgeschwindigkeits-Autobahn speziell für den Lastwagen, die es ihm ermöglicht, schwere Lasten an komprimierten Daten zu transporten, ohne sie zwischendurch neu verpacken zu müssen.

Hier erklärt das Paper diese Lösung anhand einfacher Analogien:

1. Das Problem: Der „Umverpackungs“-Engpass

Normalerweise muss man, um eine KI auf diesen neuen Chips auszuführen, die „komprimierten“ Gewichte der KI (welche wie Bücher sind, die eng in einen kleinen Koffer gepackt wurden) in ein sperriges Format entpacken (wie die Bücher auszupacken und flach auf einen Tisch zu legen), nur damit der Chip sie lesen kann.

  • Der alte Weg: Der Chip liest den Koffer, packt die Bücher aus, legt sie in einen anderen Koffer um und fängt dann erst an, sie zu lesen. Das verschwendet Zeit und Energie.
  • Der TileFuse-Weg: Der Chip liest den Koffer, öffnet ihn und liest die Bücher, während sie noch ausgepackt werden. Er erledigt alles in einem fließenden Bewegungsablauf.

2. Die Lösung: „Fused“ Kernels

Die Autoren haben eine Bibliothek namens TileFuse erstellt. Stellen Sie sich einen „Kernel“ als eine spezifische Bedienungsanleitung für den Chip vor.

  • Fusion: Anstatt drei separater Arbeiter zu haben (einen zum Auspacken, einen zum Konvertieren, einen für die Berechnung), kombiniert TileFuse diese zu einem Super-Arbeiter. Dieser Arbeiter greift nach den komprimierten Daten, konvertiert sie „on the fly“ und erledigt die Mathematik alles in einem einzigen Durchgang.
  • Das Ergebnis: Dies ist vergleichbar mit einem Koch, der Gemüse nicht nur schneidet, sondern es in einer einzigen, kontinuierlichen Bewegung schneidet, würzt und gart. Das Paper behauptet, dass dies den „Auspack“-Teil des Prozesses für bestimmte Aufgaben um bis zu 2,8-mal schneller macht als ältere Methoden.

3. Das „Interleaved“-Layout: Das Lager organisieren

Große KI-Modelle haben massive Listen von Zahlen (Gewichte). Das Speichersystem des Chips hat eine Grenze, wie weit es greifen kann, um das nächste Stück der Daten zu erfassen. Wenn die Daten unordentlich und verstreut gespeichert sind, muss der Chip lange, langsame Wege zurücklegen, um das nächste Teil zu bekommen.

  • Die Analogie: Stellen Sie sich ein Lagerhaus vor, in dem Kisten wahllos gestapelt sind. Ein Gabelstapler muss 15 Meter fahren, um die nächste Kiste zu holen.
  • Die TileFuse-Lösung: Sie ordnen das Lagerhaus neu (genannt „Interleaved Pre-tiling“), sodass die Kisten, die der Gabelstapler als Nächstes benötigt, direkt nebeneinander stehen. Dies ermöglicht es dem Chip, riesige Datenmengen in einem einzigen, glatten Wisch zu erfassen, was viel größere KI-Modelle (bis zu 32.000 Elemente breit) unterstützt, die zuvor nicht hineingepasst hätten.

4. Das „GEMV“-Problem: Der Stau

KI-Chatbots arbeiten in zwei Phasen:

  1. Prefilling: Das Lesen eines langen Prompts auf einmal (wie das Lesen eines ganzen Buches). Das ist schnell und einfach für den Lastwagen.
  2. Token Generation: Das Schreiben eines Wortes nach dem anderen (wie das Schreiben eines Satzes). Das ist langsam und knifflig.
  • Das Problem: Beim Schreiben eines Wortes nach dem anderen steht der „Lastwagen“ des Chips oft still, da er darauf ausgelegt ist, große Lasten zu tragen, nicht kleine. Es ist, als würde man einen Sattelzug benutzen, um einen einzelnen Brief auszuliefern; der Motor läuft, aber der Lastwagen ist leer.
  • Die Lösung: TileFuse hat den Verkehrsfluss für diese Phase neu gestaltet. Anstatt die Daten nur in eine Spur der Autobahn zu senden, verteilt es die Arbeit gleichzeitig auf alle 32 Spuren des Chips. Dies hält den gesamten Motor beschäftigt, selbst wenn die „Last“ klein ist.

5. Die Ergebnisse aus der Praxis

Das Team hat dies auf echten AMD-Laptops (Ryzen AI) getestet und mit der Verwendung der Standard-Grafikkarte (iGPU) des Laptops verglichen.

  • Geschwindigkeit: Beim Lesen langer Prompts (Prefilling) war die NPU mit TileFuse bis zu 2-mal schneller als die Grafikkarte.
  • Batterie: Da die NPU effizienter ist, verbrauchte sie 64 % weniger Energie, um dieselbe Aufgabe zu erledigen.
  • Der Haken: Bei der Generierung einzelner Wörter (Token Generation) war die NPU manchmal langsamer als die Grafikkarte. Das liegt daran, dass die „Setup-Zeit“, um die NPU zu konfigurieren, für solch winzige, schnelle Aufgaben zu lang ist.
  • Die Hybrid-Lösung: Das Paper schlägt einen „Best-of-Both-Worlds“-Ansatz vor: Nutzen Sie die NPU für die schwere Arbeit (Lesen langer Prompts) und die Grafikkarte für die schnellen Aufgaben (Schreiben von Wörtern). Diese Kombination liefert die beste Geschwindigkeit und die beste Akkulaufzeit.

Zusammenfassung

TileFuse ist eine Brücke. Es nimmt die populären, komprimierten KI-Formate, die Entwickler bereits verwenden (wie AWQ), und lässt sie nativ auf AMDs neuen KI-Chips laufen, ohne dass die KI-Modelle selbst geändert werden müssen. Durch das Verschmelzen (Fusing) der Auspack- und Rechenschritte, die perfekte Organisation der Daten und die Nutzung der vollen Leistung der Chip-Spuren, macht es das Ausführen von KI auf Laptops signifikant schneller und energieeffizienter.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →