← Neueste Arbeiten
🤖 AI

TileMix: Tile-Centric Mixed-Precision Attention for LLM Inference Acceleration

TileMix ist ein trainingsfreier, kachelbasierter Mixed-Precision-Kernel, der die Inferenz von Long-Context-LLMs beschleunigt, indem er hardware-ausgerichtete Attention-Score-Kacheln dynamisch zwischen FP16- und INT8-Pfaden innerhalb einer fusionierten dichten Attention-Operation routet und dadurch die durch uniforme Niedrigpräzisionsmethoden verlorene Genauigkeit wiederherstellt, während gleichzeitig der Durchsatz verbessert wird.

Ursprüngliche Autoren: Hanzhi Zhang, Qiao Zhang, Qinglei Cao, Heng Fan, Yan Huang, Kewei Sha, Yunhe Feng

Veröffentlicht 2026-08-19
📖 5 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Hanzhi Zhang, Qiao Zhang, Qinglei Cao, Heng Fan, Yan Huang, Kewei Sha, Yunhe Feng

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Große Sprachmodelle sind zum Motor einer neuen Generation künstlicher Intelligenz geworden, die in der Lage sind, ganze Bücher zusammenzufassen, komplexe Fragen aus langen Dokumenten zu beantworten und Gespräche zu führen, die sich über tausende von Wörtern erstrecken. Um dies zu erreichen, verlassen sich diese Modelle auf einen Mechanismus namens „Attention“ (Aufmerksamkeit), der es ihnen ermöglicht, die Wichtigkeit eines Wortes in einem Satz gegenüber jedem anderen Wort abzuwägen. Wenn der Text kurz ist, ist dieser Prozess schnell. Aber wenn der Kontext auf ganze Kapitel oder rechtliche Verträge anwächst, explodieren die Rechenkosten. Das Modell muss einen Score für jedes mögliche Wortpaar berechnen, was ein massives Datenraster erzeugt, das enorme Mengen an Speicher und Rechenleistung beansprucht. Dieser Engpass hat es schwierig gemacht, diese leistungsstarken Werkzeuge effizient auf Standardhardware auszuführen, insbesondere beim Umgang mit den langen Sequenzen, die für reale Aufgaben wie die juristische Analyse oder die Überprüfung medizinischer Unterlagen erforderlich sind.

Forscher haben versucht, dies durch eine Vereinfachung der Mathematik zu lösen. Ein gängiger Ansatz besteht darin, die Präzision der Zahlen, die der Computer verwendet, zu senken, indem man von hochgenauen Berechnungen zu schnelleren, weniger präzisen Berechnungen wechselt. Dies ist vergleichbar mit dem Wechsel von der Messung der Zutaten mit einer Laborwaage hin zur Verwendung eines Küchenlöffels; es ist viel schneller, aber wenn man dies bei jedem einzelnen Schritt eines komplexen Rezepts tut, könnte das fertige Gericht anders schmecken als beabsichtigt. Ein anderer Ansatz besteht darin, Berechnungen komplett zu überspringen, indem man Wörter ignoriert, die unwichtig erscheinen. Während dies Zeit spart, besteht das Risiko, genau die Verbindungen abzuschneiden, die das Modell benötigt, um die Geschichte zu verstehen. Die Herausforderung bestand darin, einen Weg zu finden, die Geschwindigkeit der Niedrigpräzisions-Mathematik zu nutzen, ohne die Genauigkeit der Hochpräzisions-Mathematik zu opfern, und gleichzeitig die Fähigkeit des Modells zu bewahren, das Gesamtbild zu erfassen.

Ein Team von Forschern hat eine neue Methode namens TileMix vorgestellt, die dieses Problem angeht, indem sie den Attention-Prozess nicht als einen einzigen, einheitlichen Block von Arbeit betrachtet, sondern als eine Sammlung kleinerer, handhabbarer Kacheln (Tiles). Stellen Sie sich das massive Gitter der Wortpaar-Scores als ein großes Mosaik vor. Anstatt das gesamte Mosaik mit einer einzigen Art von Farbe zu bemalen, unterteilt TileMix es in kleine, hardware-ausgerichtete quadratische Abschnitte. Für jeden dieser Abschnitte trifft das System eine blitzschnelle Entscheidung: Benötigt diese spezifische Gruppe von Wortpaaren die hochpräzise, langsame Berechnung, oder kommt sie mit der schnellen, niedrigeren Präzision aus? Diese Entscheidung wird basierend auf einer vorab geplanten Karte getroffen, die diese Kacheln gruppiert, was es dem Computer ermöglicht, innerhalb derselben Operation zwischen hoher und niedriger Präzision zu wechseln, ohne die Daten neu organisieren zu müssen.

Der Kern dieser Innovation ist ein Routing-System, das wie ein Verkehrskontrolleur für den Prozessor des Computers fungiert. Es verpackt diese Entscheidungen in einen kompakten Code, im Wesentlichen eine Zeichenfolge von Bits, die dem Prozessor sagt, welchen Pfad er für jede Kachel nehmen soll. Wenn eine Kachel für hohe Präzision markiert ist, nutzt der Prozessor seine genauesten Recheneinheiten. Wenn sie für niedrige Präzision markiert ist, wechselt er zu seinen schnellsten, energieeffizientesten Einheiten. Entscheidend ist, dass beide Pfade einen gemeinsamen Speicherzustand aktualisieren, der die Gesamtergebnisse verfolgt, um sicherzustellen, dass die endgültige Ausgabe konsistent bleibt. Dies ermöglicht es dem System, die volle Konnektivität des Modells zu bewahren – das heißt, Wort-Interaktionen werden niemals ignoriert – während es gleichzeitig die Geschwindigkeitsvorteile der Niedrigpräzisions-Mathematik nutzt, für die Teile der Berechnung, die sie tolerieren können.

In ihren Experimenten testeten die Forscher diese Methode an mehreren populären großen Sprachmodellen, darunter LLaMA, Qwen und Vicuna, wobei sie Sequenzen von 16.000 bis 64.000 Wörtern verwendeten. Sie verglichen ihren Ansatz mit der standardmäßigen Hochpräzisionsmethode und einer Version, die überall Niedrigpräzisions-Mathematik verwendete. Die Ergebnisse zeigten, dass die Verwendung von Niedrigpräzisions-Mathematik für die gesamte Berechnung oft zu einem signifikanten Abfall der Genauigkeit führte, was dazu führte, dass das Modell Details übersah oder bei Retrieval-Aufgaben versagte. TileMix war jedoch in der Lage, den Großteil dieser verlorenen Qualität wiederherzustellen. Durch das gezielte Routing nur spezifischer Gruppen von Kacheln auf den Hochpräzisionspfad konnte das System Genauigkeitswerte erreichen, die sehr nah an der vollen Hochpräzisions-Baseline liegen, während es gleichzeitig wesentlich schnellere Verarbeitungsgeschwindigkeiten erzielte.

Die Studie untersuchte auch verschiedene Muster für die Entscheidung, welche Kacheln die Hochpräzisions-Behandlung erhalten sollten. Sie fanden heraus, dass die Anordnung entscheidend war; einige Muster, die Hochpräzisionsberechnungen in bestimmten räumlichen Regionen des Wortgitters beibehielten, funktionierten je nach Aufgabe besser als andere. Beispielsweise waren bestimmte Layouts, die die Hochpräzision für lokale Wortinteraktionen bewahrten, besser bei Aufgaben des faktischen Abrufens (Factual Recall), während andere robuster für allgemeine Beantwortung von Fragen waren. Die Forscher demonstrierten, dass diese Methode angewendet werden kann, ohne die Modelle neu trainieren zu müssen, was bedeutet, dass sie sofort auf bestehenden Systemen eingesetzt werden kann. Sie zeigten auch, dass der Ansatz gut mit variablen Batch-Größen und unterschiedlichen Modellarchitekturen funktioniert, was darauf hindeutet, dass er ein flexibles Werkzeug zur Effizienzsteigerung ist.

Letztendlich bietet TileMix ein kontrollierbares Gleichgewicht zwischen Geschwindigkeit und Genauigkeit. Es legt nahe, dass die Zukunft der effizienten Long-Context-Verarbeitung nicht darin besteht, sich zwischen „schnell sein“ oder „intelligent sein“ entscheiden zu müssen. Stattdessen kann das System, indem es beide intelligent mischt, lange Dokumente mit einer Geschwindigkeit verarbeiten, die sich den theoretischen Grenzen der Hardware nähert, ohne die schweren Genauigkeitseinbußen, die mit der flächendeckenden Verwendung von Niedrigpräzisions-Mathematik einhergehen. Dieser Ansatz bietet einen praktischen Weg nach vorn, um große Sprachmodelle in Szenarien einzusetzen, in denen sowohl Geschwindigkeit als auch Präzision entscheidend sind, wie etwa bei der Echtzeit-Analyse massiver Datensätze oder interaktiven Tools, die lange, komplexe Kontexte sofort verstehen müssen.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →