← Neueste Arbeiten
🤖 machine learning

FluxBin: Flexible LUT-based Ultra-low-bit LLM Inference by Algorithm-Kernel Synergy

FluxBin ist ein Algorithmisch-Kernel-Co-Design-Framework, das eine neuartige Methode der entkoppelten binären Zerlegung mit einem spezialisierten CUDA-Kernel unter Verwendung von Nachschlagetabellen und virtueller spaltenweiser Abbildung kombiniert, um eine Ultra-Low-Bit-LLM-Inferenz mit signifikanten Geschwindigkeitssteigerungen, Energieeinsparungen und Speicherreduktion bei gleichzeitiger Aufrechterhaltung hoher Genauigkeit zu ermöglichen.

Ursprüngliche Autoren: Qingyao Yang, Runming Yang, He Xiao, Wendong Xu, Junyu Chen, Haobo Liu, Chenchen Ding, Ruihan Hu, Yik-Chung Wu, Ngai Wong

Veröffentlicht 2026-08-18
📖 6 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Qingyao Yang, Runming Yang, He Xiao, Wendong Xu, Junyu Chen, Haobo Liu, Chenchen Ding, Ruihan Hu, Yik-Chung Wu, Ngai Wong

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Große Sprachmodelle sind die leistungsstarken Computerprogramme, die Geschichten schreiben, Probleme lösen und Gespräche führen können, aber sie bringen einen massiven physischen Preis mit sich. Um diese Modelle zu betreiben, benötigt man enorme Mengen an Computerspeicher und Energie, was oft spezialisierte, teure Hardware erfordert, auf die nur wenige Menschen Zugang haben. Dies liegt daran, dass die Modelle ihr Wissen in riesigen Gittern aus Zahlen speichern, und das Behalten all dieser Zahlen in ihrer ursprünglichen, hochpräzisen Form nimmt zu viel Platz ein. Wissenschaftler versuchen schon lange, diese Modelle zu verkleinern, indem sie die Zahlen komprimieren, ganz ähnlich wie man ein hochauflösendes Foto in eine kleinere Datei umwandelt. Eine extreme Version dieser Kompression besteht darin, die Zahlen auf ihre einfachste Form zu reduzieren, indem man nur zwei Werte verwendet, was sie im Wesentlichen in eine Serie von An- und Aus-Schaltern verwandelt. Theoretisch sollte dies die Modelle unglaublich schnell und effizient machen, aber in der Praxis haben die Computer Schwierigkeiten, diese vereinfachten Zahlen zu nutzen, ohne langsamer zu werden oder an Genauigkeit zu verlieren. Der Prozess, die vereinfachten Zahlen zurück in ein nutzbares Format zu konvertieren, nimmt oft so viel Zeit in Anspruch, dass er die Geschwindigkeitsgewinne zunichtemacht, wodurch die Modelle genauso langsam bleiben wie zuvor.

Ein Forscherteam hat nun einen Weg gefunden, diesen Stillstand zu durchbrechen, und eine neue Methode entwickelt, die es ermöglicht, dass diese ultra-vereinfachten Modelle mit hoher Geschwindigkeit laufen, ohne ihre Fähigkeit zu verlieren, klar zu denken. Sie entwickelten ein System namens FluxBin, das funktioniert, indem es verändert, wie der Computer den Speicher des Modells liest. Anstatt zu versuchen, die vereinfachten Zahlen jedes Mal wieder in komplexe Zahlen zurückzuverwandeln, wenn das Modell etwas berechnen muss, nutzt das neue System eine vorgefertigte Nachschlagetabelle. Stellen Sie sich eine Bibliothek vor, in der man, anstatt jedes einzelne Buch zu lesen, um eine Antwort zu finden, einfach einen Code im Regal nachschlägt und sofort die fertige Antwort erhält. Die Forscher entwickelten ein spezielles Computerprogramm, das diese Nachschlagetabellen so erstellt, dass die wichtigsten Teile des Modells mit besonderer Sorgfalt behandelt werden, um sicherzustellen, dass die kritischsten Informationen während der Kompression nicht verloren gehen. Sie entwarfen auch eine neue Art, die Daten zu organisieren, damit der Computer reibungslos darauf zugreifen kann, um die Verkehrsstaus zu vermeiden, die normalerweise entstehen, wenn man versucht, spärlich verteilte oder verstreute Informationen zu lesen.

Die Ergebnisse dieser Arbeit sind bedeutend, weil sie beweisen, dass extreme Kompression nicht zwangsläufig auf Kosten der Geschwindigkeit gehen muss. Als die Forscher ihr System auf einem leistungsstarken Computerchip testeten, fanden sie heraus, dass es ein massives Modell, das normalerweise eine riesige Menge an Speicher benötigt, auf einer einzigen Standard-Grafikkarte ausführen konnte. Das System war in der Lage, Text fast sechsmal schneller zu generieren als die standardmäßige, unkomprimierte Version des Modells. Darüber hinaus verbrauchte der Computer, da er weniger schwere Arbeit leistete und weniger Daten bewegte, etwa zehnmal weniger Energie. Diese Effizienz bedeutet, dass Modelle, die zuvor zu groß waren, um auf einer einzigen Maschine zu laufen, nun effektiv auf einer einzigen Maschine passen und operieren können, was die Tür für den Einsatz leistungsfähiger künstlicher Intelligenz an Orten öffnet, an denen die Ressourcen begrenzt sind.

Der Erfolg dieses Ansatzes beruht auf einem sorgfältigen Gleichgewicht zwischen der Art und Weise, wie die Daten komprimiert werden, und wie die Hardware des Computers angewiesen wird, sie zu lesen. Die Forscher erkannten, dass es nicht ausreichte, einfach alles simpel zu machen; sie mussten identifizieren, welche Teile des Modells am empfindlichsten gegenüber Fehlern waren, und diese anders behandeln. Sie entwickelten eine Methode, die das Wissen des Modells in ein allgemeines, vereinfachtes Fundament und einen Satz spezieller, detaillierter Notizen für die wichtigsten Teile trennt. Dieser hybride Ansatz stellt sicher, dass das Modell seine Intelligenz behält, während es gleichzeitig von der Geschwindigkeit des vereinfachten Formats profitiert. Durch die Kombination dieser intelligenten Kompressionsstrategie mit einem maßgeschneiderten Programm, das direkt auf dem Prozessor des Computers läuft, eliminierten sie die Notwendigkeit der langsamen Konvertierungsschritte, die bisherige Versuche behindert hatten. Das System arbeitet, indem es die vereinfachten Daten direkt auf vorberechnete Ergebnisse abbildet, was es dem Computer ermöglicht, die Mathematik komplett zu überspringen und direkt zur Antwort zu springen.

In ihren Experimenten testete das Team ihre Methode an mehreren verschiedenen Versionen großer Sprachmodelle, die von kleineren bis hin zu massiven Modellen mit Milliarden von Parametern reichten. In jedem Fall lieferte das neue System eine dramatische Steigerung der Geschwindigkeit und eine massive Reduktion des Energieverbrauchs. Bei den größten getesteten Modellen war das System in der Lage, sie auf einer einzigen Computerkarte auszuführen, wo die Standardversion aufgrund eines Mangels an Speicher vollständig versagt hätte. Die Genauigkeit der Modelle blieb hoch und entsprach der Leistung anderer fortgeschrittener Methoden, die viel mehr Zeit und Rechenleistung für die Einrichtung benötigen. Die Forscher merkten an, dass ihre Methode funktioniert, ohne dass die Modelle neu trainiert werden müssen, was bedeutet, dass sie sofort auf bestehende Systeme angewendet werden kann. Dies deutet darauf hin, dass die Barriere, leistungsfähige künstliche Intelligenz auf alltäglicher Hardware auszuführen, nicht mehr die Frage ist, ob es möglich ist, sondern vielmehr eine Frage der Verwendung der richtigen Werkzeuge, um das bereits vorhandene Potenzial freizusetzen.

Die Auswirkungen dieser Arbeit gehen über das bloße Schneller-Machen von Modellen hinaus; sie verändert grundlegend die Beziehung zwischen Software und Hardware. Jahrelang steckte das Feld in einem Zyklus fest, in dem neue Algorithmen für theoretische Effizienz entworfen wurden, aber in der Praxis nicht realisiert werden konnten, weil die Hardware nicht mithalten konnte. Dieser neue Ansatz überbrückt diese Lücke, indem er den Algorithmus und die Hardwareanweisungen gemeinsam entwirft, um sicherzustellen, dass jeder Schritt des Prozesses für die spezifische Maschine, auf der er läuft, optimiert ist. Die Forscher demonstrierten, dass es durch ein sorgfältiges Management der Art und Weise, wie Daten gespeichert und abgerufen werden, möglich ist, Leistungsniveaus zu erreichen, die für solch hochkomprimierte Modelle zuvor als unerreichbar galten. Während die künstliche Intelligenz immer größer und komplexer wird, werden Methoden wie diese essenziell sein, um diese Technologien für eine breitere Palette von Anwendungen zugänglich und praktikabel zu machen, von persönlichen Geräten bis hin zu großen Rechenzentren. Die Arbeit zeigt, dass mit der richtigen Kombination aus kluger Mathematik und effizientem Engineering die Einschränkungen der heutigen Technologie überwunden werden können, was den Weg für eine Zukunft ebnet, in der leistungsstarke Intelligenz nicht nur ein Luxus, sondern ein Standardwerkzeug ist.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →