← Neueste Arbeiten
🤖 machine learning

MosaicQuant: Inlier-Outlier Disaggregation for Unified 4-Bit LLM Quantization

MosaicQuant führt ein einheitliches 4-Bit-LLM-Quantisierungsframework ein, das Gewichte in eine dichte Basis und ein spärliches Residuum aufteilt, um die Genauigkeit zu bewahren, während seine ZipperEngine-Komponente deren Ausführung zu einer einzigen Low-Bit-Pipeline fusioniert, um eine nahezu FP16-Leistung mit einer bis zu 1,24-fachen Beschleunigung gegenüber den Baselines zu erreichen.

Ursprüngliche Autoren: Yangjia Hu, Haodong Wang, Zicong Hong, Qianli Liu, Quanxin Shou, Jian Lin, Song Guo, Xiaowei Shen, Xiangjun Huang, Dian Wang, Jian Yang

Veröffentlicht 2026-06-16
📖 4 Min. Lesezeit☕ Kaffeepausen-Lektüre

Ursprüngliche Autoren: Yangjia Hu, Haodong Wang, Zicong Hong, Qianli Liu, Quanxin Shou, Jian Lin, Song Guo, Xiaowei Shen, Xiangjun Huang, Dian Wang, Jian Yang

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie haben eine riesige Bibliothek voller Bücher (Large Language Models oder LLMs), die Sie in Ihrem Rucksack mitnehmen wollen. Das Problem ist, dass die Bücher so schwer und dick sind, dass Ihr Rucksack sie nicht halten kann und das Lesen ewig dauert.

Um dieses Problem zu lösen, beschließen Sie, die Bücher zu schrumpfen. Sie wollen sie auf winzige 4-Bit-"Tascheneditionen" (Quantisierung) schrumpfen. Das macht sie leicht und schnell lesbar. Es gibt jedoch einen Haken: Wenn Sie die Bücher zu stark schrumpfen, verlieren Sie die wichtigen Details.

Die meisten Bücher enthalten viele gewöhnliche, langweilige Wörter (wie „der“, „ist“, „und“), die leicht zu schrumpfen sind. Aber ab und zu gibt es ein seltenes, komplexes Wort oder eine dramatische Wendung in der Handlung (einen „Ausreißer“), die entscheidend für die Geschichte ist. Wenn Sie versuchen, diese seltenen Wörter auf dieselbe winzige Größe wie die gewöhnlichen Wörter zu schrumpfen, bricht die Geschichte zusammen und die KI beginnt, Fehler zu machen.

Der alte Weg: Das „VIP-Sektion“-Problem

Frühere Methoden versuchten, dies zu beheben, indem sie sagten: „Okay, lassen wir die seltenen, wichtigen Wörter in ihrem ursprünglichen, schweren Format (hohe Präzision) und schrumpfen nur die langweiligen.“

Dies hielt die Geschichte zwar genau, erzeugte aber ein neues Problem. Stellen Sie sich einen Bus vor, in dem die meisten Passagiere auf winzigen Klapphockern sitzen (die kleinen, komprimierten Daten), aber ein paar VIPs sitzen in riesigen, schweren Sesseln (den hochpräzisen Daten).

  • Das Problem: Der Busfahrer (der Computerchip) muss ständig die Gänge wechseln, um die verschiedenen Sitze zu handhaben. Er muss anhalten, die schweren Sessel bewegen und sie wieder zurückkonvertieren. Dieses Umschalten verlangsamt den Bus, was den Geschwindigkeitsvorteil, den man durch das Schrumpfen der anderen Passagiere gewonnen hat, zunichtemacht.

Der neue Weg: MosaicQuant

Die Autoren dieser Arbeit schlagen ein neues System namens MosaicQuant vor. Anstatt die VIPs in großen Sesseln zu behalten, lassen sie alle auf denselben winzigen Klapphockern sitzen (vereinheitlichte 4-Bit). Aber sie fügen einen cleveren Kniff hinzu, um mit den seltenen, schwierigen Wörtern umzugehen.

So funktioniert es, unter Verwendung einer „Mosaik“-Analogie:

1. Die Basisschicht (Das dichte 4-Bit)
Sie nehmen das ganze Buch und schrumpfen es auf eine einheitliche 4-Bit-Größe. Dies erfasst alle gewöhnlichen Wörter perfekt. Die seltenen, komplexen Wörter werden jedoch etwas verschwommen oder verzerrt, weil sie in das winzige Format gezwungen wurden.

2. Die „Stich“-Schicht (Das spärliche Residuum)
Anstatt den seltenen Wörtern einen ganz neuen, großen Sessel zu geben, erstellen sie ein winziges, unsichtbares „Patch“ oder einen „Stich“ nur für die Teile der Geschichte, die verschwommen geworden sind.

  • Sie flicken nicht das ganze Buch. Sie flicken nur die spezifischen Seiten, auf denen die Verzerrung am schlimmsten ist.
  • Dieses Patch ist ebenfalls 4-Bit, sodass es auf denselben winzigen Hocker passt.
  • Da sie nur einige wenige spezifische Stellen flicken (etwa 10 % des Buches), ist es sehr leicht und belastet den Rucksack nicht.

3. Die „Reißverschluss“-Engine (ZipperEngine)
Dies ist das Geheimrezept, das es schnell macht. In der alten „VIP“-Methode musste der Computer zwischen den schweren Sesseln und den winzigen Hockern umschalten.

  • Die MosaicQuant ZipperEngine fungt wie ein meisterhafter Schneider. Sie nimmt das Hauptbuch (das dichte Fundament) und die winzigen Patches (die spärlichen Residuen) und näht sie zusammen, während der Bus fährt.
  • Sie hält nicht an, um die Gänge zu wechseln. Sie verarbeitet den Haupttext und die Patches gleichzeitig in einer einzigen, fließenden Bewegung. Das bedeutet, dass der Computerchip niemals stoppen muss, um Daten zu „konvertieren“, wodurch die Geschwindigkeit hoch bleibt.

Warum das wichtig ist

Die Autoren haben dies an leistungsstarken KI-Modellen (wie LLaMA und Qwen) getestet und zwei Hauptergebnisse erzielt:

  1. Genauigkeit: Die Geschichten (KI-Ausgaben) blieben fast so perfekt wie die ursprünglichen, schweren Bücher. Die „Patches“ korrigierten die verschwommenen Teile so gut, dass die KI nicht an Intelligenz verlor.
  2. Geschwindigkeit: Da sie nicht zwischen verschiedenen Formaten umschalten mussten, lief die KI bis zu 1,24-mal schneller als die Standard-16-Bit-Version und viel schneller als andere Methoden, die versuchten, hohe und niedrige Präzision zu mischen.

Kurz gesagt: MosaicQuant ist wie das Schrumpfen einer ganzen Bibliothek auf Taschenformat, aber anstatt die wichtigen Teile wegzulassen oder sie schwer zu machen, fügt es winzige, leichte „Patches“ hinzu, um die Fehler zu beheben – und das alles, während der gesamte Leseprozess reibungslos und schnell bleibt.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →