← Neueste Arbeiten
🤖 machine learning

OASIS: Outlier-Aware LUT-Based GEMM with Dual-Side Quantization for LLM Inference Acceleration

OASIS ist eine auf Nachschlagetabellen basierende Architektur, die die LLM-Inferenz beschleunigt, indem sie eine effiziente allgemeine Matrixmultiplikation mit nicht-uniform quantisierten Gewichten und Aktivierungen durch beidseitige Quantisierung, Ausreißer-bewusste Fehlerkompensation und eine neuartige Top-k-Erkennungsmaschine ermöglicht und dabei signifikante Verbesserungen bei Geschwindigkeit, Energieeffizienz und Genauigkeit im Vergleich zu bestehenden Methoden erzielt.

Ursprüngliche Autoren: Xueying Wu, Baijun Zhou, Zhihui Gao, Yuzhe Fu, Qilin Zheng, Yintao He, Hai Li

Veröffentlicht 2026-06-03
📖 5 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Xueying Wu, Baijun Zhou, Zhihui Gao, Yuzhe Fu, Qilin Zheng, Yintao He, Hai Li

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie besitzen eine riesige Bibliothek voller Bücher (ein Large Language Model), die Geschichten schreiben, Fragen beantworten und Probleme lösen kann. Aber diese Bibliothek ist so gewaltig, dass sie ein riesiges Lagerhaus (Speicher) beansprucht und ein Team von tausenden Bibliothekaren (Computer) benötigt, nur um eine einzige Seite zu finden. Das macht sie langsam und teuer in der Anwendung.

Um dies zu beheben, versuchen Wissenschaftler normalerweise, die Bücher durch Zusammenfassungen in kleinere, einfachere Versionen zu schrumpfen (Quantisierung). Es gibt jedoch einen Haken:

  • Methode A (Weight-Only): Sie schrumpfen die Bücher, behalten aber die Referenzkarten in einem komplexen Format bei. Um sie zu nutzen, müssen Sie die Karten jedes Mal wieder in das ursprüngliche Format übersetzen. Diese Übersetzung dauert ewig.
  • Methode B (Standard Low-Precision): Sie schrumpfen alles in winzige, einfache Notizen. Das ist schnell, aber Sie verlieren so viele Details, dass die Geschichten Fehler machen.
  • Methode C (Non-Uniform): Sie erstellen ein spezielles, maßgeschneidertes Wörterbuch, in dem die häufigsten Wörter kurze Codes und seltene Wörter längere Codes erhalten. Dies bewahrt die Genauigkeit der Geschichten, aber Ihre derzeitigen Bibliothekare wissen nicht, wie sie dieses spezielle Wörterbuch lesen können, ohne es zuerst zu übersetzen, was die Geschwindigkeit ruiniert.

Hier kommt OASIS ins Spiel: Ein neues System, das darauf ausgelegt ist, diese speziellen, maßgeschneiderten Wörterbücher sofort zu lesen, ohne sie vorher übersetzen zu müssen.

So funktioniert OASIS, aufgeteilt in einfache Konzepte:

1. Der magische Spickzettel (Die LUT)

Stellen Sie sich vor, Sie spielen ein Spiel, bei dem Sie zwei Zahlen multiplizieren müssen. Anstatt die Mathematik jedes Mal neu durchzuführen, haben Sie einen riesigen Spickzettel (eine Lookup Table, oder LUT), auf dem die Antwort bereits aufgeschrieben steht.

  • Das Problem: Frühere Spickzettel waren zu groß, um in Ihre Tasche zu passen, oder sie änderten sich jedes Mal, wenn Sie spielten, sodass Sie sie ständig neu schreiben mussten.
  • Die OASIS-Lösung: OASIS verwendet einen „Kartesischen Produkt“-Spickzettel. Denken Sie an ein Gitter, bei dem eine Seite alle möglichen „Gewicht“-Codes und die andere Seite alle möglichen „Aktivierungs“-Codes auflistet. Da die Codes im Voraus definiert und gelernt wurden, kann OASIS diesen Spickzettel einmal drucken, bevor das Spiel beginnt.
  • Das Ergebnis: Dieser Spickzettel ist 64-mal kleiner als frühere Versionen, und weil er so kompakt ist, kann OASIS Antworten 1.024-mal schneller parallel abrufen. Es ist, als hätte man einen superschnellen Bibliothekar, der die Antwort von einer winzigen, gut organisierten Karte greift, anstatt zu einem massiven, sich ständig verändernden Archiv zu laufen.

2. Das „Ausreißer“-Problem (Die lauten Geräusche)

In diesen Modellen sind die meisten Zahlen leise und vorhersehbar (Inlier), aber einige wenige sind extrem laut und seltsam (Outlier). Wenn Sie versuchen, das ganze Buch zusammenzufassen, werden diese lauten Zahlen verzerrt, was die Geschichte ruiniert.

  • Der alte Weg: Um diese lauten Zahlen zu finden, hält der Bibliothekar inne, scannt die ganze Seite, findet die lauten Stellen und fängt dann erst an zu lesen. Dieses „Anhalten und Scannen“ verlangsamt alles.
  • Die OASIS-Lösung (Look-Ahead): OASIS nutzt einen cleveren Trick namens „Look-Ahead“.
    • Zweig 1 (Der Hauptleser): Liest die ganze Seite schnell und ignoriert die lauten Geräusche für einen Moment. Er liefert eine „erste grobe Entwurfsantwort“.
    • Zweig 2 (Der Lärmreiniger): Läuft parallel dazu und sucht gezielt nach diesen lauten Zahlen. Er berechnet genau, wie sehr der „grobe Entwurf“ aufgrund des Lärms falsch war, und erstellt eine „Korrekturnotiz“.
    • Die Verschmelzung: Am Ende werden der grobe Entwurf und die Korrekturnotiz zusammenaddiert.
    • Das Ergebnis: Das System muss nie anhalten und warten, um die lauten Zahlen zu finden. Es erledigt beide Aufgaben gleichzeitig, sodass die Geschwindigkeit nicht sinkt.

3. Die „Orizuru“-Engine (Der Papierkranich-Jäger)

Um den „Lärmreiniger“-Zweig schnell zu machen, haben die Forscher ein spezielles Werkzeug namens Orizuru gebaut (benannt nach einem Papierkranich).

  • Stellen Sie sich vor, Sie haben einen Stapel von 1.000 Papieren und müssen sofort die 5 schwersten und die 5 leichtesten finden. Eine normale Person würde sie einzeln aufheben.
  • Orizuru ist wie eine intelligente Sortiermaschine, die eine „Turnier“-Struktur verwendet. Sie paart Papiere zusammen, eliminiert die leichteren in einem „Max“-Turnier und die schwereren in einem „Min“-Turnier, während sie die Ergebnisse wiederverwendet. Sie findet die Ausreißer mit minimalem Aufwand und stellt sicher, dass der „Lärmreiniger“-Zweig nicht stecken bleibt.

Die abschließende Bilanz

Das Paper testete OASIS gegen die besten bestehenden Methoden:

  • Genauigkeit: Es verlor nur etwa 1,94 % der ursprünglichen Qualität (im Vergleich zum vollständigen, unkomprimierten Modell). Das ist viel besser als andere schnelle Methoden, die oft 6 % oder mehr verlieren.
  • Geschwindigkeit: Es ist 3-mal schneller als die derzeit beste spezialisierte Hardware (FIGLUT).
  • Energie: Es verbraucht 1,44-mal weniger Energie, um dieselbe Aufgabe zu erledigen.

Zusammenfassend: OASIS ist eine neue Art, intelligente KI-Modelle auszuführen, die die Daten schrumpft, ohne die Geschichte zu verlieren, einen vorgefertigten Spickzettel nutzt, um Berechnungen sofort durchzuführen, und ein paralleles „Korrektur-Team“ einsetzt, um Fehler direkt vor Ort zu beheben – und das alles, ohne den Prozess zu verlangsamen.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →