← Neueste Arbeiten
🔢 mathematics

High-Rate Quantized Matrix Multiplication I

Dieser Artikel untersucht den fundamentalen informationstheoretischen Trade-off zwischen Quantisierungsrate und Verzerrung bei der generischen Matrixmultiplikation ohne vorherige statistische Kalibrierung, analysiert und leitet dabei zugleich heuristische Approximationen für gängige Quantisierungsschemata wie absmax INT und Gleitkomma her.

Ursprüngliche Autoren: Or Ordentlich, Yury Polyanskiy

Veröffentlicht 2026-05-14
📖 5 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Or Ordentlich, Yury Polyanskiy

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie versuchen, einen riesigen, hochauflösenden Film durch einen winzigen, engen Tunnel zu senden. Der Film repräsentiert die komplexe Mathematik innerhalb eines Large Language Models (wie derjenigen, die Chatbots antreiben), und der Tunnel repräsentiert den Arbeitsspeicher und die Verarbeitungsgeschwindigkeit des Computers. Wenn Sie versuchen, den gesamten, unkomprimierten Film hindurchzudrücken, verstopft der Tunnel, und der Computer verlangsamt sich bis zum Stillstand.

Um dies zu beheben, verwenden Ingenieure Quantisierung. Stellen Sie sich dies vor wie das Komprimieren dieses hochauflösenden Films in eine niedrigauflösende, pixelige Version. Es ist nicht perfekt, aber es passt viel schneller durch den Tunnel, und das Bild ist immer noch erkennbar genug zum Anschauen.

Dieses Papier, verfasst von Or Ordentlich und Yury Polyanskiy, ist wie ein theoretischer Physikbericht über Kompression. Anstatt nur verschiedene Komprimierungswerkzeuge zu testen, um zu sehen, welches in der Praxis am besten funktioniert, fragen die Autoren: "Was ist das absolute, mathematische Limit dafür, wie gut wir diese Daten komprimieren können, bevor sie zu Müll werden?"

Hier ist eine Aufschlüsselung ihrer Erkenntnisse mit einfachen Analogien:

1. Die zwei Arten von „Kompression"

Die Autoren weisen auf eine Verwirrung hin, wie Mathematiker und Ingenieure über die „Rate" (wie viel Daten wir behalten) sprechen.

  • Die Sicht des Mathematikers: Stellen Sie sich vor, Sie nehmen einen ganzen Block von Pixeln und komprimieren sie alle zusammen in einen einzigen, cleveren Code. Dies ist der effizienteste Weg, aber es ist unglaublich schwierig, dies in Echtzeit zu tun.
  • Die Sicht des Ingenieurs: Stellen Sie sich vor, Sie betrachten jedes Pixel einzeln und sagen: „Du bist ein bisschen zu hell, also runde ich dich einfach auf die nächste Standardfarbe ab." So funktionieren aktuelle KI-Chips (unter Verwendung von Formaten wie INT8 oder FP8). Es ist schnell und einfach, aber die Autoren argumentieren, dass es nicht so effizient ist wie das theoretische Limit.

2. Die „Hoch-Rate"-Annahme

Das Papier konzentriert sich auf ein Szenario, in dem die Kompression nicht zu extrem ist (wie die Umwandlung eines Films in eine Strichzeichnung). Sie gehen davon aus, dass wir genügend Details behalten, sodass das „Rauschen" (die durch Rundung eingeführten Fehler) gering ist.

  • Die Analogie: Stellen Sie sich vor, Sie versuchen, einen Tisch mit einem Lineal zu messen. Wenn Ihr Lineal winzige, präzise Markierungen hat (hohe Rate), ist der Fehler nur ein winziger Bruchteil eines Millimeters. Wenn Sie ein Lineal mit riesigen Lücken verwenden (niedrige Rate), ist der Fehler massiv. Die Autoren gehen davon aus, dass wir das präzise Lineal verwenden, was es ihnen ermöglicht, einfache Mathematik zu verwenden, um die Fehler vorherzusagen.

3. Das „Perfekte" vs. das „Reale"

Die Autoren berechneten das Fundamentale Limit: die bestmögliche Genauigkeit, die Sie jemals erreichen könnten, wenn Sie ein magisches Komprimierungswerkzeug hätten, das das gesamte Bild auf einmal betrachten könnte.

  • Das Ergebnis: Sie stellten fest, dass bei einem perfekten System der Fehler sehr schnell abnimmt, wenn Sie mehr Bits hinzufügen (mehr Details).
  • Der Realitätscheck: Anschließend untersuchten sie beliebte Werkzeuge, die heute in der KI verwendet werden, wie INT (Ganzzahl) und FP (Gleitkomma) Formate.
    • Das Problem: Diese Werkzeuge verwenden oft eine „Einheitsgröße für alle"-Skalierungsmethode (wie die Verwendung desselben Lineals für einen riesigen Elefanten und eine winzige Maus). Wenn die Daten einige riesige Zahlen und viele kleine enthalten, wird das Lineal gedehnt, um die großen zu passen, wodurch die kleinen wie verschwommene Punkte aussehen.
    • Die Lösung: Sie stellten fest, dass wenn Sie die Daten drehen (wie das Drehen eines Bildes, damit die gezackten Ränder mit dem Gitter ausgerichtet sind), bevor Sie sie komprimieren, die „Verschmierung" viel gleichmäßiger und vorhersagbarer wird. Dies ist eine Technik namens zufällige Rotation.

4. Die „Schrumpfung"-Überraschung

Eine interessante Erkenntnis betrifft das „Schrumpfen".

  • Die Analogie: Wenn Sie ein Foto komprimieren und dann versuchen, es zu dekomprimieren, ist die beste Schätzung für das Original nicht einfach das dekomprimierte Foto; es ist tatsächlich eine leicht „geschrumpfte" Version davon.
  • Die Sicht des Papiers: Obwohl dieser „Schrumpf"-Effekt existiert, stellten die Autoren fest, dass in der Welt hoher Qualität (hohe Rate), die sie untersuchen, der Vorteil so winzig ist, dass wir ihn sicher ignorieren können, um die Mathematik einfach zu halten.

5. Testen der Werkzeuge

Die Autoren testeten ihre Theorien gegen reale Daten aus einem beliebten KI-Modell (Llama 3).

  • INT vs. FP: Sie stellten fest, dass für Standard-Ganzzahlformate (INT) das vorherige Drehen der Daten entscheidend ist. Ohne Rotation kann der Fehler enorm sein. Mit Rotation sinkt der Fehler auf nahezu das theoretische Limit.
  • Gleitkomma (FP): Überraschenderweise ist das Drehen der Daten bei Gleitkommaformaten tatsächlich schädlich. Die Autoren erklären, dass die Art und Weise, wie diese Formate Zahlen handhaben, die „gezackten Ränder" auf natürliche Weise besser bewältigt, sodass das Drehen der Daten die Dinge nur durcheinanderbringt.
  • NestQuant: Sie untersuchten eine neue, ausgefeilte Methode namens NestQuant (die komplexe geometrische Formen namens „Gitter" anstelle einfacher Würfel verwendet). Sie stellten fest, dass sie deutlich besser abschneidet als die Standardwerkzeuge und näher an dieses „magische" theoretische Limit herankommt.

Das Fazit

Dieses Papier liefert einen Bauplan für die Zukunft der KI-Kompression. Es sagt uns:

  1. Es gibt eine harte mathematische Grenze dafür, wie gut wir KI-Mathematik komprimieren können.
  2. Aktuelle Werkzeuge (wie INT8 und FP8) sind gut, lassen aber oft „Bits an Genauigkeit" auf dem Tisch liegen, weil sie die Form der Daten nicht berücksichtigen.
  3. Rotation ist ein mächtiger Trick, aber ein zweischneidiges Schwert: Sie hilft der Ganzzahlmathematik, schadet aber der Gleitkomma-Mathematik.
  4. Neuere, komplexere Methoden (wie NestQuant) beginnen, die Lücke zwischen dem, was wir tun, und dem, was mathematisch möglich ist, zu schließen.

Kurz gesagt sagt das Papier: „Wir kennen die Geschwindigkeitsbegrenzung der Autobahn. Aktuelle Autos fahren schnell, aber wenn wir den Motor anpassen (durch Verwendung von Rotation oder besseren Gittern), können wir dieser Geschwindigkeitsbegrenzung viel näher kommen, ohne zu crashen."

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →