← Neueste Arbeiten
💬 NLP

Is Finer Better? The Limits of Microscaling Formats in Large Language Models

Diese Arbeit zeigt auf, dass kleinere Blockgrößen bei der Mikroskalierung-Quantisierung paradoxerweise die Modellleistung verschlechtern können, was auf das Zusammenspiel zwischen engen Tensorverteilungen und einem begrenzten Skalen-Dynamikbereich zurückzuführen ist, woraufhin die Autoren ein neuartiges FP8-unsigned E5M3-Format für Skalen vorschlagen, das die Genauigkeit beibehält und gleichzeitig die Notwendigkeit globaler Skalierungsoperationen eliminiert.

Ursprüngliche Autoren: Andrea Fasoli, Monodeep Kar, Chi-Chun Liu, Swagath Venkataramani, Viji Srinivasan, Leland Chang, Naigang Wang

Veröffentlicht 2026-01-28
📖 5 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Andrea Fasoli, Monodeep Kar, Chi-Chun Liu, Swagath Venkataramani, Viji Srinivasan, Leland Chang, Naigang Wang

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Das große Ganze: Das Modell schrumpfen

Stellen Sie sich vor, ein Large Language Model (LLM) ist wie eine riesige Bibliothek des Wissens. Um diese Bibliothek in einen kleinen Rucksack zu bekommen (damit sie auf Handys schnell läuft oder Energie spart), versuchen Wissenschaftler, die Bücher zu schrumpfen. Sie tun dies durch „Quantisierung“, was bedeutet, Zahlen abzurunden, um weniger Bits zu verwenden (wie etwa „3,14“ einfach als „3“ zu schreiben).

Vor Kurzem wurde eine neue Technik namens Mikroskalierung (Microscaling) populär. Anstatt ein einziges Lineal zu verwenden, um die gesamte Bibliothek zu messen, begannen sie, winzige, individuelle Lineale für kleine Gruppen von Büchern zu verwenden. Die Logik dahinter war: „Je kleiner die Gruppe, desto genauer können wir die Bücher darin messen.“

Die Überraschung: Kleiner ist nicht immer besser

Die Forscher in dieser Arbeit entdeckten einen seltsamen Fehler. Sie erwarteten, dass das Verkleinern der Gruppen (oder „Blöcke“) das Modell immer intelligenter machen würde. Aber sie fanden das Gegenteil heraus, und zwar bei bestimmten Modellen.

Die Analogie: Das Lineal mit den fehlenden Markierungen
Stellen Sie sich vor, Sie messen einen sehr kleinen Kieselstein.

  • Der alte Weg: Sie benutzen ein riesiges Lineal mit Markierungen alle Zoll. Sie können den Kieselstein nicht gut messen, also raten Sie.
  • Der neue Weg (Mikroskalierung): Sie wechseln zu einem winzigen Lineal, das perfekt zum Kieselstein passt. Das sollte besser sein, oder?
  • Das Problem: Das winzige Lineal hat ein defektes Merkmal. Sein „Nullpunkt“ und seine kleinsten Markierungen liegen zu weit auseinander. Wenn der Kieselstein zu klein ist, kann das Lineal ihn gar nicht erst sehen. Es sagt einfach: „Das ist Null.“

Die Arbeit fand heraus, dass wenn die „Blöcke“ der Daten zu klein werden, das „Lineal“ (genannt Scale), das verwendet wird, um sie zu messen, an Präzision verliert. Es kann keine sehr kleinen Zahlen mehr darstellen. Obwohl Sie also eine kleinere Gruppe messen, verlieren Sie tatsächlich mehr Informationen, weil das Lineal für solch winzige Dinge zu klobig ist.

Dies verursachte ein Phänomen, das die Autoren „Perplexity Inversion“ nennen. Normalerweise wird das Modell besser, wenn man die Blöcke schrumpft. Aber mit diesem Fehler wird das Modell plötzlich schlechter, sobald die Blöcke zu klein werden.

Warum passiert das?

Die Forscher sind der Mathematik auf den Grund gegangen und fanden den Übeltäter: Die Skala (Scale).

In diesem System hat jede Gruppe von Zahlen eine „Skala-Zahl“, die dem Computer sagt, wie groß die Zahlen in dieser Gruppe sind.

  1. Breite Gruppen: Wenn eine Gruppe große und kleine Zahlen hat, ist die Skala groß. Das Lineal funktioniert gut.
  2. Schmale Gruppen: Wenn eine Gruppe nur winzige Zahlen hat (wie 0,0001), muss die Skala winzig sein, um sie genau zu messen.
  3. Der Fehler: Die aktuelle Hardware verwendet eine bestimmte Art von Lineal (genannt FP8 E4M3), das einen begrenzten Bereich hat. Es kann keine Skalen handhaben, die zu klein sind. Wenn die Blockgröße schrumpft, werden die Zahlen innerhalb des Blocks so klein, dass die „kleinste Einstellung“ des Lineals immer noch zu groß ist. Der Computer rundet alles auf Null ab, und das Modell vergisst die Information.

Die Lösung: Ein besseres Lineal

Die Autoren haben das Problem nicht nur aufgezeigt, sondern auch ein besseres Werkzeug gebaut, um es zu beheben.

Sie schlugen ein neues Format vor, das FP8 Unsigned E5M3 (UE5M3) heißt.

  • Die Korrektur: Stellen Sie sich das alte Lineal als ein Werkzeug mit 4 Markierungen für die „Größe“ (Exponent) und 3 Markierungen für die „Detailgenauigkeit“ (Mantisse) vor.
  • Das Upgrade: Sie nahmen ein ungenutztes Bit (einen winzigen Schalter) und verwandelten es in eine zusätzliche „Größen“-Markierung. Jetzt hat das Lineal 5 Markierungen für die Größe und 3 für die Detailgenauigkeit.

Warum das hilft:
Dieses neue Lineal kann viel, viel kleinere Zahlen messen, ohne sie auf Null abzurunden. Es verlängert das „untere Ende“ des Lineals, sodass es diese winzigen Kieselsteine klar sehen kann.

Die Ergebnisse

Die Forscher testeten dieses neue Lineal an mehreren KI-Modellen (wie Llama und Granite).

  • Ohne die Korrektur: Wenn sie die Blöcke sehr klein machten, wurden die Modelle verwirrt und machten mehr Fehler.
  • Mit dem neuen Lineal (UE5M3): Die Modelle blieben genau, selbst mit winzigen Blöcken. Tatsächlich schnitt es genauso gut ab wie ein komplizierter Umweg, bei dem man die Zahlen manuell strecken musste, bevor man sie maß – allerdings ohne diesen zusätzlichen, teuren Schritt zu benötigen.

Zusammenfassung

Die Arbeit lehrt uns, dass bei der KI-Kompression kleiner nicht immer besser ist. Wenn Sie Ihre Datengruppen zu stark schrumpfen, zerstören Sie möglicherweise das Messwerkzeug, das Sie verwenden, um sie zu lesen. Durch die einfache Anpassung des Designs dieses Messwerkzeugs (Hinzufügen eines zusätzlichen Bits an Reichweite) haben sie den Fehler behoben und ermöglicht es KI-Modellen, effizienter komprimiert zu werden, ohne ihre Intelligenz zu verlieren.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →