← Neueste Arbeiten
🤖 machine learning

Finer is Better (with the Right Scaling)

Dieser Beitrag löst das Paradoxon, dass schrumpfende Quantisierungsblockgrößen die Leistung von Large Language Modellen verschlechtern, indem er nachweist, dass das Problem aus der ungünstigen Wechselwirkung von heavy-tailed-Verteilungen mit FP4-Formaten resultiert, und zeigt, dass gezielte algorithmische Eingriffe wie 4-over-6-Skalierung und Unterlaufverhinderung es standardkonformen Hardwareformaten ermöglichen, mit feinerer Granularität eine optimale Qualität zu erreichen.

Ursprüngliche Autoren: Clemens Schaefer, Gil Tabak

Veröffentlicht 2026-05-12
📖 5 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Clemens Schaefer, Gil Tabak

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Das große Problem: Das „Zu-fein"-Paradoxon

Stellen Sie sich vor, Sie versuchen, einen Koffer für eine Reise zu packen. Sie haben einen riesigen Haufen Kleidung (Daten) und nur begrenzten Platz (Speicher). Um alles unterzubringen, beschließen Sie, die Kleidung in immer kleinere Bündel (sogenannte Blöcke) zu schneiden, damit Sie sie effizienter organisieren können.

Intuitiv würde man denken: „Je kleiner die Bündel, desto besser kann ich alles unterbringen, oder?"

In der Welt der KI nennt man dies Quantisierung. Wissenschaftler versuchten, diese Bündel zu verkleinern, um KI-Modelle kleiner und schneller zu machen. Doch sie stießen auf ein seltsames Paradoxon: Als sie die Bündel zu klein machten, wurde die KI bei ihrer Aufgabe tatsächlich schlechter. Es war so, als würde man einen Koffer so sorgfältig packen, dass man am Ende die Kleidung zerquetscht und unbrauchbar macht.

Warum ist das passiert?

Die Autoren dieses Papiers untersuchten, warum dieses „zu-feine" Paradoxon auftrat. Sie fanden zwei Hauptschuldige:

1. Der „Null"-Fehler (Die leere Box)
Stellen Sie sich eine Box vor, die nur Zahlen aufnehmen kann. Wenn eine Zahl winzig ist, könnte das Lineal der Box sie auf Null runden. Wenn Sie ein ganzes Bündel winziger Zahlen haben, könnte das Lineal sagen: „Okay, alles in diesem Bündel ist Null", und das ganze Bündel wegwerfen.

  • Die Lösung: Das Papier schlägt eine einfache Regel vor: Lassen Sie das Lineal niemals Null sagen. Wenn eine Zahl zu klein ist, zwingen Sie das Lineal, die kleinstmögliche positive Zahl zu verwenden. Dadurch bleibt die Information erhalten.

2. Das „Grobe Lineal"-Problem (Das grobe Gitter)
Dies ist das größere Problem. Die KI verwendet eine bestimmte Art von „Lineal" (genannt E4M3), um diese Bündel zu messen. Dieses Lineal hat sehr große Lücken zwischen seinen Markierungen, besonders am oberen Ende.

  • Die Analogie: Stellen Sie sich vor, Sie versuchen, eine Gebirgslandschaft mit einem Lineal zu vermessen, das nur Markierungen für 1 Fuß, 2 Fuß, 4 Fuß und 6 Fuß hat.
    • Wenn Sie einen kleinen Hügel haben (ein kleiner Datenblock), könnte das Lineal Sie zwingen, einen 5,9-Fuß-Hügel auf 6 Fuß aufzurunden. Das ist ein riesiger Fehler!
    • Wenn Sie die Bündel kleiner machen, landen Sie mit mehr dieser „hohen" Zahlen, die in diesen großen, ungeschickten 6-Fuß-Eimer gezwungen werden. Je kleiner das Bündel, desto häufiger passiert diese schlechte Rundung, und desto schlechter performt die KI.

Die Lösungen: Wie sie es behoben haben

Die Autoren testeten drei Hauptwege, um dies zu beheben, und bewiesen, dass feinere Blöcke besser sind, aber nur, wenn Sie die richtigen Werkzeuge verwenden.

1. Die „Nicht zur Null gehen"-Regel
Sie programmierten das System einfach so, dass es niemals zulässt, dass ein Skalierungsfaktor Null wird.

  • Ergebnis: Dies löste das Problem für winzige Zahlen, aber es löste das Problem nicht für die „hohen" Zahlen, die auf 6 aufgerundet wurden.

2. Die „4-oder-6"-Wahl (Die 4-über-6-Methode)
Dies ist das „Geheimrezept" des Papiers. Anstatt ein festes Lineal zu verwenden, kann das System für jedes Bündel zwischen zwei spezifischen Einstellungen wählen: 4 oder 6.

  • Die Analogie: Stellen Sie sich vor, Sie packen eine Box. Manchmal passen Ihre Gegenstände am besten in eine „Mittelgroße" Box (4), und manchmal passen sie am besten in eine „Große" Box (6). Anstatt alles in eine „Große" Box zu zwingen (was die kleinen Sachen zerquetscht), prüft das System: „Welche dieser beiden Boxen passt am besten zu diesem spezifischen Bündel?"
  • Ergebnis: Dies ermöglichte es der KI, die ungeschickten Rundungsfehler zu vermeiden. Als sie diese Methode anwandten, verschwand das „Paradoxon". Kleinere Bündel wurden plötzlich viel besser, genau wie es sein sollte.

3. Der „Brute-Force"-Check
Um ihren Standpunkt zu beweisen, führten sie eine Computersuche durch, die jeden möglichen Weg zum Messen der Bündel ausprobierte, um den perfekten zu finden.

  • Ergebnis: Dies bewies, dass theoretisch kleinere Bündel immer besser funktionieren, wenn man die perfekte Messung auswählt. Dass die KI zuvor versagte, lag nicht daran, dass kleine Bündel schlecht sind; es lag einfach daran, dass sie eine schlechte Messmethode verwendeten.

Der Realwelt-Test: Funktioniert das bei echter KI?

Sie testeten dies an vier berühmten KI-Modellen (Granite, Llama, DeepSeek und Qwen).

  • Das Problem: Zwei der Modelle (Granite und Llama) wurden schlechter, als die Bündel kleiner wurden, genau wie das Paradoxon vorhersagte.
  • Die Lösung: Als sie die „4-oder-6"-Wahl und die „Nicht zur Null gehen"-Regel anwandten, hörten diese Modelle auf, schlechter zu werden. Tatsächlich wurden sie besser, je kleiner die Bündel wurden.
  • Der Vergleich: Sie versuchten auch, ein ausgefalleneres, teureres Lineal (genannt UE5M3) zu verwenden, das mehr Markierungen hat. Das funktionierte ebenfalls gut, erfordert jedoch mehr Hardware-Leistung. Ihr „4-oder-6"-Trick ermöglichte es ihnen, das billigere, Standard-Lineal zu verwenden und die gleichen großartigen Ergebnisse zu erzielen.

Das Fazit

Das Papier kommt zu dem Schluss, dass KI-Modelle kleiner und effizienter zu machen (durch winzige Blöcke) eine großartige Idee ist. Der Grund, warum es zuvor versagte, war kein Fehler in der Idee selbst, sondern ein Fehler im verwendeten „Maßband".

Durch die Verwendung einer intelligenteren Methode zur Auswahl, wie die Daten gemessen werden (insbesondere die „4-über-6"-Methode), können wir KI-Modelle kleiner, schneller und genauer machen, ohne teure neue Hardware zu benötigen. Das Paradoxon ist gelöst: Feiner ist tatsächlich besser, solange man die richtige Skalierung hat.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →