← Neueste Arbeiten
🤖 machine learning

FairyFuse: Multiplication-Free LLM Inference on CPUs via Fused Ternary Kernels

Das Paper stellt FairyFuse vor, ein Inferenzsystem für Large Language Models auf CPUs, das durch die Fusion von ternären Gewichten in AVX-512-Kernen Multiplikationen eliminiert und so eine bis zu 29,6-fache Beschleunigung bei nahezu verlustfreier Qualität erreicht.

Ursprüngliche Autoren: Fei Zuo, Xiaoyan Xi, Quanyi Zeng, Feiyu Wang, Ho Fai Leung

Veröffentlicht 2026-04-24
📖 4 Min. Lesezeit☕ Kaffeepausen-Lektüre

Ursprüngliche Autoren: Fei Zuo, Xiaoyan Xi, Quanyi Zeng, Feiyu Wang, Ho Fai Leung

Originalarbeit unter CC0 1.0 der Gemeinfreiheit gewidmet (http://creativecommons.org/publicdomain/zero/1.0/). ✨ Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Das Problem: Der riesige Bibliothekar ohne Hände

Stell dir vor, du hast einen riesigen Bibliothekar (das KI-Modell), der auf einem normalen Computer (dem CPU) arbeitet. Dieser Bibliothekar ist extrem schlau, aber er hat ein riesiges Problem:

  1. Er ist zu schwer: Seine Bücher (die Daten) sind so groß, dass sie kaum in den kleinen Schreibtisch (den Arbeitsspeicher) passen.
  2. Er ist zu langsam: Er muss ständig aus dem Keller (dem Hauptspeicher) neue Bücher holen. Das ist wie ein Marathonlauf für den Bibliothekar. Er rennt den ganzen Tag, um Bücher zu holen, aber kaum hat er eines, muss er schon das nächste holen. Die eigentliche Arbeit (das Lesen und Verstehen) kommt kaum vor.

Bisher haben Entwickler versucht, die Bücher zu verkleinern, indem sie sie zusammengequetscht haben (Quantisierung). Aber wenn der Bibliothekar ein Buch liest, muss er es erst wieder „aufblasen" (dequantisieren) und dann mit einem Taschenrechner (Multiplikation) rechnen. Das kostet Zeit und Energie.

Die Lösung: FairyFuse – Der Bibliothekar mit einem neuen Trick

Die Forscher von FairyFuse haben eine geniale Idee entwickelt, wie man diesen Bibliothekar auf normalen Computern extrem schnell machen kann, ohne dass er einen teuren Grafikchip (GPU) braucht.

Hier ist der Trick in drei Schritten:

1. Die Sprache vereinfachen (Von „Rechnen" zu „Hinzu- oder Wegnehmen")

Normalerweise muss der Bibliothekar bei jedem Wort eine komplizierte Multiplikation machen (z. B. 3,14 × 5,2). Das ist wie das Berechnen einer komplexen Steuererklärung für jedes einzelne Buch.

FairyFuse sagt: „Lass uns die Sprache ändern!"
Statt Zahlen wie 3,14 oder 5,2 nutzen wir nur drei einfache Symbole:

  • +1 (Mach das Buch noch einmal dazu)
  • -1 (Nimm das Buch weg)
  • 0 (Ignoriere das Buch)

Die Analogie: Stell dir vor, du hast einen Stapel Karten.

  • Bei +1 legst du die Karte auf den Stapel.
  • Bei -1 nimmst du eine Karte vom Stapel.
  • Bei 0 tust du gar nichts.
    Du musst nicht mehr rechnen, du musst nur noch handeln. Das ist viel schneller!

2. Das Paket-Verpacken (Ternary Kernels)

Da diese Symbole (+1, -1, 0) so einfach sind, können wir sie winzig verpacken.

  • Normalerweise braucht ein Buch (eine Zahl) einen ganzen großen Karton (32 Bit).
  • Mit FairyFuse passen 16 Bücher in einen einzigen kleinen Briefumschlag (32 Bit), weil sie so klein sind.

Das ist wie ein riesiger Umzug: Statt 16 große Möbelstücke zu transportieren, hast du jetzt nur noch einen kleinen Koffer. Der Bibliothekar muss viel weniger laufen, um die Bücher zu holen.

3. Der „Fusion"-Effekt (Alles in einem Rutsch)

Das ist der wichtigste Teil des Papiers. Die KI-Modelle von „Fairy2i" (die die Bücher vorbereitet haben) sind etwas kompliziert aufgebaut. Sie bestehen aus 8 verschiedenen Teilaufgaben, die normalerweise nacheinander erledigt werden.

  • Der alte Weg: Der Bibliothekar macht Aufgabe 1, geht zum Schreibtisch, macht Aufgabe 2, geht wieder zum Schreibtisch... Das ist wie ein Pendler, der 8 Mal pro Tag zur Arbeit fährt. Viel Zeitverschwendung!
  • Der FairyFuse-Weg: Der Bibliothekar macht alle 8 Aufgaben in einem einzigen Durchgang. Er packt alles in einen Rucksack und erledigt es, während er nur einmal zum Schreibtisch läuft.

Warum ist das so schnell? (Der Roofline-Vergleich)

Die Forscher haben herausgefunden, dass dieser Trick auf Computern (CPUs) Wunder wirkt, aber auf Grafikkarten (GPUs) eher nicht.

  • Auf dem Computer (CPU): Der Computer ist wie ein kleiner Lieferwagen mit wenig Ladekapazität (wenig Speicherbandbreite). Da FairyFuse die Bücher so stark komprimiert (16-mal kleiner), passt viel mehr auf einmal in den Wagen. Der Lieferwagen muss viel weniger Fahrten machen. Das Ergebnis: Der Computer wird fast 30-mal schneller!
  • Auf der Grafikkarte (GPU): Die Grafikkarte ist wie ein riesiger Güterzug mit unendlicher Kapazität. Für den Zug ist es egal, ob die Pakete klein oder groß sind; er fährt trotzdem nur einmal. Der Trick mit dem kleinen Koffer bringt dem Zug keinen Vorteil.

Das Ergebnis in der Praxis

Die Forscher haben ihr System auf einem normalen Server-Computer getestet:

  • Geschwindigkeit: Es generiert 32,4 Wörter pro Sekunde. Das ist schneller als die besten bisherigen Methoden (wie llama.cpp), die noch Multiplikationen nutzen.
  • Qualität: Die KI ist immer noch extrem schlau. Sie macht fast keine Fehler im Vergleich zum Originalmodell.
  • Speicher: Das Modell braucht nur noch 3,3 GB Speicher (statt 13,5 GB beim Original). Das passt auf einen normalen Laptop!

Zusammenfassung

FairyFuse ist wie ein genialer Umzugshelfer, der:

  1. Die schweren Möbel (Daten) in winzige, leichte Pakete zerlegt.
  2. Statt schwerer Kistenhebe-Maschinen (Multiplikation) nur noch einfaches Tragen und Ablegen (Addition/Subtraktion) nutzt.
  3. Alle Aufgaben in einem einzigen, effizienten Rutsch erledigt.

Dadurch können wir riesige, intelligente KIs auf normalen Computern laufen lassen, die schnell, privat (da keine Cloud nötig ist) und energieeffizient sind. Es ist ein großer Schritt in Richtung „KI auf jedem Laptop".

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →