← Neueste Arbeiten
🤖 machine learning

Efficient Mixture-of-Experts LLM Inference with Apple Silicon NPUs

Die Arbeit stellt NPUMoE vor, eine Laufzeit-Inferenzengine, die Mixture-of-Experts-LLMs auf Apple Silicon durch die Auslagerung statischer Berechnungen auf den Neural Engine und die Verwendung von Kalibrierungsstrategien für dynamische Operationen beschleunigt und dabei Latenz, Energieverbrauch und CPU-Auslastung erheblich reduziert.

Ursprüngliche Autoren: Afsara Benazir, Felix Xiaozhu Lin

Veröffentlicht 2026-04-22
📖 5 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Afsara Benazir, Felix Xiaozhu Lin

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Das große Problem: Der überforderte Chef und die Spezialisten

Stell dir vor, du hast einen riesigen, genialen KI-Assistenten (ein sogenanntes „Large Language Model" oder LLM), der auf deinem iPhone oder Mac läuft. Dieser Assistent ist wie ein riesiges Büro mit tausenden von Spezialisten (die sogenannten „Experten").

Normalerweise würde der Assistent für jede deiner Fragen alle Spezialisten gleichzeitig anrufen, um eine Antwort zu finden. Das wäre aber viel zu langsam und würde den Akku in Sekunden leer saugen.

Deshalb nutzen moderne KIs eine clevere Methode namens MoE (Mixture of Experts):

  • Statt alle Spezialisten zu rufen, schaut sich der Assistent zuerst deine Frage an.
  • Er entscheidet dann: „Für diese Frage brauche ich nur zwei dieser tausenden Spezialisten."
  • Die anderen 998 bleiben ruhig. Das spart enorm viel Zeit und Energie.

Das Problem: Dein Computer (der Chip in deinem Apple-Gerät) hat einen speziellen, super-schnellen Helfer für solche Aufgaben: den NPU (Neural Engine). Dieser NPU ist wie ein hochspezialisiertes Fließband. Er ist extrem schnell, aber er ist auch sehr stur.

  • Er mag keine Überraschungen.
  • Er mag keine unregelmäßigen Aufgaben.
  • Er braucht einen festen Plan: „Ich mache genau 100 Schritte, dann bin ich fertig."

Das Problem bei den MoE-Modellen ist aber: Niemand weiß vorher, welche Spezialisten arbeiten müssen.

  • Bei Frage A arbeiten Spezialist 1 und 5.
  • Bei Frage B arbeiten Spezialist 10 und 99.
  • Manchmal kommen 100 Fragen auf einmal, manchmal nur eine.

Wenn man versucht, diesen chaotischen, dynamischen Prozess auf den sturen NPU zu laden, passiert Folgendes:

  1. Der NPU muss ständig angehalten werden, um neue Pläne zu machen (zu viel Wartezeit).
  2. Der normale Prozessor (CPU) muss ständig dazwischengehen, um zu entscheiden, wer was macht. Das kostet Energie und verlangsamt alles.
  3. Das Ergebnis: Der Akku ist schnell leer und das Gerät wird langsam.

Die Lösung: NPUMoE – Der clevere Manager

Die Forscher (Afsara Benazir und Felix Lin) haben eine neue Software namens NPUMoE entwickelt. Sie ist wie ein genialer Manager, der den chaotischen MoE-Prozess so umorganisiert, dass der sture NPU endlich effizient arbeiten kann, ohne dass der Akku leidet.

Hier sind die drei Tricks, die sie angewendet haben:

1. Die „Klassen-Einteilung" (Statische Stufen)

Das Problem: Da nicht bekannt ist, wie viele Fragen ein Spezialist bekommt, müsste der NPU eigentlich für den „schlimmsten Fall" (z. B. 1000 Fragen) vorbereitet sein. Das wäre aber riesig und ineffizient.
Die Lösung: Der Manager teilt die Spezialisten in drei Klassen ein:

  • Klasse A (Die Stars): Diese Spezialisten bekommen fast immer viele Fragen. Sie bekommen einen großen, festen Platz zugewiesen.
  • Klasse B (Die Durchschnittlichen): Für diese reicht ein mittlerer Platz.
  • Klasse C (Die Seltenen): Diese bekommen nur einen kleinen Platz.
  • Der Trick: Wenn ein Spezialist mehr Fragen bekommt, als sein Platz erlaubt, werden die „unwichtigsten" Fragen einfach verworfen (wie ein Brief, der nicht ins Postfach passt). Da die KI aber sehr robust ist, merkt man davon kaum etwas. Der NPU muss sich jetzt nicht mehr um unvorhersehbare Mengen kümmern, sondern arbeitet immer mit festen, sauberen Blöcken.

2. Der „Bus-Service" (Gruppierte Ausführung)

Das Problem: Wenn der NPU für jeden einzelnen Spezialisten einen eigenen kleinen Auftrag bekommt, muss er ständig anhalten, den Motor starten, losfahren und wieder stoppen. Das ist wie ein Bus, der für jeden einzelnen Passagier an jeder Haltestelle anhält. Der Treibstoffverbrauch (Energie) ist enorm, und die Reise dauert ewig.
Die Lösung: Der Manager packt mehrere Spezialisten (z. B. 8 Stück) in einen großen Bus.

  • Statt 8 kleine Fahrten zu machen, macht der NPU eine große Fahrt mit allen 8 Spezialisten gleichzeitig.
  • Das spart enorm viel Startzeit und Energie. Der NPU wird ausgelastet wie ein gut gefüllter Bus, statt wie ein leerer Taxi.

3. Der „Hotspot-Plan" (Lastbewusste Platzierung)

Das Problem: Manchmal sind die Spezialisten so selten gefragt, dass es sich gar nicht lohnt, den NPU zu wecken. Der Aufwand, den NPU zu aktivieren, ist größer als die eigentliche Arbeit.
Die Lösung: Der Manager schaut sich an, welche Spezialisten gerade „heiß" (sehr gefragt) sind und welche „kalt" (uninteressant) sind.

  • Die heißen Spezialisten werden direkt zum NPU geschickt, damit sie dort schnell arbeiten.
  • Die kalten Spezialisten werden einfach vom normalen Prozessor (CPU) erledigt.
  • Das verhindert, dass der NPU ständig aufgeweckt wird, um nur eine einzige kleine Aufgabe zu erledigen. Es ist wie bei einer Party: Die beliebten Gäste werden in den großen Saal (NPU) gelassen, während die wenigen, die nur kurz vorbeikommen, im Flur (CPU) bedient werden.

Das Ergebnis: Schneller, sparsamer, schlauer

Durch diese drei Tricks hat NPUMoE beeindruckende Ergebnisse auf Apple-Geräten (wie dem M2-Chip) erzielt:

  • Geschwindigkeit: Die KI antwortet 1,3- bis 5,5-mal schneller als bisherige Methoden.
  • Energie: Der Akku hält 1,8- bis 7,3-mal länger, weil weniger Energie verschwendet wird.
  • Entlastung: Der normale Prozessor (CPU) wird fast 6-mal weniger belastet. Das bedeutet, dein Gerät bleibt auch bei schweren Aufgaben flüssig und reagiert schnell auf andere Apps.

Zusammenfassend:
Die Forscher haben gelernt, wie man einen chaotischen, dynamischen Prozess (MoE) so in eine Schablone (NPU) presst, dass er perfekt funktioniert. Sie haben den „Sturkopf" des Chips nicht geändert, sondern den Prozess so intelligent umgebaut, dass der Chip endlich seine volle Leistung bringen kann, ohne den Akku zu töten. Das ist ein großer Schritt für private KI-Assistenten direkt auf deinem Handy oder Laptop.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →