← Neueste Arbeiten
💬 NLP

MobileMoE: Scaling On-Device Mixture of Experts

Die Arbeit stellt MobileMoE vor, eine Familie von On-Device-Mixture-of-Experts-Sprachmodellen mit weniger als einer Milliarde Parametern, die Architektur und Training optimieren, um im Vergleich zu bestehenden dichten und MoE-Baselines überlegene Leistung und Effizienz zu erzielen und damit eine schnelle Inferenz auf handelsüblichen Smartphones zu ermöglichen.

Ursprüngliche Autoren: Yanbei Chen, Hanxian Huang, Ernie Chang, Jacob Szwejbka, Digant Desai, Zechun Liu, Vikas Chandra, Raghuraman Krishnamoorthi

Veröffentlicht 2026-05-27
📖 5 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Yanbei Chen, Hanxian Huang, Ernie Chang, Jacob Szwejbka, Digant Desai, Zechun Liu, Vikas Chandra, Raghuraman Krishnamoorthi

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Die große Idee: „Super-Gehirne" in Ihre Hosentasche bringen

Stellen Sie sich vor, Sie besitzen eine riesige Wissensbibliothek (ein Large Language Model, oder LLM). Normalerweise müssen Sie Ihre Fragen an einen riesigen, cloudbasierten Server-Farm senden, um die besten Antworten zu erhalten. Aber was wäre, wenn Sie dieses Gehirn in Ihrer Hosentasche, auf Ihrem Telefon, mitführen könnten, ohne das Internet zu benötigen?

Lange Zeit war der einzige Weg, ein intelligentes Gehirn auf ein Telefon zu bringen, es „dicht" zu machen – wie ein einziger, super-harbeitsamer Schüler, der versucht, für jede einzelne Frage alles zu merken und alles zu tun. Dies ist langsam und beansprucht viel Speicherplatz.

MobileMoE ist eine neue Familie von KI-Modellen von Meta, die das Spiel verändert. Anstatt eines einzigen hart arbeitenden Schülers nutzen sie ein Team von Spezialisten. Dieser Ansatz, Mixture of Experts (MoE) genannt, ermöglicht es dem Telefon, ein viel intelligenteres Gehirn zu betreiben, das schneller ist, weniger Akku verbraucht und in den Speicher moderner Smartphones passt.


1. Das Problem: Der „Einheitsgröße"-Engpass

Stellen Sie sich eine Standard-Telefon-KI (wie die aktuellen auf dem Markt) als Generalisten vor.

  • Die Analogie: Stellen Sie sich einen einzelnen Koch in einer winzigen Küche vor. Wenn Sie Sushi bestellen, schneiden sie den Fisch. Wenn Sie einen Kuchen bestellen, backen sie ihn. Wenn Sie ein Steak bestellen, grillen sie es. Sie müssen in allem gut sein, also tragen sie jedes Werkzeug der Küche bei sich.
  • Das Problem: Dieser Koch ist langsam, weil er für jede Aufgabe das Werkzeug wechseln muss, und die Küche (der Speicher Ihres Telefons) wird durch alle Werkzeuge, die sie vielleicht brauchen, überfüllt, selbst wenn sie sie gerade nicht verwenden.

2. Die Lösung: Das „Spezialisten-Team" (MoE)

MobileMoE ersetzt den einzelnen Koch durch ein Team von Experten.

  • Die Analogie: Stellen Sie sich nun eine Küche mit einem Router (einem Manager) und 64 verschiedenen Spezialisten-Köchen vor.
    • Ein Koch weiß nur, wie man Kuchen backt.
    • Ein anderer weiß nur, wie man Steaks grillt.
    • Ein weiterer weiß nur, wie man Sushi zubereitet.
  • Wie es funktioniert: Wenn Sie eine Frage stellen, schaut der Router schnell darauf und sagt: „Ah, das ist eine Mathefrage! Schick sie zum Mathe-Koch." Der Mathe-Koch erledigt die Arbeit, und die anderen 63 Köche machen Pause.
  • Der Vorteil: Obwohl das gesamte Team riesig ist (viel Gesamtwissen), arbeitet zu jedem Zeitpunkt nur ein winziger Bruchteil von ihnen tatsächlich. Das bedeutet, das Telefon muss nicht so viel Schwerstarbeit leisten, was Akku und Zeit spart.

3. Der „Sweet Spot": Die perfekte Teamgröße finden

Die Forscher haben nicht einfach geraten; sie nutzten ein Scaling Law (eine mathematische Rezeptur), um die perfekte Teamgröße für ein Telefon zu finden.

  • Die Entdeckung: Sie stellten fest, dass Sie für ein Telefon kein Team wollen, das zu klein ist (nicht intelligent genug) oder zu groß (zu schwer).
  • Das Ergebnis: Sie fanden einen „Sweet Spot" mit 8 Hauptexperten, wobei jeder Experte tatsächlich aus 8 winzigen Sub-Experten (feinkörnig) besteht, plus einem „Generalisten"-Experten, der immer einsatzbereit ist, um alles zu handhaben, was die Spezialisten verpassen.
  • Warum es wichtig ist: Diese spezifische Mischung ermöglicht es dem Modell, unglaublich intelligent zu sein und gleichzeitig klein genug zu bleiben, um auf ein Telefon mit 3–5 GB Speicher zu passen (was bei Telefonen wie dem iPhone 16 Pro oder Samsung S25 Standard ist).

4. Das Training: Ein vierstufiges Bootcamp

Um dieses Team perfekt funktionieren zu lassen, wurden sie in vier spezifischen Phasen trainiert, wie in einem rigorosen Bootcamp:

  1. Pre-training: Das Team liest eine riesige Bibliothek von Büchern (6 Billionen Wörter), um die allgemeine Sprache zu lernen.
  2. Mid-training: Sie konzentrieren sich auf spezifische, hochwertige Themen wie Mathematik, Code und Wissenschaft, um ihre Fähigkeiten zu schärfen.
  3. Instruction Fine-Tuning: Sie lernen, menschlichen Anweisungen zu folgen (wie „schreibe ein Gedicht" oder „löse diese Gleichung").
  4. Quantisierung (Die Komprimierung): Das ist der Zaubertrick. Sie verkleinern den Speicherbedarf des Modells um das 4-fache (indem sie es in das „INT4"-Format umwandeln), ohne viel Intelligenz zu verlieren, damit es problemlos auf ein Telefon passt.

5. Die Ergebnisse: Schneller und intelligenter auf echten Telefonen

Das Team testete MobileMoE auf echten Flaggschiff-Telefonen (Samsung Galaxy S25 und iPhone 16 Pro) und verglich es mit der besten bestehenden Telefon-KI (MobileLLM-Pro).

  • Geschwindigkeit: MobileMoE ist 2 bis 4 Mal schneller beim Generieren von Text als die dichten Modelle.
    • Analogie: Wenn das alte Modell ein Lieferwagen war, der im Stau steckte, ist MobileMoE ein Motorrad, das sich durchschlängelt.
  • Intelligenz: Es entspricht oder übertrifft die Leistung viel größerer Modelle. Zum Beispiel ist die „Medium"-Version von MobileMoE intelligenter als Modelle, die 3–4 Mal größer sind.
  • Effizienz: Es verbraucht weniger Akku und Speicher, da es nur die spezifischen Experten „wachruft", die für die Aufgabe benötigt werden.

6. Die „Letzte Meile": Damit es auf Ihrem Telefon läuft

Das Papier hebt eine große Hürde hervor: Die meisten Telefone haben keine integrierte Software, um dieses „Team von Experten" effizient auszuführen.

  • Die Lösung: Die Forscher bauten eine benutzerdefinierte Engine (ein spezieller Software-Kernel), die wie ein Verkehrsleiter funktioniert. Sie organisiert die Daten so, dass der Prozessor des Telefons die Spezialisten effizient handhaben kann.
  • Der Beweis: Sie bewiesen, dass dies auf echter Hardware funktioniert. Auf einem iPhone 16 Pro generierte das neue Modell Text 3,4 Mal schneller als das alte dichte Modell, bei gleichzeitig geringerem Speicherverbrauch.

Zusammenfassung

MobileMoE beweist, dass Sie keinen riesigen Cloud-Server benötigen, um eine intelligente KI auf Ihrem Telefon zu haben. Durch die Verwendung eines Teams von Spezialisten anstelle eines einzelnen Generalisten und durch sorgfältiges Abstimmen der Teamgröße und des Trainingsprozesses schufen sie eine KI, die:

  1. Intelligenter ist als aktuelle Telefonmodelle.
  2. Schneller ist (bis zu 4-fache Geschwindigkeitssteigerung).
  3. Effizient ist (passt in den Speicher Ihres Telefons und spart Akku).

Dies öffnet die Tür zu leistungsstarken, privaten und sofortigen KI-Assistenten, die vollständig auf Ihrem Gerät leben, ohne eine Verbindung zum Internet benötigen.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →