OrderMoE: An expert similarity driven distributed edge MoE inference
OrderMoE ist ein neuartiges Framework, das die verteilte Edge-MoE-Inferenz beschleunigt, indem es Expertenähnlichkeit nutzt, um eine lokale Substitution für entfernte Experten zu ermöglichen, wodurch die Latenz und den Kommunikationsaufwand signifikant reduziert werden, während gleichzeitig eine kontrollierbare Inferenzqualität beibehalten wird.
Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen
Stellen Sie sich das Internet als eine riesige, belebte Stadt vor, in der superintelligente Computer (genannt Large Language Models) leben. Diese Computer sind wie brillante Bibliothekare, die jede Frage beantworten, Geschichten schreiben oder Matheaufgaben lösen können. Diese Bibliothekare sind jedoch so groß und schwer, dass sie nicht in Ihr Telefon oder den Computer eines lokalen Cafés passen. Normalenfalls muss Ihr Telefon eine Frage über die ganze Stadt an ein riesiges Rechenzentrum schreien, darauf warten, dass der gigantische Bibliothekar nachdenkt, und dann warten, bis die Antwort zurückgeschrien wird. Das kostet Zeit und verbraucht viel des „Straßenraums“ (Bandbreite) der Stadt.
Um dies schneller zu machen, haben Wissenschaftler eine neue Art von Bibliothekar namens „Mixture of Experts“ (MoE) erfunden. Anstatt eines einzigen riesigen Gehirns ist dieser Bibliothekar eigentlich ein Team aus vielen kleineren Spezialisten. Wenn Sie eine Frage stellen, wählt ein intelligenter Manager (genannt Router) schnell die zwei oder drei Spezialisten aus, die für diese spezifische Aufgabe benötigt werden, und ignoriert den Rest. Das macht den Bibliothekaren viel schneller und leichter. Aber der knifflige Teil ist: In einem verteilten Edge-System sind diese Spezialisten über verschiedene lokale Server (wie verschiedene Cafés oder Nachbarschaftsknotenpunkte) verstreut, anstatt in einem einzigen großen Gebäude zu sein. Wenn der Router einen Spezialisten auswählt, der in einem Café drei Städte entfernt arbeitet, muss Ihr Telefon die Frage den ganzen Weg dorthin schicken und auf die Antwort warten, die zurückkommt. In einer Stadt mit engen, überfüllten Straßen kann diese Reisezeit genauso langsam sein wie das Sprechen mit dem riesigen Rechenzentrum.
Hier kommt eine neue Studie namens OrderMoE ins Spiel. Die Forscher, die mit einem echten Testbett aus acht physischen Servern arbeiteten, stellten eine einfache, aber kluge Frage: Was wäre, wenn wir, anstatt eine Frage immer an den exakten Spezialisten zu senden, den Router ausgewählt hat, einen anderen Spezialisten verwenden könnten, der direkt nebenan arbeitet und fast dieselbe Arbeit erledigt?
Das Paper legt nahe, dass viele dieser Spezialisten, obwohl sie unterschiedliche Namen haben, tatsächlich sehr ähnlich denken. Die Autoren fanden heraus, dass man diese Spezialisten gruppieren kann, indem man misst, wie ähnlich ihre „Denkmuster“ sind (unter Verwendung von etwas wie „router-induced logits“). Wenn der Router einen Spezialisten auswählt, der weit entfernt ist, prüft OrderMoE, ob es einen „Cousin“-Spezialisten in der Nähe gibt, der ähnlich genug ist, um die Aufgabe zu übernehmen. Wenn dies der Fall ist, wird die Frage lokal bearbeitet, was die lange, langsame Reise durch die Stadt spart.
Die Forscher wussten jedoch, dass dies ein empfindlicher Balanceakt ist. Einen Cousin anstelle des exakten Spezialisten zu verwenden, könnte zwar Zeit sparen, aber es könnte auch bedeuten, dass die Antwort nicht ganz so perfekt ist. Um dies zu lösen, bauten sie einen intelligenten Verkehrskontrolleur, der für jede einzelne Frage entscheidet, ob es sicher ist, einen lokalen Cousin zu verwenden oder ob es sich lohnt, auf den exakten Spezialisten in der Ferne zu warten. Dieser Kontrolleur blickt auch voraus und denkt darüber nach, wohin die nächste Frage gehen muss, damit er nicht versehentlich eine Frage an einen Server sendet, der ein schlechter Ort für den nächsten Schritt wäre.
Als sie OrderMoE in einem echten Netzwerk aus acht Servern mit unterschiedlichen Geschwindigkeiten und Speichergrößen testeten, waren die Ergebnisse beeindruckend. Das System schaffte es, die durchschnittliche Wartezeit (Latenz) im Vergleich zu anderen Methoden um etwa 40 % bis 51 % zu senken, und es reduzierte die Menge der zwischen den Servern fließenden Daten um eine enorme Menge. Vielleicht am wichtigsten ist, dass die Qualität der Antworten kaum sank – nur um einen winzigen, fast unmerklichen Betrag. Die Studie zeigt, dass, indem wir lokale Server erlauben, ähnliche Experten einzutauschen, wir KI viel schneller und reaktionsschneller machen können, ohne größere, teurere Rechenzentren bauen zu müssen. Es ist ein bisschen so, als würde man erkennen, dass man nicht in die nächste Stadt fahren muss, um eine bestimmte Art von Sandwich zu bekommen; der Laden gleich nebenan hat ein sehr ähnliches, und es ist in Sekunden bereit.
Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?
Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.