Understanding and Improving Communication Performance in Multi-node LLM Inference
Dieser Artikel präsentiert eine Leistungsstudie zur Inferenz von Large Language Models (LLMs) auf mehreren Knoten, die All-Reduce-Operationen als wesentlichen Engpass identifiziert und NVRAR vorstellt, einen hierarchischen All-Reduce-Algorithmus unter Verwendung von NVSHMEM, der die Latenz signifikant verringert und die End-zu-End-Leistung für große Modelle wie Llama 3.1 405B im Vergleich zu Standard-NCCL-Implementierungen verbessert.
Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen
Stellen Sie sich vor, Sie versuchen, ein riesiges, komplexes Puzzle zu lösen. In der Welt der Künstlichen Intelligenz ist dieses Puzzle ein „Large Language Model" (LLM) – ein superschlauer Computerhirn, das Geschichten schreiben, Fragen beantworten und Probleme lösen kann. Wenn diese Gehirne größer und schlauer werden, werden sie zu schwer, um von einem einzelnen Computer gehalten zu werden.
Um dies zu lösen, teilen Wissenschaftler die Puzzleteile auf viele Computer (sogenannte „Knoten") auf, die zusammenarbeiten. Dieser Artikel handelt davon, herauszufinden, wie man diese Computer effizient miteinander kommunizieren lässt, damit sie keine Zeit mit Warten verschwenden.
Hier ist eine einfache Aufschlüsselung dessen, was die Forscher herausfanden und entwickelten:
1. Das Problem: Die „Stille Post"-Engstelle
Wenn Computer zusammenarbeiten, müssen sie ständig Informationen austauschen.
- Das Setup: Stellen Sie sich ein Team von 32 Personen (GPUs) vor, die versuchen, das Puzzle zu lösen. Sie sind in Gruppen (Knoten) aufgeteilt. Innerhalb einer Gruppe können sie sich sofort zuschreien (wie mit einem superschnellen internen Walkie-Talkie namens NVLink). Um jedoch mit den anderen Gruppen zu sprechen, müssen sie eine langsamere, Fernverbindung nutzen (das Netzwerk zwischen den Knoten).
- Das Problem: Die Forscher stellten fest, dass die Computer, wenn sie den „Decodier"-Teil des Puzzles lösen (ein Wort nach dem anderen generieren), sehr kleine Nachrichten aneinander senden müssen.
- Die Analogie: Stellen Sie sich vor, Sie sind bei einem Staffellauf. Wenn Sie eine lange Strecke laufen müssen, um eine winzige Notiz an den nächsten Läufer zu übergeben, und die Person, der Sie sie geben, beim Empfangen langsam ist, verbringen Sie die meiste Zeit mit Warten. Die Studie ergab, dass die Standard-„Telefon"-Software (NCCL) schlecht darin war, diese winzigen, häufigen Nachrichten zwischen verschiedenen Gebäuden (Knoten) zu handhaben. Es war, als würde man versuchen, eine Postkarte über einen langsamen Postdienst zu senden, wenn man stattdessen sofort einen geheimen Handschlag weitergeben müsste.
2. Der Vergleich: Zwei Wege, das Team zu organisieren
Die Forscher testeten zwei Hauptmethoden, um das Team zu organisieren:
- Tensor-Parallelismus (TP): Alle arbeiten gleichzeitig am gleichen Teil des Puzzles, müssen sich aber ständig mit allen anderen abstimmen, um sicherzustellen, dass sie übereinstimmen. Dies ist großartig für große Arbeitspakete, wird aber durch das ständige Abstimmen (Kommunikation) ausgebremst.
- Hybrider Parallelismus (HP): Sie teilen das Puzzle in große Blöcke auf und weisen verschiedene Blöcke verschiedenen Personen zu. Dies reduziert die Notwendigkeit des Abstimms, ist aber für den „wort-für-wort"-Generierungsteil der Aufgabe weniger effizient.
Die Erkenntnis: Für den „wort-für-wort"-Teil der Aufgabe (was die meiste Zeit passiert) ist TP normalerweise besser, aber nur wenn das Team schnell genug miteinander sprechen kann. Die Standard-Kommunikationsweise war zu langsam und ließ das Team ins Stocken geraten.
3. Die Lösung: NVRAR (Die „Expressspur")
Um die langsame Kommunikation zu beheben, entwickelten die Forscher ein neues Werkzeug namens NVRAR.
- Funktionsweise: Anstatt den Standard-Postdienst zu nutzen, bauten sie eine maßgeschneiderte „Expressspur" mit einer Technologie namens NVSHMEM.
- Die Analogie: Denken Sie an die alte Methode als das Versenden eines Briefes, der gestempelt, sortiert und von einem LKW geliefert werden muss. NVRAR ist wie eine dedizierte Drohne, die direkt von einer Person zur anderen fliegt, die Notiz abgibt und im selben Moment eine Antwort aufnimmt.
- Der Trick der „rekursiven Verdopplung": Sie organisierten die Kommunikation wie ein Spiel „Stille Post", bei dem jeder in jedem Schritt die Anzahl der Personen verdoppelt, mit denen er spricht. Anstatt dass jeder nacheinander mit jedem spricht, paaren sie sich, verschmelzen, paaren sich erneut und verschmelzen wieder. Dies ist für große Gruppen viel schneller.
4. Die Ergebnisse: Das Team beschleunigen
Als sie diese neue „Expressspur" (NVRAR) in ihr System einbauten:
- Schnelleres Sprechen: Für die kleinen Nachrichten, die bei diesen KI-Aufgaben verwendet werden, war das neue System 1,9- bis 3,6-mal schneller als das Standard-System.
- Besseres Puzzles Lösen: Als sie dieses neue System nutzten, um das massive Modell „Llama 3.1 405B" (ein riesiges KI-Gehirn) laufen zu lassen, sank die Zeit, die zum Generieren von Antworten benötigt wurde, erheblich. In einigen Fällen war das Team 1,72-mal schneller fertig als zuvor.
- Realwelt-Test: Sie testeten dies unter Realwelt-Verkehr (simuliert durch Tausende von Nutzern, die Fragen stellen) und stellten fest, dass das System mehr Anfragen pro Sekunde bewältigen konnte, ohne langsamer zu werden.
Zusammenfassung
Der Artikel handelt im Wesentlichen davon, zu erkennen, dass wenn ein riesiges Team von Computern versucht, ein KI-Puzzle zu lösen, die größte Verzögerung nicht das Denken ist – sondern das Sprechen. Die Standardweise des Sprechens zwischen verschiedenen Gebäuden war für die winzigen, häufigen Nachrichten zu langsam. Die Autoren bauten ein maßgeschneidertes Hochgeschwindigkeits-Kommunikationssystem (NVRAR), das wie eine Expressspur funktioniert und es dem Team ermöglicht, sich sofort zu koordinieren und das Puzzle viel schneller zu lösen.
Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?
Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.