← Neueste Arbeiten
🤖 machine learning

HetCCL: Enabling Collective Communication For Mixed-Vendor Heterogeneous Clusters

letCCL ist ein neuartiges Framework, das eine effiziente kollektive Kommunikation in gemischten Multi-Vendor-Heterogenen Clustern ermöglicht, indem es einen kopierfreien Host-Device-P2P-Transport, einen herstellerunabhängigen Border-Communicator-Mechanismus und eine hierarchische Topologie-Abstraktion einführt, wodurch eine bis zu 19-mal höhere Bandbreite als Gloo erreicht und das LLM-Training um 16,9 % beschleunigt wird.

Ursprüngliche Autoren: Yuejie Wang, Tao Chang, Yuanyuan Zhao, Yulong Ao, Zeyu Gu, Zhiyu Li, Yanmin Jia, Yan Zhang, Mingjun Zhang, He Liu, Yongzhe He, Yonghua Lin, Guyue Liu

Veröffentlicht 2026-06-01
📖 4 Min. Lesezeit☕ Kaffeepausen-Lektüre

Ursprüngliche Autoren: Yuejie Wang, Tao Chang, Yuanyuan Zhao, Yulong Ao, Zeyu Gu, Zhiyu Li, Yanmin Jia, Yan Zhang, Mingjun Zhang, He Liu, Yongzhe He, Yonghua Lin, Guyue Liu

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie versuchen, einen riesigen, globalen Staffellauf zu organisieren, um eine superintelligente KI (ein Large Language Model) zu trainieren. In der Vergangenheit konnten Sie nur Läufer aus einem speziellen Land nutzen (einen Hardware-Anbieter wie NVIDIA). Sie trugen alle die gleichen Schuhe, sprachen dieselbe Sprache und wussten genau, wie sie den Stab weiterreichen müssen. Das machte das Rennen schnell und reibungslos.

Aber heute ist es zu teuer oder unmöglich, einen Wettlauf mit Läufern aus nur einem Land zu führen, weil die Vorräte knapp sind. Also entscheiden Sie sich, Läufer aus verschiedenen Ländern (NVIDIA, AMD, Huawei usw.) zu mischen. Das Problem? Diese sprechen verschiedene Sprachen, tragen unterschiedliche Schuhe und wissen nicht, wie sie den Stab aneinander übergeben sollen, ohne ihn fallen zu lassen.

Dies ist das Problem, das HetCCL löst. Hier ist die Funktionsweise, unterteilt in einfache Konzepte:

1. Das Problem: Der „Host“-Engpass

In alten gemischten Wettlauf-Versuchen musste ein Läufer aus Land A, wenn er den Stab an einen Läufer aus Land B übergeben wollte, zuerst zu einem zentralen „Coach“ (der CPU) laufen. Der Coach nahm den Stab entgegen, schrieb ihn auf ein Klemmbrett, lief zur anderen Seite und reichte ihn dem neuen Läufer.

  • Das Problem: Dieser „Coach“-Schritt ist langsam. Er verschwendet Zeit durch das Hin- und Herlaufen, und der Pfad zwischen dem Coach und den Läufern ist ein enger, überfüllter Flur (der PCIe-Engpass).

2. Die Lösung: Die „Direktverbindung“ (P2P-Transport)

HetCCL erfindet einen neuen Weg, den Stab zu übergeben. Anstatt den Coach zu benutzen, baut es einen direkten, Hochgeschwindigkeits-Tunnel zwischen den Händen der Läufer, selbst wenn diese aus verschiedenen Ländern kommen.

  • Wie es funktioniert: HetCCL behält die „Kontrolle“ (die Anweisungen darüber, wann gelaufen wird) beim Coach, aber die „Daten“ (der eigentliche Stab) bleiben die ganze Zeit in den Händen der Läufer.
  • Die Analogie: Stellen Sie sich vor, der Coach schickt eine Textnachricht mit dem Inhalt: „Los!“ Die Läufer geben den Stab dann direkt durch einen superschnellen Tunnel aneinander weiter und überspringen das Büro des Coaches komplett. Dies eliminiert die langsame „Hin- und Herlaufzeit“.

3. Der „Grenzschutz“-Trick (Vendor-unabhängige Reduktion)

Manchmal geht es beim Rennen nicht nur darum, einen Stab zu übergeben; es geht darum, Informationen zu kombinieren. Wenn zum Beispiel Läufer A die Zahl „5“ hat und Läufer B die Zahl „3“, müssen sie diese zu „8“ addieren, bevor sie das Ergebnis weitergeben.

  • Das Problem: Verschiedene Länder verwenden unterschiedliche Taschenrechner. Man kann Läufer A nicht einfach bitten, den Taschenrechner von Läufer B zu benutzen.
  • Die Lösung: HetCCL erschafft ein „Grenzschutz“-System. Es nimmt die Zahlen der verschiedenen Läufer, bewegt sie zu einer speziellen „Grenzstation“, wo ein standardisierter, universeller Taschenrechner (der in der bestehenden Software für jedes Land eingebaut ist) die Rechnung durchführen kann. Es ist wie ein universeller Übersetzer an der Grenze, der die Addition für alle erledigt, sodass niemand eine neue Sprache lernen muss.

4. Die „Fließbandarbeit“ (Hierarchisches & Pipelined Design)

In einem riesigen Rennen mit vielen Teams ist das Rennen langsam, wenn jeder wartet, bis das vorherige Team fertig ist.

  • Die Lösung: HetCCL organisiert das Rennen als hierarchische Fließbandarbeit.
    • Schritt 1: Läufer innerhalb desselben Landes schließen zuerst ihre lokalen Übergaben ab.
    • Schritt 2: Währenddessen beginnen die „Grenzschütze“, Daten zwischen den Ländern zu übergeben.
    • Schritt 3: Die letzten Übergaben finden wieder innerhalb der Länder statt.
  • Die Analogy: Anstatt dass die gesamte Linie wartet, bis die nächste Gruppe startet, beginnt die nächste Gruppe der Läufer bereits zu laufen, sobald die vorherige Gruppe die Strecke geräumt hat. Dies hält die „Tunnel“ (Netzwerkbandbreite) voll und beschäftigt, anstatt sie im Leerlauf zu lassen.

Was haben sie bewiesen?

Die Forscher haben dieses System (genannt HetCCL) gebaut und mit echter Hardware von vier verschiedenen Unternehmen getestet. Hier ist, was sie herausfanden:

  • Geschwindigkeit: In gemischten Szenarien war HetCCL 17- bis 19-mal schneller als die alte „Coach“-Methode (Gloo).
  • Effizienz: Es erreichte fast die gleiche Geschwindigkeit, als kämen alle aus demselben Land, selbst wenn verschiedene Hardware gemischt wurde.
  • Echtwelt-Auswirkung: Wenn sie es zum Training von KI-Modellen (wie Llama 3) einsetzten, schloss sich der Trainingsprozess im Vergleich zu den alten Methoden pro Schritt um bis zu 16,9 % schneller.

Kurz gesagt: HetCCL ist ein universeller Übersetzer und eine Abkürzung, die es verschiedenen Arten von Computerchips ermöglicht, als Team zusammenzuarbeiten, ohne sich gegenseitig auszubremsen, was den Bau massiver KI-Systeme kostengünstiger und schneller macht.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →