← Ultimi articoli
🤖 machine learning

HetCCL: Enabling Collective Communication For Mixed-Vendor Heterogeneous Clusters

letCCL è un nuovo framework che consente una comunicazione collettiva efficiente in cluster eterogenei multi-vendor introducendo un trasporto P2P copy-free tra host e device, un meccanismo di border-communicator indipendente dal vendor e un'astrazione della topologia gerarchica, ottenendo una larghezza di banda fino a 19 volte superiore rispetto a Gloo e accelerando l'addestramento di LLM del 16,9%.

Autori originali: Yuejie Wang, Tao Chang, Yuanyuan Zhao, Yulong Ao, Zeyu Gu, Zhiyu Li, Yanmin Jia, Yan Zhang, Mingjun Zhang, He Liu, Yongzhe He, Yonghua Lin, Guyue Liu

Pubblicato 2026-06-01
📖 4 min di lettura☕ Lettura da pausa caffè

Autori originali: Yuejie Wang, Tao Chang, Yuanyuan Zhao, Yulong Ao, Zeyu Gu, Zhiyu Li, Yanmin Jia, Yan Zhang, Mingjun Zhang, He Liu, Yongzhe He, Yonghua Lin, Guyue Liu

Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo

Immagina di cercare di organizzare una corsa a staffetta globale e massiccia per addestrare un'IA super intelligente (un Large Language Model). In passato, potevi usare solo corridori provenienti da un unico paese specifico (un singolo fornitore di hardware, come NVIDIA). Indossavano tutti le stesse scarpe, parlavano la stessa lingua e sapevano esattamente come passarsi il testimone. Questo rendeva la corsa veloce e fluida.

Ma oggi, correre una gara con i soli corridori di un unico paese è troppo costoso o impossibile perché le forniture sono scarse. Così, decidi di mescolare corridori di paesi diversi (NVIDIA, AMD, Huawei, ecc.). Il problema? Parlano lingue diverse, indossano scarpe diverse e non sanno come passarsi il testimone l'un l'altro senza farlo cadere.

Questo è il problema che HetCCL risolve. Ecco come funziona, suddiviso in concetti semplici:

1. Il Problema: Il collo di bottiglia dell' "Host"

Nelle vecchie tentativi di gare miste, se un corridore del Paese A doveva passare il testimone a un corridore del Paese B, doveva prima correre verso un "Coach" centrale (la CPU). Il Coach prendeva il testimone, lo annotava su un appunti e correva dall'altra parte per consegnarlo al nuovo corridore.

  • Il Problelo: Questo passaggio del "Coach" è lento. Spreca tempo correndo avanti e indietro, e il percorso tra il Coach e i corridori è un corridoio stretto e affollato (il collo di bottiglia PCIe).

2. La Soluzione: La "Linea Diretta" (Trasporto P2P)

HetCCL inventa un nuovo modo per passarsi il testimone. Invece di usare il Coach, costruisce un tunnel diretto ad alta velocità tra le mani dei corridori, anche se provengono da paesi diversi.

  • Come funziona: HetCCL mantiene il "controllo" (le istruzioni su quando correre) con il Coach, ma i "dati" (il testimone effettivo) rimangono nelle mani dei corridori per tutto il tempo.
  • L'Analogia: Immagina che il Coach invii un messaggio di testo dicendo: "Vai!". I corridori poi si passano il testimone direttamente tra di loro attraverso un tunnel super veloce, saltando interamente l'ufficio del Coach. Questo elimina il tempo perso nel "correre avanti e indietro".

3. Il Trucco della "Guardia di Confine" (Riduzione Indipendente dal Vendor)

A volte, la corsa non consiste solo nel passarsi un testimone; si tratta di combinare le informazioni. Ad esempio, se il Corridore A ha il numero "5" e il Corridore B ha il numero "3", devono sommarli per ottenere "8" prima di passare il risultato successivo.

  • Il Problema: Paesi diversi usano diverse calcolatrici. Non puoi semplicemente chiedere al Corridore A di usare la calcolatrice del Corridore B.
  • La Soluzione: HetCCL crea un sistema di "Guardia di Confine". Prende i numeri dai diversi corridori, li sposta in una specifica "Stazione di Confine" dove una calcolatrice universale e standard (integrata nel software esistente di ogni paese) può fare i calcoli. È come avere un traduttore universale alla frontiera che fa l'addizione per tutti, così nessuno deve imparare una nuova lingua.

4. La "Linea di Montaggio" (Design Gerarchico e Pipelined)

In una corsa enorme con molte squadre, se tutti aspettano che la squadra precedente finisca prima di iniziare, la corsa diventa lenta.

  • La Soluzione: HetCCL organizza la corsa in una linea di montaggio gerarchica.
    • Passaggio 1: I corridori all'interno dello stesso paese completano prima i loro passaggi locali.
    • Passaggio 2: Mentre lo stanno facendo, le "Guardie di Confine" iniziano a passare i dati tra i paesi.
    • Passaggio 3: I passaggi finali avvengono all'interno dei paesi di nuovo.
  • L'Analogia: Invece di aspettare che l'intera linea si fermi, il gruppo successivo di corridori inizia a muoversi nel momento in cui il gruppo precedente libera la pista. Questo mantiene i "tunnel" (larghezza di banda di rete) pieni e attivi, invece di lasciarli inattivi.

Cosa hanno dimostrato?

I ricercatori hanno costruito questo sistema (chiamato HetCCL) e lo hanno testato con hardware reale di quattro diverse aziende. Ecco cosa hanno scoperto:

  • Velocità: Negli scenari di gara mista, HetCCL era da 17 a 19 volte più veloce del vecchio metodo del "Coach" (Gloo).
  • Efficienza: Ha raggiunto quasi la stessa velocità di quando tutti provengono dallo stesso paese, anche mescolando hardware diversi.
  • Impatto nel mondo reale: Quando hanno usato questo sistema per addestrare modelli di IA (come Llama 3), il processo di addestramento è terminato fino al 16,9% più velocemente per ogni passaggio rispetto ai vecchi metodi.

In breve: HetCCL è un traduttore universale e una corsia preferenziale che permette a diversi tipi di chip per computer di lavorare insieme come una squadra senza rallentarsi a vicenda, rendendo più economico e veloce costruire massicci sistemi di IA.

Sommerso dagli articoli nel tuo campo?

Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.

Prova Digest →