Heterogeneous Parallelism for Multimodal Large Language Model Training
Dit artikel introduceert een heterogeen parallelisme-framework voor het trainen van multimodale grote taalmodellen dat onafhankelijke tensorparallelisme-indelingen voor verschillende modules binnen één grafiek mogelijk maakt, waardoor schaalingsmismatches die specifiek zijn voor een modus worden opgelost en tot 49,3% hogere TFLOPS/GPU wordt bereikt via geoptimaliseerde gecoördineerde uitvoering.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je probeert een superintelligente robot te trainen die kan zien, horen en lezen. Om dit te doen, moet je twee zeer verschillende soorten "hersenen" combineren:
- De Encoder: Dit deel is als een gespecialiseerde camera of microfoon. Het is uitstekend in het verwerken van afbeeldingen of geluid, maar werkt het beste met een specifiek, vast formaat datablok.
- Het LLM (Large Language Model): Dit is het gigantische taalbrein. Het is enorm, moet enorme hoeveelheden tekst in één keer lezen en vereist een heel andere manier om zijn werk te organiseren om efficiënt te zijn.
Het Probleem: Het "Eén-Formaat-Voor-Alles" Pak
In het verleden, bij het trainen van deze gecombineerde robots, dwongen ingenieurs beide hersenen om exact hetzelfde "uniform" te dragen (een specifieke manier om het werk over veel computers te verdelen).
Denk hierbij aan een bouwteam waar de loodgieters en de elektricisten gedwongen worden om in exact dezelfde formatie te werken.
- De elektriciens (het LLM) moeten in een enorme cirkel staan om snel draden door te geven (een techniek genaamd Tensor Parallelism).
- De loodgieters (de Encoder) hoeven alleen maar in kleine paren te werken omdat hun pijpen kort en vast zijn.
Als je de loodgieters dwingt om in de enorme cirkel van de elektriciens te staan, brengen ze al hun tijd door met wachten tot de elektriciens klaar zijn met het doorgeven van draden. Ze doen geen loodgieterswerk; ze staan alleen maar rond te kijken. Dit vertraagt het hele project.
De Oplossing: "Heterogene Parallelisme"
Dit artikel introduceert een nieuwe manier om het bouwteam te organiseren, genaamd Heterogene Parallelisme. In plaats van iedereen in één uniform te dwingen, laat het elk team het uniform dragen dat het beste bij hen past, zelfs als ze in hetzelfde gebouw werken.
Het systeem staat het "Encoder"-team en het "LLM"-team toe om:
- Hun werk anders te verdelen: Het LLM kan een enorme cirkel van computers gebruiken, terwijl de Encoder een strak paar gebruikt.
- Hun eigen zitplaats te kiezen: Ze kunnen op dezelfde computers zitten (de hardware delen) of op volledig verschillende computers, afhankelijk van wat de meeste ruimte en tijd bespaart.
De Magische Truc: De "Vertaler"
Het moeilijkste deel van het laten werken van twee teams op verschillende manieren, is het doorgeven van informatie tussen hen. Als de Encoder zijn werk afrondt in een "klein paar"-formaat, maar het LLM verwacht het in een "grote cirkel"-formaat, wordt de data verward.
De auteurs bouwden een speciale Vertaler (een Boundary Communicator genoemd).
- Forward Pass (De Bezorging): Wanneer de Encoder klaar is, herschikt de Vertaler de data direct in het formaat dat het LLM nodig heeft. Het is als een koerier die een klein pakketje pakt, het opnieuw inpakt in een grote kist en het aan het LLM-team overhandigt.
- Backward Pass (De Terugkeer): Wanneer het LLM leert van zijn fouten, stuurt het feedback terug. De Vertaler neemt die feedback, breekt het terug naar het kleine formaat dat de Encoder begrijpt, en geeft het terug.
Dit zorgt ervoor dat, zelfs als de teams op verschillende manieren werken, ze nooit de data of het leerproces uit het oog verliezen.
Twee Manieren om te Zitten: "Colocated" vs. "Non-Colocated"
Het artikel test twee manieren om deze teams te rangschikken:
Colocated (Delen van Dezelfde Werkplek):
- Het Scenario: De Encoder en het LLM passen op dezelfde set computers.
- Het Voordeel: In plaats van de Encoder te dwingen om in de inefficiënte cirkel van het LLM te zitten, laat het systeem de Encoder in zijn eigen efficiënte paren zitten op dezelfde computers.
- Het Resultaat: Dit is als het hebben van een chef-kok en een sous-chef in dezelfde keuken. De chef snijdt groenten (Encoder) terwijl de sous-chef de soep roert (LLM). Ze komen elkaar niet in de weg, en de keuken draait tot 49% sneller omdat niemand rondhangt.
Non-Colocated (Scheiding in Aparte Kamers):
- Het Scenario: De Encoder is zo groot (of het LLM zo geheugen-hongerig) dat ze niet dezelfde computers kunnen delen zonder de ruimte te missen.
- Het Voordeel: Het systeem verplaatst de Encoder naar een aparte kamer (een aparte set computers) volledig. Dit maakt de kamer van het LLM vrij om perfect te worden ingericht voor zijn eigen behoeften, zonder dat de Encoder de ruimte rommelig maakt.
- Het Resultaat: Dit is als het verplaatsen van de zware machines naar een apart magazijn, zodat het hoofdgebouw kan worden georganiseerd voor maximale efficiëntie. Dit verbeterde de totale snelheid van het verwerken van woorden met tot 13%.
Het Bewijs
De auteurs gokten niet zomaar dat dit zou werken; ze testten het.
- Ze bewezen dat de "Vertaler" de wiskunde niet verstoort. De robot leert met exact dezelfde snelheid en nauwkeurigheid als voorheen, alleen sneller.
- Ze toonden aan dat voor kleine Encoders, het delen van computers (Colocated) het beste is.
- Ze toonden aan dat voor enorme Encoders, het verplaatsen van hen naar een aparte kamer (Non-Colocated) het beste is.
Samenvatting
Dit artikel gaat over het stoppen van de "één-formaat-voor-alles"-aanpak bij het trainen van AI. Door verschillende onderdelen van het AI-systeem de meest efficiënte manier te laten gebruiken om te werken voor hun specifieke taak, en door een slimme vertaler te bouwen om data tussen hen door te geven, traint het systeem veel sneller en gebruikt het minder computerkracht. Het is alsof je eindelijk de loodgieters en elektriciens laat werken in hun eigen natuurlijke formaties, in plaats van ze te dwingen in pas te marcheren.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.