MinT: Managed Infrastructure for Training and Serving Millions of LLMs
MinT is een beheerd infrastructuursysteem dat efficiënte training en levering van miljoenen LoRA-gebaseerde LLM-beleid mogelijk maakt door een enkel groot basismodel resident te houden en tegelijkertijd lichtgewicht adapterrevisies dynamisch te beheren, waardoor aanzienlijke verbeteringen worden bereikt in schaalbaarheid, geheugenefficiëntie en implementatiesnelheid over dichte en MoE-architecturen.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een enorme, ongelooflijk dure bibliotheek van boeken beheert (het Base Model). Deze boeken zijn enorm, nemen een hele kamer in beslag en zijn zeer moeilijk te verplaatsen.
Op de oude manier, als je een boek een nieuwe truc wilde leren—zoals het oplossen van wiskundeproblemen of het schrijven van juridische contracten—moest je het hele boek fotokopiëren, de nieuwe notities in de marges schrijven, en vervolgens die hele nieuwe, zware kopie naar een andere kamer verplaatsen om mensen te tonen. Als je 1.000 verschillende trucs wilde leren, had je 1.000 zware kopieën van het boek nodig, wat een enorme hoeveelheid ruimte en tijd kostte om te verplaatsen.
MinT (MindLab Toolkit) verandert het spel. In plaats van het hele boek te verplaatsen, zegt MinT: "Laten we het zware boek precies waar het is houden, vergrendeld in de bibliotheek. We schrijven de nieuwe trucs gewoon op kleine, lichtgewicht post-it nota's (zogenaamde LoRA-adapters)."
Hier is hoe MinT werkt, opgesplitst in drie eenvoudige ideeën:
1. Het "Post-it" Systeem (Schalen naar beneden)
In plaats van een 45-kilo encyclopedie te verplaatsen, verplaats je slechts een 28-gram post-it nota.
- De Oude Manier: Om een model bij te werken, voeg je de notities terug samen met het boek, waardoor een nieuw zwaar bestand ontstaat. Dit kost eeuwen om op te slaan en te verplaatsen.
- De MinT Manier: Je houdt het zware boek (het Base Model) zittend in het geheugen van de computer. Wanneer je een nieuwe vaardigheid traint, slaat je gewoon de kleine post-it nota op.
- Het Resultaat: Het verplaatsen van de "update" is ongelooflijk snel. Het onderzoek toonde aan dat het verplaatsen van alleen de post-it nota 18 keer sneller was voor een model van gemiddelde grootte en bijna 3 keer sneller voor een gigantisch model vergeleken met het verplaatsen van het hele boek. Het is alsof je een tekstbericht stuurt in plaats van een baksteen per post.
2. De "Schakelstations" (Schalen naar boven)
Stel je voor dat je een gigantische, complexe machine (een supercomputer) hebt die maar één zwaar boek tegelijk kan bevatten.
- Het Probleem: Meestal, als je 5 verschillende versies van een beleid wilt trainen (bijvoorbeeld één voor wiskunde, één voor codering, één voor recht), heb je 5 verschillende machines nodig, die elk een kopie van het zware boek bevatten. Dat is een verspilling van geld.
- De MinT Oplossing: MinT fungeert als een slim schakelbord. Het houdt het zware boek geladen in de machine. Als het tijd is om de "Wiskunde"-versie te trainen, wisselt het de "Wiskunde"-post-it nota in. Als het tijd is voor "Codering", wisselt het die nota uit en plaatst de "Codering"-nota.
- Het Resultaat: Je kunt veel verschillende "beleidslijnen" op dezelfde machine trainen zonder meer computers nodig te hebben. Het onderzoek toonde aan dat dit training 1,77 keer sneller maakte voor een model van 4 miljard parameters en 1,45 keer sneller voor een model van 30 miljard parameters, allemaal zonder extra geheugen nodig te hebben.
3. De "Slimme Catalogus" (Schalen naar buiten)
Stel je een bibliotheek voor met een miljoen verschillende post-it nota's, maar je leesbureau heeft maar ruimte voor een paar tegelijk.
- Het Probleem: Als een gebruiker om een specifieke post-it nota vraagt, en deze staat niet op het bureau, moet je naar de opslagruimte gaan, deze vinden en terugbrengen. Als 1.000 mensen tegelijk om 1.000 verschillende nota's vragen, raakt de opslagruimte verstopt en wachten iedereen in een lange rij.
- De MinT Oplossing: MinT organiseert dit als een slim bezorgsysteem.
- De Catalogus: Het kan een miljoen verschillende post-it nota's (beleidslijnen) bijhouden.
- De Cache: Het houdt de populairste nota's op een plank bij het bureau (CPU-cache) zodat ze direct klaarstaan.
- De "Verpakking"-Truc: Soms bestaat een post-it nota eigenlijk uit duizenden kleine, kleine stukjes (zoals een puzzel). MinT plakt deze stukjes samen tot één net pakket voordat ze naar het bureau worden gestuurd. Dit maakt de levering 8,5 keer sneller omdat de bezorgwagen niet 37.000 keer hoeft te stoppen om kleine puzzelstukjes op te halen; hij pakt gewoon één doos op.
Het Grote Geheel
MinT is in wezen een manager voor AI-training. Het voorkomt dat je tijd en geld verspilt door gigantische bestanden te verplaatsen. In plaats daarvan houdt het het zware "brein" (het Base Model) op één plek en beheert het de duizenden kleine "vaardigheden" (Adapters) die eraan worden bevestigd.
- Voor Training: Het stelt je in staat om snel tussen verschillende vaardigheden te schakelen zonder het hele brein opnieuw te laden.
- Voor Serving: Het stelt je in staat om miljoenen verschillende vaardigheden aan gebruikers te leveren, waarbij alleen de specifieke die op dat exacte moment nodig zijn, worden geladen, en dit op een manier die het systeem niet verstopt.
Kortom: Verplaats de olifant niet; verplaats gewoon de muis. MinT maakt het mogelijk om miljoenen verschillende AI-personaliteiten te draaien op een gedeelde, dure basis zonder dat de basis ooit hoeft te verplaatsen.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.