MinT: Managed Infrastructure for Training and Serving Millions of LLMs
MinT ist ein verwaltetes Infrastruktur-System, das ein effizientes Training und Serving von Millionen LoRA-basierter LLM-Richtlinien ermöglicht, indem ein einziges großes Basismodell resident gehalten wird, während gleichzeitig leichte Adapter-Revisions dynamisch verwaltet werden, wodurch erhebliche Verbesserungen in Bezug auf Skalierbarkeit, Speichereffizienz und Bereitstellungsgeschwindigkeit sowohl bei dichten als auch bei MoE-Architekturen erzielt werden.
Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen
Stellen Sie sich vor, Sie betreiben eine riesige, unglaublich teure Bibliothek von Büchern (das Basis-Modell). Diese Bücher sind enorm groß, nehmen einen ganzen Raum ein und sind sehr schwer zu bewegen.
Bei der alten Methode, wenn Sie einem Buch einen neuen Trick beibringen wollten – etwa wie man Matheaufgaben löst oder juristische Verträge schreibt –, mussten Sie das gesamte Buch fotokopieren, die neuen Notizen in die Ränder schreiben und dann diese ganze neue, schwere Kopie in einen anderen Raum bringen, um sie den Leuten zu zeigen. Wenn Sie 1.000 verschiedene Tricks beibringen wollten, bräuchten Sie 1.000 schwere Kopien des Buches, die einen massiven Platz- und Zeitaufwand zum Herumtragen verursachen würden.
MinT (MindLab Toolkit) verändert das Spiel. Anstatt das ganze Buch zu bewegen, sagt MinT: „Lassen Sie uns das schwere Buch genau dort lassen, wo es ist, in der Bibliothek verriegelt. Wir schreiben die neuen Tricks einfach auf kleine, leichte Haftnotizen (die sogenannten LoRA-Adapter)."
So funktioniert MinT, aufgeteilt in drei einfache Ideen:
1. Das „Haftnotiz"-System (Skalierung nach unten)
Anstatt eine 45-Kilogramm-Enzyklopädie zu bewegen, bewegen Sie nur eine 30-Gramm-Haftnotiz.
- Die alte Methode: Um ein Modell zu aktualisieren, fügen Sie die Notizen wieder in das Buch ein und erstellen eine neue, schwere Datei. Das dauert ewig zum Speichern und Bewegen.
- Die MinT-Methode: Sie lassen das schwere Buch (das Basis-Modell) im Arbeitsspeicher des Computers sitzen. Wenn Sie eine neue Fähigkeit trainieren, speichern Sie einfach die winzige Haftnotiz.
- Das Ergebnis: Das Bewegen des „Updates" ist unglaublich schnell. Die Studie fand heraus, dass das Bewegen nur der Haftnotiz bei einem mittelgroßen Modell 18-mal schneller und bei einem riesigen Modell fast 3-mal schneller war als das Bewegen des ganzen Buches. Es ist wie das Senden einer Textnachricht statt dem Versenden eines Ziegelsteins.
2. Die „Umschaltstationen" (Skalierung nach oben)
Stellen Sie sich eine riesige, komplexe Maschine (einen Supercomputer) vor, die nur ein schweres Buch gleichzeitig halten kann.
- Das Problem: Normalerweise benötigen Sie, wenn Sie 5 verschiedene Versionen einer Richtlinie trainieren wollen (z. B. eine für Mathe, eine für Programmieren, eine für Recht), 5 verschiedene Maschinen, von denen jede eine Kopie des schweren Buches hält. Das ist eine Verschwendung von Geld.
- Die MinT-Lösung: MinT fungiert wie eine intelligente Vermittlungsstelle. Es hält das schwere Buch in der Maschine geladen. Wenn es Zeit ist, die „Mathe"-Version zu trainieren, wird die „Mathe"-Haftnotiz eingewechselt. Wenn es Zeit für „Programmieren" ist, wird diese Notiz ausgetauscht und die „Programmieren"-Notiz eingelegt.
- Das Ergebnis: Sie können viele verschiedene „Richtlinien" auf derselben Maschine trainieren, ohne weitere Computer zu benötigen. Die Studie zeigte, dass dies das Training bei einem 4-Milliarden-Parameter-Modell 1,77-mal schneller und bei einem 30-Milliarden-Parameter-Modell 1,45-mal schneller machte, alles ohne zusätzlichen Speicherbedarf.
3. Der „intelligente Katalog" (Skalierung nach außen)
Stellen Sie sich eine Bibliothek mit einer Million verschiedener Haftnotizen vor, aber Ihr Leseplatz bietet nur Platz für einige wenige gleichzeitig.
- Das Problem: Wenn ein Benutzer eine bestimmte Haftnotiz anfordert und diese nicht auf dem Tisch liegt, müssen Sie zum Lagerraum gehen, sie finden und zurückbringen. Wenn 1.000 Personen gleichzeitig 1.000 verschiedene Notizen anfordern, wird der Lagerraum verstopft, und alle warten in einer langen Schlange.
- Die MinT-Lösung: MinT organisiert dies wie einen intelligenten Lieferdienst.
- Der Katalog: Er kann eine Million verschiedene Haftnotizen (Richtlinien) verfolgen.
- Der Cache: Er hält die beliebtesten Notizen auf einem Regal in der Nähe des Tisches (CPU-Cache), damit sie sofort bereitstehen.
- Der „Verpackungs"-Trick: Manchmal besteht eine Haftnotiz tatsächlich aus Tausenden winziger, winziger Teile (wie ein Puzzle). MinT klebt diese Teile zu einem einzigen, ordentlichen Paket zusammen, bevor er sie zum Tisch sendet. Dies macht die Lieferung 8,5-mal schneller, weil der Lieferwagen nicht 37.000 Mal anhalten muss, um winzige Puzzleteile aufzunehmen; er nimmt einfach nur eine Kiste auf.
Das große Ganze
MinT ist im Wesentlichen ein Manager für das KI-Training. Es verhindert, dass Sie Zeit und Geld verschwenden, indem Sie riesige Dateien herumtransportieren. Stattdessen hält es das schwere „Gehirn" (das Basis-Modell) an einem Ort und verwaltet die Tausenden winzigen „Fähigkeiten" (Adapter), die damit verbunden werden.
- Für das Training: Es ermöglicht Ihnen, schnell zwischen verschiedenen Fähigkeiten zu wechseln, ohne das gesamte Gehirn neu laden zu müssen.
- Für den Betrieb: Es ermöglicht Ihnen, Millionen verschiedener Fähigkeiten an Benutzer auszuliefern, wobei nur die spezifischen geladen werden, die in genau diesem Moment benötigt werden, und dies auf eine Weise, die das System nicht verstopft.
Kurz gesagt: Bewegen Sie nicht den Elefanten; bewegen Sie nur die Maus. MinT macht es möglich, Millionen verschiedener KI-Persönlichkeiten auf einer gemeinsamen, teuren Grundlage laufen zu lassen, ohne dass sich die Grundlage jemals bewegen muss.
Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?
Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.