NeuroPrefetcher: Storage-Aware Sparse LLM Inference via Delta Prefetching
NeuroPrefetcher ist ein speichersensitives LLM-Inferenzsystem, das durch die Ausnutzung der zeitlichen Lokalität der MLP-Neuronenaktivität signifikante Geschwindigkeitssteigerungen auf speicherbeschränkten Edge-Geräten erzielt, indem es die notwendigen Gewichtsdeltas prädiktiv aus dem Speicher vorab lädt (prefetching), anstatt sich auf reaktive Demand-Paging-Verfahren zu verlassen.
Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen
Große Sprachmodelle sind die Motoren der modernen künstlichen Intelligenz und fähig zu Schreiben, Schlussfolgern und Übersetzen mit einer Flüssigkeit, die einst unmöglich schien. Diese Systeme arbeiten, indem sie Text Wort für Wort verarbeiten und das nächste Wort in einer Sequenz basierend auf den riesigen Mustern vorhersagen, die sie während des Trainings gelernt haben. Um dies zu tun, verlassen sie sich auf massive digitale Bibliotheken von Zahlen, sogenannten Gewichten, die im Speicher des Computers gespeichert sind. Je größer und leistungsfähiger das Modell ist, desto mehr Speicher benötigt es. Es ist jedoch eine signifikante Lücke entstanden: Während diese Modelle exponentiell an Größe zugenommen haben, ist der verfügbare Speicher in tragbaren Geräten wie Laptops, Tablets und spezialisierten Edge-Computern nicht im gleichen Maße Schritt gehalten worden. Dies schafft ein grundlegendes Problem für das Ausführen fortgeschrittener Intelligenz außerhalb von massiven Rechenzentren. Wenn ein Modell zu groß ist, um in den Speicher eines Geräts zu passen, muss das System ständig Daten zwischen dem schnellen Speicher und dem langsameren, größeren Datenträger austauschen – ein Prozess, der die Leistung normalerweise zum Erliegen bringt.
Forscher der Kennesaw State University und Samsung haben einen neuen Ansatz für dieses Problem entwickelt und ein System namens NeuroPrefetcher geschaffen, das es diesen überdimensionierten Modellen ermöglicht, effizient auf Geräten mit sehr begrenztem Speicher zu laufen. Anstatt zu versuchen, das Modell zu verkleinern oder es in den Speicher zu pressen, akzeptiert ihr System, dass das Modell größer als der verfügbare Speicher ist, und behandelt das Speichermedium als aktiven Teil des Berechnungsprozesses. Der Schlüssel zu ihrem Erfolg liegt in einer einfachen Beobachtung darüber, wie diese Modelle denken. Wenn das Modell ein Wort generiert, aktiviert es einen spezifischen Satz interner Pfade. Wenn es das darauffolgende Wort generiert, nutzt es fast exakt dieselben Pfade wieder. Die Forscher fanden heraus, dass zwischen 82 und 85 Prozent der aktiven Pfade vom einen Wort zum nächsten gleich bleiben. Das bedeutet, dass für den Großteil der Arbeit die notwendigen Daten bereits im Speicher des Geräts liegen und darauf warten, verwendet zu werden.
Die Innovation von NeuroPrefetcher liegt darin, wie es mit der kleinen Menge an Daten umgeht, die sich tatsächlich ändert. Traditionelle Systeme warten, bis das Modell ein Stück der Daten benötigt, bevor sie zum Datenträger gehen, um es abzurufen – ein reaktiver Prozess, der den Computer zum Pausieren und Warten zwingt. NeuroPrefzetcher arbeitet anders, indem er vorausblickt. Er nutzt einen kleinen, spezialisierten Prädiktor, der das aktuelle Wort analysiert und genau errät, welche neuen Pfade für das nächste Wort benötigt werden. Da das System weiß, was kommt, kann es nur die spezifischen, fehlenden Datenstücke vom Datenträger abrufen, während der Computer gerade mit der Berechnung des aktuellen Wortes beschäftigt ist. Dies verwandelt einen chaotischen Stop-and-Go-Prozess in einen reibungslosen, kontinuierlichen Fluss. Das System lädt im Wesentlichen nur den winzigen Bruchteil der neuen Informationen vor, während es die massive Menge an Daten ignoriert, die bereits im Speicher resident ist.
Um diese Idee zu testen, baute das Team ein vollständiges System und ließ es auf einem leistungsstarken Edge-Gerät laufen, bekannt als Jetson AGX Orin, das über eine vereinheitlichte Speicherarchitektur verfügt, die zwischen seinem Prozessor und seiner Grafikeinheit geteilt wird. Sie testeten das System mit großen Sprachmodellen wie Mistral-7B und Llama-3-8B unter strengen Speicherbeschränkungen, um Bedingungen zu simulieren, in denen das Modell signifikant größer als der verfügbare Speicher war. Unter diesen herausfordernden Bedingungen schnitt die Standardmethode zum Ausführen dieser Modelle, die sich auf das Betriebssystem zur Verwaltung des Datenaustauschs verlässt, schlecht ab und brachte das Gerät oft zum Stocken. Im Gegensatz dazu hielt NeuroPrefetcher das Gerät in Bewegung und erreichte eine Beschleunigung von fast acht bis zwölf Mal gegenüber der Standardmethode. Das System schaffte es, Wörter mit einer Rate von über drei pro Sekunde zu generieren, während der Standardansatz kaum eine Silbe pro Sekunde produzieren konnte.
Die Forscher untersuchten auch, wie sich das System verhielt, wenn sich der verfügbare Speicher änderte. Sie fanden heraus, dass das System sich anpassen konnte, indem es mehr Arbeit des Modells auf den Datenträger verlagerte, wenn der Speicher knapp war, und mehr Arbeit zurück in den schnellen Speicher verlagerte, wenn mehr Platz verfügbar war. Selbst unter den engsten Speicherbedingungen behielt das System eine hohe Leistung bei, da es die massiven Datentransfers vermeidete, die diese Operationen normalerweise verlangsamen. Anstatt ganze Schichten des „Gehirns“ des Modells hin und her zu bewegen, bewegte es nur die kleinen, sich ändernden Datenschnipsel. Dieser Ansatz erwies sich als so effektiv, dass das System selbst im Vergleich zu anderen fortschrittlichen Werkzeugen die schnellste Option blieb, von denen viele unter diesen spezifischen Einschränkungen gar nicht erst funktionierten.
Ein entscheidender Teil dieser Arbeit war die Sicherstellung, dass die Geschwindigkeitsgewinne nicht zu Lasten der Intelligenz gingen. Die Forscher maßen die Qualität des erzeugten Textes durch das System und stellten fest, dass sie der Qualität des vollständigen, unkomprimierten Modells sehr nahe kam. Das System bewahrte die Genauigkeit der Vorhersagen des Modells und behielt selbst bei den aggressivsten Speicherspareinstellungen über 90 Prozent der ursprünglichen Leistung bei. Dies bestätigte, dass die Strategie, nur die notwendigen Daten zu bewegen, die Fähigkeit des Modells, Sprache zu verstehen und zu generieren, nicht verschlechterte. Das System lernte effektiv, die Daten zu ignorieren, die für den unmittelbaren nächsten Schritt nicht benötigt wurden, und konzentrierte seine Ressourcen nur auf das, was wichtig war.
Die Studie unterstreicht einen Wandel in der Art und Weise, wie wir über das Ausführen von künstlicher Intelligenz auf Alltagsgeräten nachdenken könnten. Jahrelang bestand die Lösung, große Modelle auf kleiner Hardware auszuführen, darin, die Modelle kleiner zu machen oder sie zu komprimieren, was manchmal ihre Fähigkeiten reduzieren kann. NeuroPrefetcher schlägt einen anderen Weg vor: Halten Sie das volle Modell intakt und verwalten Sie die Bewegung seiner Daten mit extremer Präzision. Indem das System vorhersagt, was das Modell als Nächstes benötigt, und nur diese spezifische Änderung abruft, macht es den Datenträger von einem Flaschenhals zu einem hilfreichen Partner. Dieser Ansatz ermöglicht es, dass leistungsstarke Intelligenz auf Geräten operieren kann, die zuvor zu klein waren, um sie zu beherbergen, was die Tür für lokale, fortgeschrittene KI öffnet, ohne eine Verbindung zu einem entfernten Server zu benötigen. Die Ergebnisse zeigen, dass mit der richtigen Verwaltung des Datenflusses die physischen Grenzen des Speichers überwunden werden können, ohne die Leistungsfähigkeit des Modells selbst zu opfern.
Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?
Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.