Compressing LLMs with MoP: Mixture of Pruners
Das Papier stellt MoP (Mixture of Pruners) vor, ein iteratives Framework, das Tiefen- und Breitenpruning vereinheitlicht, um bestehende eindimensionale Methoden hinsichtlich Genauigkeit und Latenzreduktion bei LLaMA- und LLaVA-Modellen zu übertreffen.
Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen
Stellen Sie sich vor, Sie versuchen, eine riesige, schwere Bibliothek in einem Rucksack zu tragen. Diese Bibliothek enthält die Summe des menschlichen Wissens, geschrieben in einer Sprache, die so komplex ist, dass nur die klügsten Computer sie lesen können. Diese „Bibliotheken“ werden Large Language Models (LLMs) genannt. Sie sind fantastisch darin, Geschichten zu schreiben, mathematische Probleme zu lösen und sogar wie ein Freund zu chatten. Aber es gibt einen Haken: Sie sind so riesig und schwer, dass sie enorme Mengen an Elektrizität und superschnelle Computer benötigen, nur um das Buch zu öffnen und einen einzigen Satz zu lesen. Wenn Sie sie auf einem normalen Laptop oder einem Telefon verwenden wollen, sind sie oft zu langsam und zu schwer zum Tragen.
Um dies zu beheben, versuchen Wissenschaftler, diese Bibliotheken kleiner zu machen, ohne die wichtigen Bücher wegzuwerfen. Eine Möglichkeit hierfür ist das sogenannte „Pruning“ (Beschneiden). Denken Sie beim Pruning an das Gärtnern. Sie haben einen riesigen, überwucherten Busch (das große Computermodell) und möchten ihn zu einer ordentlichen, kleineren Form stutzen. Sie können ganze Äste abschneiden (den Busch kürzer machen) oder die Blätter von den Ästen trimmen (den Busch dünner machen). Lange Zeit mussten Gärtner wählen: Entweder schnitten sie ganze Äste ab oder sie trimmen die Blätter, aber nicht beides gleichzeitig. Die Frage war: Welcher Weg macht den Busch kleiner, während er gleichzeitig gesund bleibt und Früchte tragen kann?
Dieses Papier stellt ein neues Gartengerät namens MoP vor, was für Mixture of Pruners steht. Anstatt sich nur für eine Methode zu entscheiden, ist MoP ein intelligenter, iterativer Gärtner, der bei jedem Schritt beide Methoden ausprobiert. Stellen Sie sich vor, Sie beschneiden Ihren Busch. Bei jedem Schnitt fragt MoP zwei Fragen: „Wie sieht der Busch aus, wenn ich diesen ganzen Ast abschneide?“ und „Wie sieht er aus, wenn ich stattdessen nur die Blätter an diesem Ast trimme?“ Dann wählt es die Version, die den Busch am meisten dem ursprünglichen, gesunden Pflanzenzustand ähnlich hält. Es wiederholt diesen Prozess, indem es zwischen dem Abschneiden von Ästen und dem Trimmen von Blättern wechselt, bis der Busch klein genug ist, um in Ihren Rucksack zu passen.
Die Forscher haben diese Methode an einigen der klügsten Computergehirne der Welt getestet, wie zum Beispiel den LLaMA-2 und LLaMA-3 Modellen. Sie fanden heraus, dass MoP diese Modelle viel besser verkleinern kann als die Verwendung von nur einer Methode allein. Als sie die Modelle um 40 % verkleinerten (sie also um 40 % kleiner machten), hielten die Modelle mit MoP genauso klug mit der Konkurrenz mit, aber sie wurden auch signifikant schneller im Antworten. Tatsächlich wurden die Modelle bei der Beantwortung von Fragen um 39 % schneller. Überraschenderweise testeten sie dies auch an einem Modell, das Bilder sehen und Text lesen kann (genannt LLaVA-1.5). Sie fanden heraus, dass das beschnittene Modell selbst dann Bilder fast so gut verstehen konnte wie zuvor, obwohl sie ihm nur mit Text (ohne Bilder) „beigebracht“ hatten. Dies deutet darauf hin, dass das Mischen der beiden Schneidestrategien ein kleineres, schnelleres und klügeres Computergehirn schafft, das nicht den Faden verliert, selbst wenn es sehr klein wird.
Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?
Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.