Low-Rank Ternary Adaptation for Fine-Tuning Transformers
Dieses Paper schlägt „ternary multiplicative adaptation“ vor, eine neuartige Low-Rank-Methode, die eine effiziente Feinabstimmung von ternären Transformern ermöglicht, indem sie diskrete Gewichtsaktualisierungen durch kleine ternäre Matrizen darstellt, wodurch der ternäre Bereich bewahrt und ein direktes Merging ohne Dequantisierung ermöglicht wird, während gleichzeitig die Leistung über Sprach- und Visionsmodelle hinweg signifikant wiederhergestellt wird.
Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen
Moderne künstliche Intelligenz stützt sich auf gewaltige Computerprogramme, die als Transformer bezeichnet werden und zum Motor für alles geworden sind, von Schreibassistenten bis hin zu Bildgeneratoren. Diese Programme sind unglaublich leistungsstark, aber sie sind auch schwerfällig und erfordern enorme Mengen an Computerspeicher und Energie, um zu laufen. Um sie auf kleineren Geräten wie Telefonen oder Laptops nutzbar zu machen, haben Forscher jahrelang versucht, sie zu verkleinern. Eine populäre Strategie besteht darin, die Zahlen innerhalb des Programms zu komprimieren, indem man sie von komplexen, hochpräzisen Werten in einfachere, niedrig-bit-basierte Versionen umwandelt. Stellen Sie sich vor, man nimmt ein hochauflösendes Foto und reduziert es auf nur wenige Farben; das Bild wird kleiner und schneller zu verarbeiten, obwohl zwangsläufig etwas Detailgenauigkeit verloren geht. Die aggressivste Form dieser Kompression besteht darin, die internen Zahlen des Programms auf nur drei mögliche Werte zu beschränken: minus eins, null und plus eins. Dieser Ansatz, bekannt als ternäre Quantisierung, senkt den benötigten Speicherbedarf um den Faktor zehn und macht aus einem Modell, das einst einen großen Server erforderte, potenziell etwas, das auf einem Standard-Laptop laufen kann.
Ein erhebliches Problem hat jedoch den Fortschritt dieser ultra-kompakten Modelle gebremst. Während die Modelle klein und effizient sind, lassen sie sich nur schwer neue Aufgaben lehren. Standardmethoden zum Lehren dieser Programme beinhalten das Vornehmen winziger, kontinuierlicher Anpassungen an ihren Zahlen. Aber wenn ein Modell auf nur drei Werte beschränkt ist, kann es keine kleinen Anpassungen vornehmen; es kann eine Zahl nur von negativ nach positiv umkehren oder sie ganz ausschalten. Bestehende Techniken zum Lehren dieser komprimierten Modelle erfordern oft, die Zahlen vorübergehend auf ihre volle, schwere Größe zu erweitern, um Änderungen vorzunehmen, und sie dann wieder zusammenzustauchen. Dieser Prozess des Erweiterns und Neu-Komprimierens führt zu Fehlern, die die Leistung des Modells verschlechtern, was das Endergebnis oft schlechter macht, als wenn gar kein Lehren stattgefunden hätte.
Ein Team von Forschern der Technischen Universität Delft und Amazon hat einen neuen Weg entwickelt, um diese ultra-kompakten Modelle zu lehren, der diesen Zyklus aus Expansion und Fehlern vermeidet. Anstatt zu versuchen, kleine, kontinuierliche Zahlen zum Modell hinzuzufügen, arbeitet ihre Methode direkt innerhalb des strengen Drei-Werte-Systems. Sie entwarfen ein System, das wie eine Reihe von Schaltern fungiert und es dem Modell ermöglicht, das Vorzeichen seiner internen Zahlen umzukehren oder sie ganz auszuschalten, ohne jemals den komprimierten Zustand zu verlassen. Um dies effizient zu gestalten, versuchten sie nicht, jede einzelne Zahl individuell anzupassen. Stattdessen verwendeten sie eine mathematische Struktur, die es ermöglicht, dass einige wenige, einfache Muster riesige Abschnitte des Modells gleichzeitig steuern. Dieser Ansatz, den sie eine „Low-Rank Ternary Adaptation“ nennen, lässt das Modell neue Fähigkeiten erlernen, während es perfekt komprimiert bleibt.
Die Forscher testeten diese Methode an verschiedenen Arten künstlicher Intelligenz, einschließlich Sprachmodellen, die fähig zu logischem Denken sind, und Visionsmodellen, die Bilder erkennen. Sie begannen mit Modellen, die bereits auf das Drei-Werte-Limit komprimiert worden waren, und wandten dann ihre neue Lehrmethik an. Die Ergebnisse zeigten, dass die Modelle einen Großteil der Genauigkeit zurückgewannen, die sie während der ursprünglichen Kompression verloren hatten. In Tests zu Sprachaufgaben schnitten die adaptierten Modelle deutlich besser ab als frühere Versuche, die versuchten, das Modell durch Expansion und Neu-Kompression zu lehren. Beispielsweise verbesserte die neue Methode bei einem Sprachmodell mit drei Milliarden Parametern die durchschnittliche Genauigkeit über neun verschiedene Aufgaben hinweg von etwa 32 Prozent auf 38 Prozent und steigerte gleichzeitig die Zuversichtlichkeit der Vorhersagen des Modells.
Vielleicht am wichtigsten ist, dass das Endergebnis dieses Prozesses ein einziges, einheitliches Modell ist, das in seiner ultra-kompakten Form bleibt. Im Gegensatz zu anderen Methoden, die ein separates, schweres Set an Instruktionen hinterlassen, das neben dem kleinen Modell geladen werden muss, integriert dieser neue Ansatz das Lernen direkt in die winzigen Gewichte. Die Forscher fanden heraus, dass ihre Methode bei Vision-Aufgaben, wie etwa dem Identifizieren von Objekten in Bildern, ein Modell erzeugte, das weita viel genauer war als jene, die durch Komprimierung nach dem Lernen erstellt wurden. Sie entdeckten auch, dass der Lernprozess dadurch funktionierte, dass die Vorzeichen der bestehenden Zahlen umverteilt wurden, anstatt zu versuchen, auf Null gesetzte Zahlen wieder zum Leben zu erwecken. Das bedeutet, das Modell lernt durch die Reorganisation dessen, was es bereits besitzt, anstatt zu versuchen, neue Verbindungen zu schaffen, wo keine existierten.
Diese Arbeit zeigt, dass es möglich ist, hochkomprimierte künstliche Intelligenz-Modelle zu lehren, ohne deren Effizienz oder Genauigkeit zu opfern. Indem sie die strengen Grenzen des Drei-Werte-Systems respektieren und einen Weg finden, innerhalb dieser Grenzen zu lernen, haben die Forscher gezeigt, dass diese winzigen Modelle für viele Aufgaben ebenso fähig sein können wie ihre größeren Gegenstücke. Die Methode benötigt während der Nutzung keinen zusätzlichen Speicher oder Rechenleistung, da das Lernen vollständig in die Struktur des Modells integriert ist. Dies öffnet die Tür für den Einsatz anspruchsvoller künstlicher Intelligenz auf Geräten mit sehr begrenzten Ressourcen und bringt leistungsstarke Fähigkeiten an Orte, an denen ihr Einsatz zuvor unmöglich war.
Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?
Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.