Gradient Transformer: Learning to Generate Updates for LLMs
Dieser Beitrag stellt Gradient Transformer vor, ein datenfreies Framework für Wissensdistillation, das Organisationen mit begrenzten Rechenressourcen ermöglicht, effektive Aktualisierungsvektoren für große Sprachmodelle zu generieren, indem Aktualisierungsvektoren von kleinen Sprachmodellen transformiert werden, die auf privaten Daten feinabgestimmt wurden, und dadurch eine sichere, organisationsübergreifende Zusammenarbeit ohne Offenlegung sensibler Informationen ermöglicht.
Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen
Stellen Sie sich vor, Sie sind Inhaber eines kleinen Unternehmens und möchten einen superintelligenten KI-Assistenten (ein „Large Language Model" oder LLM) nutzen, um bei Ihren spezifischen, privaten Kundendaten zu helfen. Doch es gibt einen Haken: Sie können sich die enorme Rechenleistung nicht leisten, die nötig wäre, um diesem riesigen KI-System Ihre Geheimnisse beizubringen, und Sie können Ihre privaten Daten aufgrund von Datenschutzgesetzen nicht in die Cloud eines Fremden senden.
Andererseits können Sie es sich leisten, eine winzige, leichtgewichtige KI (ein „TinyLM") auf Ihrem eigenen Computer zu trainieren. Doch diese winzige KI ist nicht intelligent genug, um die schwere Arbeit allein zu erledigen.
Das Problem: Sie haben eine winzige, intelligente, aber kleine KI, die Ihre Geheimnisse kennt, und eine riesige, leistungsfähige KI, die das nicht tut. Sie müssen der riesigen KI beibringen, was die kleine gelernt hat, ohne der riesigen KI jemals Ihre privaten Daten zu zeigen.
Die Lösung: Der „Gradient Transformer"
Die Autoren dieses Papiers haben einen cleveren Mittelsmann erfunden, der Gradient Transformer heißt. Denken Sie an ihn als universellen Übersetzer für „Lern-Updates".
So funktioniert es, anhand einer einfachen Analogie:
1. Die „Lernnotizen" (Update-Vektoren)
Wenn Sie Ihre winzige KI auf Ihren privaten Daten trainieren, „lernt" sie nicht nur auf vage Weise; sie nimmt spezifische, winzige Anpassungen an ihrer internen Gehirnverdrahtung vor. Das Papier nennt diese Anpassungen „Update-Vektoren".
- Analogie: Stellen Sie sich vor, Ihre winzige KI ist ein Schüler, der sich Notizen zu einem Lehrbuch macht. Der „Update-Vektor" ist die spezifische Liste von Korrekturen, die der Schüler in die Ränder schreibt, um die richtigen Antworten zu erhalten. Es ist nicht das Lehrbuch selbst (Ihre privaten Daten); es sind nur die Änderungen, die der Schüler an seinem Gehirn vorgenommen hat.
2. Der Übersetzer (Der Gradient Transformer)
Die Autoren haben einen speziellen KI-Übersetzer (den Gradient Transformer) entwickelt. Dieser Übersetzer wurde auf öffentlichen Daten (wie Open-Source-Lehrbüchern) trainiert, um die Beziehung zwischen „Schülernotizen" und „Professornotizen" zu verstehen.
- Wie er lernt: Die Forscher nahmen öffentliche Daten, trainierten eine winzige KI und eine riesige KI darauf und beobachteten, wie sich ihre „Notizen" (Update-Vektoren) unterschieden. Sie lehrten den Übersetzer: „Wenn eine winzige KI diese spezifische Änderung vornimmt, muss die riesige KI diese spezifische entsprechende Änderung vornehmen."
- Die Magie: Der Übersetzer lernt das Muster des Lernens, nicht den Inhalt der Daten.
3. Die Übertragung (Keine privaten Daten werden offengelegt)
Nun zurück zu Ihrem Unternehmen:
- Sie trainieren Ihre winzige KI lokal auf Ihren privaten Daten.
- Sie extrahieren die „Notizen" (die Update-Vektoren) aus Ihrer winzigen KI.
- Sie senden nur die Notizen an den Dienstleister. Sie senden Ihre privaten Daten nicht.
- Der Dienstleister speist Ihre „Notizen" in den Gradient Transformer ein.
- Der Übersetzer generiert sofort einen neuen Satz „Notizen" für die riesige KI. Diese Notizen sagen der riesigen KI genau, wie sie ihr Gehirn anpassen muss, um dem zu entsprechen, was Ihre winzige KI gelernt hat, jedoch hochskaliert auf die Größe des Riesen.
- Die riesige KI aktualisiert sich selbst mit diesen neuen Notizen.
Warum ist das eine große Sache?
- Datenschutz an erster Stelle: Die riesige KI sieht Ihre privaten Daten niemals. Sie sieht nur die mathematische „Form" des Lernens, nicht den tatsächlichen Inhalt.
- Kosteneffizient: Sie benötigen keinen Supercomputer, um die riesige KI zu trainieren. Sie benötigen nur einen kleinen Computer, um die winzige zu trainieren.
- Teamarbeit: Wenn zehn verschiedene Unternehmen jeweils ihre eigene winzige KI haben, die auf ihren eigenen privaten Daten trainiert wurde, können alle ihre „Notizen" an den Übersetzer senden. Der Übersetzer kann sie kombinieren, um eine superriesige KI zu schaffen, die das kollektive Wissen aller zehn Unternehmen kennt, ohne dass ein Unternehmen jemals seine Geheimnisse mit den anderen teilt.
Die Ergebnisse
Das Papier testete dies an Aufgaben wie Matheaufgaben, gesundem Menschenverstand beim Schlussfolgern und dem Zusammenfassen von Gesprächen.
- Die winzige KI allein war okay, aber nicht großartig.
- Die direkt trainierte riesige KI (wenn Sie es sich leisten könnten) war die beste.
- Der Gradient Transformer nahm die „Notizen" der winzigen KI und verwandelte sie in eine riesige KI, die fast so gut performte, als wäre sie direkt auf den privaten Daten trainiert worden, aber ohne die Daten jemals gesehen zu haben.
Tatsächlich war der Übersetzer selbst dann noch in der Lage, hochwertige Updates für die riesige KI zu generieren, wenn die winzige KI mit strengen Datenschutzmaßnahmen trainiert wurde (Hinzufügen von Rauschen, um die Daten zu verschleiern), was beweist, dass er robust und sicher ist.
Kurz gesagt: Der Gradient Transformer ist eine magische Brücke, die es einer kleinen, privaten KI ermöglicht, einer riesigen, öffentlichen KI beizubringen, wie sie klug sein kann, ohne jemals die Geheimnisse preiszugeben, die sie gelernt hat.
Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?
Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.