Privacy from Symmetry: Orthogonally Equivariant Transformers for LLM Inference
Dieses Paper schlägt ConjFormer vor, eine orthogonal äquivariante Transformer-Architektur, die eine datenschutzfreundliche LLM-Inferenz ermöglicht, indem Clients geheim rotierte Hidden States an einen Server übertragen, was effektiv Token-Rekonstruktionsangriffe verhindert und gleichzeitig eine minimale Leistungseinbußen beibehält.
Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen
Stellen Sie sich vor, Sie möchten einer superintelligenten KI (einem Large Language Model) eine Frage zu Ihren privaten Krankenakten stellen. Das Problem ist: Die KI lebt auf einem leistungsstarken Server weit weg, und Sie wollen nicht, dass Sie den Rohtext dorthin senden, weil der Serverbesitzer vielleicht einen Blick darauf werfen könnte.
Normalerweise versuchen Menschen, die Arbeit aufzuteilen: Sie erledigen den ersten Teil des Denkens auf Ihrem Telefon und senden dann nur die „Gedanken“ (verborgene Zahlen) an den Server, um die Aufgabe zu vollenden. Aber es gibt einen Haken: Diese „Gedanken“ sind wie ein Geheimcode, der geknackt werden kann. Wenn der Server ein öffentliches Wörterbuch besitzt, das zeigt, wie Wörter als Zahlen aussehen, kann er Ihre „Gedanken“ mit dem Wörterbuch abgleichen und genau erraten, was Sie getippt haben.
Die Lösung des Papers: Der „Magische Rotator“
Dieses Paper stellt ein neues System namens CONJFORMER vor. Betrachten Sie es als einen magischen Privatsphäre-Schild, der Geometrie statt schwerer Verschlüsselung verwendet.
So funktioniert es, unter Verwendung einer einfachen Analogie:
1. Das Problem: Das „Transparente Glas“
Stellen Sie sich vor, Ihre Daten sind eine Skulptur, die auf einem Tisch steht. Der Server besitzt einen Katalog jeder möglichen Skulptur. Wenn Sie die Skulptur an den Server senden, kann dieser sie einfach betrachten, sie mit seinem Katalog vergleichen und sagen: „Ah, das ist das Bild einer Katze!“ Selbst wenn Sie die Skulptur in einem etwas anderen Licht senden, bleibt die Form dieselbe, und er kann sie immer noch erkennen.
2. Die Lösung: Der „Geheime Dreh“
Die Autoren schlagen vor, dass Sie, bevor Sie Ihre Skulptur senden, sie auf einen Drehtisch legen und sie um 90 Grad (oder einen beliebigen zufälligen Winkel) drehen, wobei Sie einen Geheimschlüssel verwenden, den nur Sie kennen.
- Sie: Drehen die Skulptur.
- Der Server: Erhält die gedrehte Skulptur. Er weiß nicht mehr, was „oben“ ist.
- Die Magie: Die KI des Servers ist auf eine spezielle Weise aufgebaut (unter Verwendung einer neuen Architektur namens CONJFORMER), die es ihr ermöglicht, das Rätsel exakt gleich zu lösen, selbst wenn die Skulptur auf dem Kopf oder seitlich steht. Sie muss nicht wissen, wie die ursprüngliche Ausrichtung war, um ihre Aufgabe zu erfüllen.
3. Die „Architektonische Änderung“ (Das Geheimrezept)
Damit dies funktioniert, muss die KI auf dem Server anders gebaut sein. Standard-KI-Modelle sind wie starre Roboter; wenn man ihre Sicht neigt, werden sie verwirrt.
Die Autoren haben das „Gehirn“ (die Transformer-Architektur) der KI verändert, indem sie:
- Die „Normalisierung“ änderten: Sie haben einen kleinen Teil der Mathematik angepasst (indem sie ein komplexes Lineal durch ein einfaches skalares Lineal ersetzten), sodass die KI nicht auf die Richtung der Daten achtet.
- Die Gewichte rotierten: Genau wie Sie die Eingabe rotiert haben, werden auch die internen „Regeln“ (Gewichte) des Servers mathematisch rotiert, um passend zu sein.
Das Ergebnis: Der Server führt die Berechnung in einer „rotierten Welt“ durch. Er sieht Ihre Daten nie in ihrer ursprünglichen Form. Er sieht nur die gedrehte Version.
4. Kann der Server schummeln? (Die Angriffe)
Das Paper testet, ob ein hinterlistiger Server den geheimen Dreh erraten und die Daten „entrollen“ kann.
- Alter Angriff (Nearest Neighbor): Früher hat der Server einfach Formen abgeglichen. Jetzt ist dies unmöglich, da die Formen rotieren.
- Neuer Angriff (Weight Alignment): Der Server versucht, den Dreh zu erraten, indem er sich die „Regeln“ (Gewichte) ansieht, die er erhalten hat. Es ist, als würde man versuchen, wie eine Schachtel rotiert wurde, indem man sich das Bild auf dem Karton ansieht.
- Das Ergebnis: Das Paper zeigt, dass, wenn Sie das Modell auf Ihren privaten Daten trainieren (Fine-Tuning), die Fähigkeit des Servers, den Dreh zu erraten, von sehr gut (Wiederherstellung von über 35 % Ihrer Wörter) auf fast zufällig (Wiederherstellung von nur 1,3 %) sinkt.
5. Der Kompromiss
Macht das die KI dümmer?
- Nur ganz leicht. Das Paper hat dies an Modellen wie GPT-2 und Llama getestet. Nach den Änderungen sank die Leistung der KI (gemessen an der „Perplexity“, oder wie verwirrt sie ist) nur minimal (weniger als 0,4 % bis 2 %).
- Kein Rauschen: Im Gegensatz zu anderen Privatsphäre-Methoden, die „Rauschen“ oder „Störsignale“ zu den Daten hinzufügen (was dazu führt, dass die KI klingt, als hätte sie eine Erkältung), hält diese Methode die Daten sauber; sie dreht sie lediglich.
Zusammenfassung
CONJFORMER ist eine Möglichkeit, eine entfernte KI Ihre privaten Aufgaben erledigen zu lassen, ohne dass sie jemals Ihre Rohdaten sieht. Dies geschieht durch:
- Das Drehen Ihrer Daten mit einem Geheimschlüssel, bevor Sie sie senden.
- Das Umrüsten der KI, damit sie perfekt auf den gedrehten Daten arbeiten kann, ohne jemals die Notwendigkeit zu haben, sie „entzurollen“.
- Das Durchbrechen der Fähigkeit des Servers, Ihre Wörter einfach in einem Wörterbuch nachzuschlagen, indem es ihn zwingt, ein viel schwierigeres mathematisches Rätsel zu lösen, das er nicht knacken kann, sobald Sie das Modell auf Ihre spezifischen Daten trainiert haben.
Es ist eine praktische Verteidigung, die auf Symmetrie (der Idee, dass die Mathematik unabhängig von der Richtung gleich funktioniert) basiert, anstatt auf schwerer, langsamer Verschlüsselung.
Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?
Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.