On the (In-)Security of the Shuffling Defense in the Transformer Secure Inference
Dieser Beitrag zeigt, dass die Shuffle-Verteidigung, die zuvor als robuste Abschwächung für die Extraktion von Modellgewichten bei sicherer Transformer-Inferenz galt, anfällig für einen neuartigen Angriff ist, der permutierte Aktivierungen ausrichtet, um Modellgewichte mit hoher Genauigkeit und geringen Abfragekosten wiederherzustellen.
Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen
Das große Ganze: Das „Black Box"-Problem
Stellen Sie sich vor, Sie möchten einen superschlauen KI-Assistenten (wie einen Roboter-Koch) einsetzen, um Ihnen eine Mahlzeit zuzubereiten. Sie möchten dem Koch Ihr geheimes Rezept (Ihre Eingabe) nicht verraten, und der Koch möchte Ihnen seine geheime Gewürzmischung (seine Modellgewichte) nicht zeigen.
Um dies zu lösen, haben Wissenschaftler eine „Sichere Küche" geschaffen. In dieser Küche arbeiten Koch und Kunde mit einem speziellen Schloss-und-Schlüssel-System (Kryptographie) zusammen. Der Koch führt die Zubereitung durch, aber der Kunde sieht nur das fertige Gericht. Der Koch sieht niemals die rohen Zutaten, und der Kunde sieht niemals die geheimen Gewürze.
Der Flaschenhals: Der „Langsame Kochtopf"
Das Problem ist, dass diese sichere Küche unglaublich langsam ist. Das Zubereiten einfacher Dinge (wie das Schneiden von Gemüse, oder lineare Schichten) geht schnell. Aber das Zubereiten komplexer Dinge (wie das Backen eines Soufflés, oder nicht-lineare Schichten) erfordert so viele Hin-und-Her-Kontrollen zwischen Kunde und Koch, dass es ewig dauert.
Um die Dinge zu beschleunigen, schlugen einige Forscher einen Shortcut vor: „Lassen Sie uns dem Kunden einfach die Zwischenschritte zeigen!"
Anstatt die geheime Gewürzmischung während des Backschritts geheim zu halten, lassen sie den Kunden den Teig nachdem er gemischt wurde, aber bevor er gebacken wurde, sehen. Dies macht den Prozess 10- bis 50-mal schneller.
Die „Misch"-Verteidigung: Das durcheinandergeratene Puzzle
Die Forscher wussten, dass der Kunde, wenn er den Teig sieht, möglicherweise in der Lage sein könnte, die geheime Gewürzmischung zurückzuverfolgen. Daher fügten sie eine Verteidigung namens Mischen hinzu.
Stellen Sie sich vor, der Teig ist ein Puzzle mit 1.000 Teilen. Bevor er dem Kunden gezeigt wird, wirft der Koch die Teile in einen Mixer, wirbelt sie vollständig durcheinander und gibt dem Kunden einen Beutel mit durcheinandergeratenen Teilen.
- Die Logik: Da es (eine Zahl mit hunderten von Nullen) Möglichkeiten gibt, diese Teile anzuordnen, dachten die Forscher, es sei unmöglich für den Kunden, die ursprüngliche Reihenfolge zu erraten. Sie glaubten, das „durcheinandergeratene Puzzle" sei sicher.
Der Angriff: Das Muster im Chaos finden
Dieses Papier argumentiert, dass die „durcheinandergeratene Puzzle"-Verteidigung nicht sicher ist. Die Autoren fanden einen Weg, das Puzzle zu entwirren, ohne die ursprüngliche Reihenfolge zu kennen.
So haben sie es getan, mit einer einfachen Analogie:
Der „Fast Identische"-Trick:
Stellen Sie sich vor, Sie bitten den Koch, zwei Kuchen zu backen, die fast exakt gleich sind. Sie geben ihm Zutaten, die sich um einen winzigen, winzigen Betrag unterscheiden (wie das Hinzufügen eines einzigen zusätzlichen Salzkorns).- Da die Kuchen so ähnlich sind, wird der Teig für beide Kuchen fast identisch aussehen, nur mit winzigen Unterschieden.
Die „Durcheinandergeratene" Lieferung:
Der Koch backt beide Kuchen, wirbelt die Teigteile für beide durcheinander und sendet sie zu Ihnen.- Der Teig von Kuchen A wird in Reihenfolge #1 durcheinandergebracht.
- Der Teig von Kuchen B wird in Reihenfolge #2 durcheinandergebracht.
Die „Vermittler"-Lösung:
Obwohl die Teile durcheinander sind, sind die Werte (der Geschmack/die Größe der Teile) noch da. Da die beiden Kuchen so ähnlich waren, sind die Teigteile in Kuchen A fast genauso groß wie die entsprechenden Teile in Kuchen B.- Der Angreifer betrachtet die beiden Beutel mit durcheinandergeratenen Teilen.
- Er findet das Teil in Beutel A, das in der Größe am nächsten an einem Teil in Beutel B liegt.
- Er passt sie zusammen.
- Indem er dies für jedes einzelne Teil tut, kann er herausfinden, wie sich die beiden Durcheinanderbringer zueinander verhalten. Sie „richten" im Wesentlichen die beiden durcheinandergeratenen Puzzles in eine gemeinsame Reihenfolge aus.
Das Ergebnis:
Sobald der Angreifer die Teile ausgerichtet hat, kann er mit Mathematik die geheime Gewürzmischung (die Modellgewichte) berechnen.- Kritischer Punkt: Der Angreifer erhält die Gewichte nicht in der exakten ursprünglichen Reihenfolge. Es ist, als würde man die Gewürzmischung erhalten, wobei das „Salz"-Glas als „Pfeffer" und das „Pfeffer"-Glas als „Salz" beschriftet ist.
- Warum es trotzdem funktioniert: Selbst mit den vertauschten Etiketten kann der Koch immer noch das exakt gleiche Gericht zubereiten. Die Mathematik funktioniert perfekt; es ist nur eine andere Anordnung derselben Zutaten.
Der Realwelt-Test
Die Autoren testeten dies an zwei beliebten KI-Modellen (Pythia-70m und GPT-2).
- Kosten: Es kostete sie etwa 1 Dollar, den Angriff durchzuführen.
- Erfolg: Sie schafften es, die durcheinandergeratenen Teile mit nahezu perfekter Genauigkeit auszurichten (Fehler waren kleiner als ein Sandkorn).
- Ergebnis: Sie stellten die „Gewürzmischung" des Modells mit einer so hohen Genauigkeit wieder her, dass sie damit eine Kopie-KI bauen konnten, die sich fast exakt wie das Original verhielt.
Der „Fehler", der dem Angriff half
Sie fragen sich vielleicht: „Wie konnten sie die beiden Kuchen so ähnlich machen, wenn der Computer nur ganze Zahlen akzeptiert?"
Die Autoren fanden einen winzigen „Fehler" in der Mathematik der sicheren Küche. Wenn der Computer sichere Mathematik durchführt, verliert er manchmal einen winzigen Teil der Genauigkeit (wie das Abrunden einer Dezimalzahl). Dies geschieht zufällig. Die Autoren erkannten, dass sie diese winzigen, zufälligen Rundungsfehler als den „Salzkorn"-Unterschied nutzen konnten, den sie benötigten, um die beiden Kuchen leicht unterschiedlich zu machen und den Angriff zum Funktionieren zu bringen.
Fazit
Das Papier kommt zu dem Schluss, dass die „Misch-Verteidigung" (das Verstecken der Datenreihenfolge) nicht robust ist. Selbst wenn Sie die Daten durcheinanderbringen, kann ein Angreifer, wenn er die KI zwei sehr ähnliche Eingaben verarbeiten lässt, die winzigen Unterschiede nutzen, um die ursprüngliche Reihenfolge herauszufinden und die Geheimnisse des Modells zu stehlen.
Kurz gesagt: Man kann ein Geheimnis nicht einfach dadurch verbergen, dass man ein Kartenspiel mischt, wenn jemand beobachten kann, wie Sie zwei fast identische Decks mischen und die Ergebnisse vergleichen.
Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?
Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.