What Does the Server See? Understanding Privacy Leakage from Large Language Models in Split Inference
Dit artikel blootst kritieke privacykwetsbaarheden in gesplitste inferentie voor grote taalmodellen door ActInv in te voeren, een methode die client-inputs reconstrueert uit intermediaire activaties ondanks gebruikelijke verdedigingen, en stelt de Perturbation Amplification Factor (PAF)-metriek en de PriPert-verdediging voor om deze lekrisico's systematisch te analyseren en te mitigeren.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Het Grote Geheel: Het "Gesplitste" Dilemma
Stel je een zeer slim, gigantisch robotbrein voor (een Large Language Model of LLM) dat woont op een krachtige cloudserver. Je hebt een kleine, zwakke smartphone die dit gigantische brein niet zelf kan draaien.
Om dit op te lossen, gebruik je Gesplitste Inferentie. Denk hierbij aan een estafettewedstrijd:
- Jij (de Client): Jij loopt de eerste paar meter van de race. Je neemt je geheime vraag (bijvoorbeeld: "Wat is er mis met mijn knie?") en verwerkt deze net genoeg om een "stokje" (intermediaire data) klaar te maken.
- De Server: Jij geeft het stokje door aan de grote robot. Hij loopt de rest van de race, maakt het antwoord af en stuurt het terug naar jou.
Het idee is dat je door alleen het "stokje" te sturen in plaats van je ruwe vraag, je geheimen veilig houdt. Het paper vraagt zich af: Is het stokje eigenlijk wel veilig, of kan de server je gedachten lezen door er alleen maar naar te kijken?
De Aanval: "ActInv" (De Gedachtelezer)
De onderzoekers ontdekten dat het "stokje" niet veilig is. Ze creëerden een tool genaamd ActInv die fungeert als een high-tech detective.
- De Analogie: Stel je voor dat je een server een wazige, gescrambelde foto van je gezicht stuurt (de intermediaire data). Een normaal persoon zou denken: "Ik kan niet zien wie dat is." Maar ActInv is als een supergeavanceerde AI die een leeg canvas pakt en begint met het schilderen van een gezicht. Het blijft de verf aanpassen totdat de wazige foto die het maakt perfect overeenkomt met de gescrambelde foto die je stuurde. Zodra ze overeenkomen, weet het precies hoe je originele gezicht (je geheime vraag) eruitzag.
- Het Resultaat: Het paper toont aan dat ActInv angstaanjagend goed is. Het kan je oorspronkelijke vraag reconstrueren met meer dan 98% nauwkeurigheid, zelfs als je probeert het te verbergen door statische ruis toe te voegen of delen van de data te vervagen. Het is alsof je probeert een bericht te verbergen in een sneeuwstorm, maar de detective heeft een warmtebeeldcamera die dwars door de sneeuw heen ziet.
Waarom gebeurt dit? (De "Zwakke Schakels")
De onderzoekers wilden weten waarom de server zo makkelijk gedachten kon lezen. Ze bedachten een maatstaf genaamd PAF (Perturbation Amplification Factor).
- De Analogie: Denk aan het AI-model als een lange tunnel met vele kamers (lagen). Sommige kamers zijn gemaakt van dik, geluidsisolerend beton (hoge PAF). Als je daar fluistert, sterft het geluid uit en kan de persoon aan het einde je niet horen. Andere kamers zijn gemaakt van dun glas of versterkers (lage PAF). Als je daar fluistert, wordt het geluid harder en duidelijker tegen de tijd dat het het einde bereikt.
- De Ontdekking: Ze ontdekten dat de "glazen kamers" (specifiek de activatielagen waar de AI beslissingen neemt) verrassend zwak zijn. Ze versleutelen de informatie niet; ze helpen de detective eigenlijk om de originele invoer te reconstrueren. Hoewel deze lagen bedoeld zijn om de AI "slim" te maken, maken ze het per ongeluk "lek".
De Gefaalde Verdedigingen
Voor dit paper dachten mensen dat het toevoegen van "ruis" (zoals statische ruis op een radio) of "sparsificatie" (het verbergen van sommige datapunten) de detective zou stoppen.
- De Realiteit: Het paper toont aan dat deze verdedigingen zijn als proberen een orkaan te stoppen met een paraplu. De detective (ActInv) is zo slim dat hij de ruis kan filteren en het oorspronkelijke bericht toch kan zien. De enige manier om het te stoppen met deze methoden is door zoveel ruis toe te voegen dat de AI helemaal stopt met werken, wat de dienst voor iedereen onbruikbaar maakt.
De Oplossing: "PriPert" (Het Slimme Schild)
Omdat simpele ruis niet werkt, ontwierpen de onderzoekers een nieuwe verdediging genaamd PriPert.
- De Analogie: In plaats van willekeurige zandkorrels in de ogen van de detective te gooien (willekeurige ruis), is PriPert als een vechtkunstenaar die precies weet waar hij moet slaan. Het berekent de meest gevoelige richting in de data.
- Stel je voor dat de data een ballon is. Als je er willekeurig op prikt, gaat hij misschien alleen maar wiebelen. Maar als je prikt op de exacte plek waar hij het kwetsbaarst is, springt hij open.
- PriPert vindt die "kwetsbare plek" in de data en voegt een kleine, gerichte duw toe. Dit duwt de reconstructie van de detective de verkeerde kant op, waardoor ze het verkeerde antwoord raden, terwijl de ballon (het antwoord van de AI) intact genoeg blijft om nog steeds bruikbaar te zijn.
- Het Resultaat: PriPert is veel beter dan de oude methoden. Het slaagt erin de detective te verwarren, waardoor het onmogelijk wordt om de oorspronkelijke vraag te raden, terwijl het de AI nog steeds een behulpzaam antwoord laat geven.
Samenvatting van Bevindingen
- Het Risico: Gesplitste inferentie (het sturen van gedeeltelijke data naar een server) is momenteel zeer onveilig. Een nieuwsgierige server kan je privé-vragen gemakkelijk reconstrueren.
- De Oorzaak: Bepaalde delen van het AI-model fungeren als versterkers, waardoor het eenvoudig is om de invoer omgekeerd te ontwerpen.
- De Oplossing: Simpele ruis werkt niet. Je hebt slimme, gerichte ruis (PriPert) nodig die specifiek de zwakke punten van het model aanvalt om de reconstructie te breken zonder het vermogen van de AI om vragen te beantwoorden te vernietigen.
Kortom: Als je vandaag gesplitste inferentie gebruikt, zijn je geheimen waarschijnlijk zichtbaar voor de server. Maar er is een nieuwe, slimmere manier om ze te verbergen die het systeem niet kapotmaakt.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.