Simple Yet Effective: Extracting Private Data Across Clients in Federated Fine-Tuning of Large Language Models
Deze studie toont aan dat semi-eerlijke deelnemers in federatief fine-tuning van grote taalmodellen via eenvoudige extractiestrategieën tot 56,6% van de privégegevens van andere cliënten kunnen achterhalen, wat de noodzaak benadrukt van robuuste privacybescherming in dergelijke systemen.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat verschillende ziekenhuizen, banken en rechtbanken een super-intelligente digitale assistent willen bouwen. Ze willen dat deze assistent slim wordt door te leren van hun gezamenlijke kennis, maar ze mogen hun patiëntgegevens, klantinformatie of dossiers niet met elkaar delen vanwege privacywetten.
De oplossing? Federated Learning. Het is alsof elke instelling de assistent in zijn eigen huis traint, en alleen de "leermethode" (de updates) wordt naar een centrale server gestuurd om de assistent slimmer te maken. De echte data blijft veilig achter gesloten deuren.
Het probleem: De assistent onthoudt te veel.
In dit onderzoek ontdekten de auteurs een verrassend en gevaarlijk lek. Hoewel de assistent de data niet direct deelt, heeft hij de geheugenkracht van een olifant. Hij heeft de data van de andere instellingen zo goed "geleerd" dat hij er nog steeds details uit kan herhalen, zelfs als die instellingen nooit hun data hebben gedeeld.
Het is alsof je een kok uitnodigt die in een ander restaurant heeft gewerkt. Je vraagt hem niet om het recept van dat andere restaurant te geven, maar als je zegt: "Hoe maak je de soep die je gisteren at?", kan hij het recept misschien toch volledig opzeggen, omdat hij het zo goed heeft onthouden.
De aanval: Een slimme "gokker"
De onderzoekers laten zien hoe een instelling (de "aanvaller") deze geheugenkracht kan misbruiken om privégegevens van een andere instelling (het "slachtoffer") te stelen.
- De Context: De aanvaller gebruikt zijn eigen dossiers als startpunt. Bijvoorbeeld: "De verdachte woont op..."
- De Vraag: Hij vraagt de gezamenlijke assistent om de zin af te maken.
- Het Geheugen: Omdat de assistent ook de dossiers van het slachtoffer heeft "geleerd", kan hij soms onbewust antwoorden met: "...de straatnaam van het slachtoffer, in 2005."
De onderzoekers hebben drie manieren bedacht om dit te doen, zoals het kiezen van de beste startzin om de assistent op het verkeerde been te zetten, of het assistent even extra te trainen op zijn eigen data om zijn geheugen scherper te maken voor deze specifieke vragen.
De resultaten: Een schokkende onthulling
Ze hebben dit getest met een dataset van Chinese juridische documenten. Het resultaat?
- De aanvaller kon 56,6% van de unieke privégegevens van het slachtoffer terugvinden.
- Namen, adressen en geboortedata waren het makkelijkst te stelen.
- Zelfs als de data was "geanonimiseerd" (vervangen door sterretjes), kon de assistent soms nog steeds de originele informatie raden, omdat hij het al kende van zijn eerdere training.
Waarom is dit belangrijk?
Dit onderzoek is een wake-up call. Het laat zien dat "privacy door samenwerking" niet automatisch veilig is. Zelfs als je data niet deelt, kan een slim model die data onthouden en later onthullen.
De oplossing?
We moeten de "assistenten" beter leren vergeten. Net als een kok die een recept moet vergeten als hij naar een nieuw restaurant gaat, moeten we zorgen dat deze AI-modellen niet te veel specifieke details onthouden van de data waarmee ze zijn getraind, zonder hun nuttige vaardigheden te verliezen.
Kortom: Samenwerken is goed, maar zonder de juiste sloten op de geheugens van onze AI, kunnen we onze geheimen toch kwijtraken.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.