Protecting User Prompts Via Character-Level Differential Privacy
Deze paper introduceert een methode voor het beschermen van gebruikersprompten met karakterniveau-differentieel privacy, waarbij tekst wordt verstoord voordat deze naar een LLM wordt verzonden, zodat een herstelmechaniek veel voorkomende woorden kan reconstrueren terwijl gevoelige informatie onleesbaar blijft zonder dat deze expliciet hoeft te worden geïdentificeerd.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een heel persoonlijk verhaal schrijft aan een super slimme robot (een "Large Language Model" of LLM) die ergens in de cloud zit. Je wilt dat de robot je helpt, bijvoorbeeld om een medisch verslag samen te vatten. Maar je verhaal bevat gevoelige dingen: je naam, je telefoonnummer, je adres.
Het probleem? Die robot wordt beheerd door een bedrijf dat je niet vertrouwt. Als je het verhaal zo stuurt, kan dat bedrijf alles zien. Je wilt dus dat de robot je helpt, maar zonder dat hij je geheimen leest.
De oude manier: De "Rode Pen"
Vroeger probeerden mensen dit op te lossen door een "rode pen" te gebruiken. Een computerprogramma zocht naar namen en nummers en veegde ze weg of vervangde ze door [NAAM].
- Het nadeel: Soms mist het programma een naam (bijvoorbeeld een rare spelling), en dan lekken je geheimen toch. Soms veegt het iets weg dat niet gevoelig was, waardoor de zin onbegrijpelijk wordt. Het is als proberen een raadsel op te lossen door gissen.
De nieuwe manier: De "Vage Verteller"
De auteurs van dit paper hebben een slimme nieuwe truc bedacht. In plaats van te proberen te raden wat gevoelig is, maken ze het hele verhaal een beetje onleesbaar, maar op een slimme manier.
Hier is hoe het werkt, stap voor stap, met een analogie:
1. Het "Krassen" (De Storing)
Stel je voor dat je een brief schrijft, maar voordat je hem opstuurde, neemt een vriendje elke letter van je tekst en gooit een munt.
- Koppen: Als de munt "kop" is, laat hij de letter staan.
- Munten: Als de munt "munt" is, vervangt hij de letter door een willekeurige andere letter of symbool.
Dit gebeurt bij elke letter in elk woord.
- Het woord
Huiswordt misschienH#isofHuisofHuis. - Het woord
Jan(een zeldzame naam in deze context) wordt misschienJ@nofXan.
Dit is wiskundig bewezen veilig (Differential Privacy). Je hebt nu een brief vol met krasjes en rare tekens.
2. De Slimme Robot (De Hersteller)
Nu stuur je deze "krassige" brief naar de robot. De robot is heel slim en heeft miljoenen boeken gelezen. Zijn taak is: "Probeer dit verhaal weer te begrijpen en maak het leesbaar, maar vertel me niet wat er echt stond."
Hier komt de magie van de menselijke taal:
- Gewone woorden: Woorden als
Huis,kopen,vandaagkomen heel vaak voor. De robot zietH#isen denkt: "Ah, dat is bijna zeker 'Huis', want dat past in de zin." De robot corrigeert deze woorden automatisch. De zin blijft begrijpelijk. - Gevoelige woorden: Woorden als
Jan,06-1234567ofStraatnaam 42komen heel zelden voor. De robot zietJ@nen denkt: "Hmm, dit zou 'Jan' kunnen zijn, maar het zou ook 'Jan', 'Jen' of 'Jon' kunnen zijn. Ik heb geen idee." Omdat deze woorden zeldzaam zijn, durft de robot ze niet te raden. Hij laat ze vaak alsJ@nstaan of maakt er een onzinwoord van.
3. Het Resultaat
De robot stuurt het verhaal terug.
- De zin leest als: "De patiënt Jan (waarbij de naam onduidelijk blijft) kwam naar het Huis."
- De robot heeft de zin begrijpelijk gemaakt (goed voor jou), maar de gevoelige naam is niet teruggekomen (goed voor je privacy).
Waarom is dit zo slim?
- Geen gissen: Je hoeft niet te weten wat gevoelig is. Het systeem behandelt alles hetzelfde. Je hoeft geen lijstje te maken van wat je wilt verbergen.
- Veiligheid door zeldzaamheid: Het systeem maakt gebruik van een eigenschap van taal: gewone woorden zijn makkelijk te raden door context, maar zeldzame namen en nummers zijn niet te raden zonder de originele tekst.
- Bewijs: De onderzoekers hebben dit getest met echte medische dossiers en e-mails. Ze zagen dat de robot de gewone woorden perfect herstelde, maar dat gevoelige namen en nummers net zo vaak "geraden" werden als een willekeurige reeks letters (dus bijna nooit goed).
Kortom:
In plaats van te proberen je geheimen te verstoppen in een kistje (wat soms openbreekt), gooien ze je gehele verhaal in een modderpoel. De robot is slim genoeg om de modder van de gewone woorden af te wassen, maar hij kan de modder van de zeldzame, gevoelige woorden niet wegpoetsen zonder de tekst te verpesten. Zo blijft je verhaal leesbaar, maar blijven je geheimen veilig.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.