Label Differential Privacy via Aggregation
Dieses Paper schlägt ein Framework für differenzielle Privatsphäre der Labels für Regressionsaufgaben vor, das durch gewichtete lineare Aggregation von Trainingsinstanzen oder disjunkten Bags starke Privatsphäre-Garantien erreicht und dadurch verbesserte praktische Schranken sowie die Erhaltung des Nutzens bietet, ohne dass additiver Label-Rauschen erforderlich ist.
Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen
Im modernen digitalen Zeitalter werden jeden Tag riesige Mengen an persönlichen Informationen gesammelt, um Computerprogramme zu trainieren, die Vorhersagen treffen – von der Schätzung von Hauspreisen bis hin zur Prognose von Umsätzen. Eine kritische Herausforderung in diesem Bereich ist die Frage, wie man diese Systeme lehrt, ohne die sensiblen Details der Personen preiszugeben, die die Daten bereitgestellt haben. Eine leistungsstarke Lösung, bekannt als Differential Privacy, fungiert wie ein mathematischer Schutzschild. Sie stellt sicher, dass das Endergebnis einer Computeranalyse fast identisch aussieht, unabhängig davon, ob die Daten einer einzelnen Person einbezogen oder ausgeschlossen werden, was es einem Außenstehenden unmöglich macht, die spezifischen Informationen dieser Person durch Rückentwicklung zu ermitteln. Während dieses Konzept für allgemeine Daten gut untersucht wurde, entsteht ein spezifisches und schwieriges Problem, wenn die sensiblen Informationen vollständig innerhalb der Labels verborgen sind – also in den Antworten oder Ergebnissen, die an die Daten angehängt sind, wie etwa der medizinischen Diagnose eines Patienten oder der Wahl eines Wählers. Die Labels zu schützen, ohne die Fähigkeit des Computers zu zerstören, nützliche Muster zu erlernen, war lange Zeit eine Hürde.
Ein Team von Forschern bei Google Research India hat eine neue Methode entwickelt, um dieses Problem zu lösen, indem sie verändert, wie die Daten gruppiert und kombiniert werden, bevor sie überhaupt für das Training verwendet werden. Anstatt zufälliges Rauschen zu den Daten hinzuzufügen – eine Technik, die oft die Ergebnisse verschleiert und die Genauigkeit verringert –, schlugen sie ein System der gewichteten Aggregation vor. Stellen Sie sich vor, man nimmt eine große Sammlung einzelner Datensätze und mischt sie in kleine Gruppen oder „Beutel“ (Bags) zusammen. In ihrem Ansatz wird jeder Datensatz innerhalb eines Beutels mit einer einzigartigen, zufällig generierten Zahl multipliziert, die aus einer spezifischen glockenförmigen Verteilung stammt. Das System summiert diese gewichteten Datensätze auf, um einen einzigen, neuen Datenpunkt für den Beutel zu erstellen. Dieser Prozess wird wiederholt, um viele solcher aggregierten Punkte zu erstellen. Die Forscher fanden heraus, dass diese spezifische Art der Durchmischung der Daten unter Verwendung dieser Zufallsgewichte eine mathematische Barriere schafft, die die Privatsphäre der ursprünglichen Labels schützt. Entscheidend ist, dass dieser Schutz auch dann besteht, wenn ein Angreifer alles über die anderen Datensätze im Beutel weiß, vorausgesetzt, der Datensatz ist groß genug und die Labels sind nicht alle identisch.
Die Studie zeigt, dass diese Methode für zwei verschiedene Szenarien effektiv funktioniert. Im ersten Fall wird jeder einzelne Datensatz aus dem gesamten Datensatz in jeden Beutel aufgenommen, wodurch ein hochgradig gemischter Satz von Aggregaten entsteht. Im zweiten Fall wird der Datensatz in viele kleine, sich nicht überschneidende Gruppen aufgeteilt, und jede Gruppe wird separat verarbeitet. In beiden Fällen zeigten die Forscher, dass ein Computermodell, das auf diesen aggregierten, privatsphäre-geschützten Punkten trainiert wird, immer noch in der Lage ist, Vorhersagen fast so genau zu treffen wie ein Modell, das auf den ursprünglichen Rohdaten trainiert wurde. Sie testeten dies an massiven realen Datensätzen, darunter eine Volkszählung von über 130 Millionen Menschen aus dem Jahr 1940 und eine Sammlung von über 1,7 Millionen Datensätzen einer Online-Werbeplattform. Die Ergebnisse waren eindeutig: Die auf den aggregierten Daten trainierten Modelle erreichten nahezu das gleiche Genauigkeitsniveau wie jene, die auf den Rohdaten trainiert wurden, während sie gleichzeitig strenge Datenschutzgarantien erfüllten.
Eine zentrale Erkenntnis dieser Arbeit ist, dass das bloße Aufsummieren der Labels in einer Gruppe ohne diese speziellen Zufallsgewichte keinen wirklichen Schutz der Privatsphäre bietet. Wenn die Daten einfach nur summiert werden, würde eine Änderung im Label einer einzelnen Person zu einer detektierbaren Verschiebung in der Gesamtsumme führen, was deren Informationen offenlegen würde. Die Forscher bewiesen, dass die Zufallsgewichtung essenziell ist, um diese individuellen Beiträge zu verbergen. Darüber hinaus zeigten sie, dass diese Technik keine Zugabe von zusätzlichem Rauschen zu den Labels erfordert, was eine häufige Anforderung bei anderen Datenschutzmethoden ist, die oft die Qualität des Lernprozesses verschlechtern. Indem sie sich ausschließlich auf die mathematischen Eigenschaften dieser gewichteten Aggregation verließen, bewahrten sie den Nutzen der Daten für Regressionsaufgaben, die dazu verwendet werden, kontinuierliche Werte wie Umsatzzahlen oder Arbeitsstunden vorherzusagen.
Das Team untersuchte auch eine Variation, bei der ein kleiner Teil der Labels absichtlich mit Rauschen verändert wird, bevor sie gruppiert und mittels der gewichteten Aggregation kombiniert werden. Dieser hybride Ansatz ermöglichte es ihnen, die Datenschutzgarantien auf komplexere Lernaufgaben unter Verwendung von neuronalen Netzen auszuweiten – das sind Deep-Learning-Modelle, die in der Lage sind, komplizierte Muster zu verarbeiten. Ihre Experimente bestätigten, dass diese Modelle selbst mit diesen hinzugefügten Komplexitäten eine hohe Nützlichkeit beibehielten. Die Arbeit legt nahe, dass diese Aggregationsmethode für viele praktische Anwendungen, insbesondere für solche, die durch Vorschriften oder Systembeschränkungen daran gehindert werden, Rohdaten einzelner Personen zu verwenden, einen robusten Weg nach vorne bietet. Sie ermöglicht es Organisationen, leistungsstarke prädiktive Werkzeuge unter Verwendung sensibler Daten aufzubauen, ohne die Privatsphäre der hinter den Zahlen stehenden Personen zu gefährden – und das alles ohne den erheblichen Genauigkeitsverlust, der oft mit datenschutzwahrenden Techniken einhergeht.
Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?
Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.