← Neueste Arbeiten
💻 computer science

Privacy Preserving Disease Prediction Across Multiple Hospitals Using CKKS Based Homomorphic Federated Learning

Dieses Paper schlägt ein auf CKKS basierendes Framework für homogenes föderiertes Lernen vor, das eine datenschutzwahrende Krankheitsvorhersage über mehrere Krankenhäuser hinweg ermöglicht, indem es Modellaktualisierungen verschlüsselt, um Membership Inference Attacks zu verhindern, wobei diese erhöhte Sicherheit auf Kosten eines erheblichen Kommunikationsaufwands und einer im Vergleich zu Plaintext-Ansätzen reduzierten Vorhersagegüte geht.

Ursprüngliche Autoren: Swatee Nikam, Nilima Kulkarni

Veröffentlicht 2026-09-18
📖 6 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Swatee Nikam, Nilima Kulkarni

Originalarbeit lizenziert unter CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). ✨ Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

In der modernen Welt der Medizin hängt die Fähigkeit eines Arztes, die zukünftige Gesundheit eines Patienten vorherzusagen, oft von der Breite der Daten ab, die er einsehen kann. Algorithmen des maschinellen Lernens – jene Computerprogramme, die aus Mustern lernen – werden zu leistungsstarken Werkzeugen, um Risiken wie Krankenhauswiederaufnahmen oder den Fortschritt von Krankheiten zu erkennen. Diese Werkzeuge sind jedoch nur so gut wie die Informationen, mit denen sie gefüttert werden. Das Problem besteht darin, dass diese Informationen – elektronische Patientenakten, die sensible Details über Patienten enthalten – über Tausende von Krankenhäusern verstreut sind und durch strenge Datenschutzgesetze sowie institutionelle Regeln geschützt werden. Krankenhäuser können ihre Rohdatendateien nicht einfach mit einer zentralen Instanz teilen, um ein besseres Modell aufzubauen, ohne das Vertrauen der Patienten und rechtliche Vorschriften zu verletzen.

Um dies zu lösen, haben Forscher eine Methode namens „Federated Learning“ (verteiltes Lernen) entwickelt. Stellen Sie sich eine Gruppe von Köchen vor, die jeweils ein geheimes Familienrezept besitzen. Anstatt ihre Rezepte in eine zentrale Küche zu schicken, wo sie gestohlen oder kopiert werden könnten, vereinbaren sie, ihre Gerichte lokal zuzubereiten und nur den fertigen Geschmack an einen zentralen Richter zu senden. Der Richter kombiniert diese Geschmacksrichtungen, um ein Meisterrezept zu erstellen, das dann an die Köche für ihren nächsten Versuch zurückgesendet wird. In dieser digitalen Version sind die „Rezepte“ die Daten, die „Köche“ die Krankenhäuser und der „Geschmack“ die mathematische Aktualisierung des Computermodells. Die rohen Patientendaten verlassen das Krankenhaus nie. Doch selbst diese Methode hat einen Fehler: Der zurückgesendete „Geschmack“ kann manchmal zu viel über die verwendeten spezifischen Zutaten verraten, was es einem neugierigen Beobachter ermöglicht, zu erraten, welche Patienten Teil des Trainingsdatensatzes waren. Um dies zu beheben, erforschen Wissenschaftler nun eine Technik namens homomorphe Verschlüsselung, die Berechnungen auf Daten ermöglicht, die in einem digitalen Tresor verschlossen bleiben, wodurch sichergestellt wird, dass selbst die Person, die die Kombination vornimmt, die Rohzahlen nicht sehen kann.

Ein Team von Forschern an der MIT School of Engineering in Pune, Indien, hat dieses Konzept kürzlich in einer simulierten Umgebung getestet, die ein Netzwerk aus zehn Krankenhäusern nachbildet. Ihr Ziel war es zu sehen, ob sie ein Modell des maschinellen Lernens entwickeln können, um vorherzusagen, ob ein Patient mit Diabetes innerhalb von dreißig Tagen wieder in das Krankenhaus aufgenommen wird, während sie gleichzeitig die Patientendaten vollständig verborgen und die Modellaktualisierungen verschlüsselt hält. Sie verwendeten eine spezifische Art von digitalem Schloss, bekannt als CKKS, das mathematische Näherungsberechnungen auf verschlüsselten Zahlen ermöglicht – eine notwendige Funktion, da medizinische Daten oft Dezimalzahlen und Brüche statt nur ganze Zahlen beinhalten.

Die Forscher richteten ein virtuelles Experiment unter Verwendung eines öffentlichen Datensatzes ein, der Aufzeichnungen aus 130 echten Krankenhäusern enthielt, den sie in zehn separate Stücke schnitten, um zehn verschiedene Institutionen darzustellen. Jedes virtuelle Krankenhaus trainierte seine eigene Version des Vorhersagemodells auf seinen lokalen Daten. In einem Standard-, unverschlüsselten Szenario würden diese Krankenhäuser ihre Modellaktualisierungen direkt an einen zentralen Server senden. In diesem neuen Experiment jedoch verschlossen die Krankenhäuser ihre Aktualisierungen zuerst in einem digitalen Tresor mittels der CKKS-Methode. Der zentrale Server, der als „ehrlicher, aber neugieriger“ Koordinator fungierte, erhielt diese verschlossenen Pakete. Er führte die Mathematik durch, um sie zu mitteln, ohne jemals die einzelnen Beiträge zu entschlüsseln. Erst nachdem die Mittelung abgeschlossen war, wurde das Endergebnis an eine vertrauenswürdige Partei gesendet, um entsperrt und zur Aktualisierung des globalen Modells verwendet zu werden.

Die Ergebnisse dieses Experiments zeigten einen klaren und schwierigen Zielkonflikt zwischen Privatsphäre und Leistung. Als die Forscher dieselbe Aufgabe ohne Verschlüsselung ausführten, war das System unglaublich effektiv und identifizierte Wiederaufnahmerisiken mit einem hohen Grad an Genauigkeit. Das Modell lernte schnell und lieferte zuverlässige Vorhersagen. In diesem unverschlüsselten Zustand war das System jedoch verwundbar; ein Angreifer konnte die Aktualisierungen analysieren und erfolgreich erraten, ob die Daten eines bestimmten Patienten Teil des Trainings waren, was das Versprechen der Privatsphäre effektiv brach.

Als die Forscher die Verschlüsselung aktivierten, funktionierte der Schutz der Privatsphäre genau wie intendiert für den untersuchten Angriffspfad. Das System reduzierte die Fähigkeit eines Angreifers, zu erraten, ob die Daten eines Patienten im Trainingssatz enthalten waren, auf das Niveau des Zufalls; es erreichte eine Erfolgsquote von genau fünfzig Prozent, was dem Werfen einer Münze entspricht. Dieser Befund steht im Einklang mit dem Schutz des evaluierten Protokolls gegenüber einem ehrlichen-aber-neugierigen Server, ist jedoch keine Garantie für Immunität gegen alle Datenschutzangriffe oder alle adversen Bedingungen. Die Krankenhausdaten blieben wahrhaft privat, und der zentrale Server sah nichts als verschlüsselte Zahlen.

Dieser Privatsphäre stand jedoch ein erheblicher Preis gegenüber. Das verschlüsselte System war viel langsamer und erforderte weitaus mehr Datenübertragung über das Netzwerk. Die Größe der Datenpakete, die von jedem Krankenhaus gesendet wurden, wuchs um den Faktor vierundzwanzig, was bedeutete, dass der Datenverkehr pro Trainingsrunde von etwa 3 Megabyte auf fast 38 Megabyte anstieg. Zudem sank die Vorhersagekraft des Modells spürbar. Während das unverschlüsselte Modell eine hohe Punktzahl bei der korrekten Identifizierung von Wiederaufnahmen erreichte, hatte die verschlüsselte Version Schwierigkeiten; ihre Fähigkeit, zwischen Patienten, die zurückkehren würden und solchen, die nicht zurückkehren würden, zu unterscheiden, fiel auf ein Niveau, das zwar besser als bloßes Raten war, aber weit weniger nützlich für klinische Entscheidungen war. Das Modell benötigte auch länger, um zu stabilisieren, und zeigte ein unruhigeres Verhalten, während es versuchte, aus den verschlossenen Daten zu lernen.

Die Studie kommt zu dem Schluss, dass es technisch zwar möglich ist, ein privatsphärebewusstes System für die krankenhausübergreifende Krankheitsvorhersage mit dieser Methode aufzubauen, es sich jedoch noch nicht um eine perfekte Lösung handelt. Die Technologie verhindert erfolgreich die spezifischen Datenschutzlecks, die die Forscher getestet haben, tut dies jedoch, indem sie das System wesentlich schwerfälliger und weniger genau macht. Die Forscher stellten fest, dass für diesen spezifischen Aufbau der Verlust an Vorhersagequalität und der massive Anstieg der Anforderungen an die Datenübertragung erhebliche Hürden darstellen. Sie schlagen vor, dass für die praktische Anwendung dieses Ansatzes künftige Arbeiten darauf fokussieren müssen, die Größe der verschlüsselten Daten zu reduzieren und die Fähigkeit des Modells zu verbessern, trotz der digitalen Schlösser effektiv zu lernen. Bis dahin bleibt die Wahl zwischen einem hochgenauen Modell, das die Privatsphäre gefährdet, und einem perfekt privaten Modell, das weniger genau ist, ein schwieriger Balanceakt für Gesundheitseinrichtungen.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →