← Neueste Arbeiten
📄 health informatics

Data Auditing and Quality Assurance in a Federated Learning Consortium; Getting the Best of Both Worlds from Cross-Institutional and In-House Data Quality Inspection

Diese Arbeit zeigt auf, dass die Kombination von hausinternen und föderierten Learning-Dashboards ein optimales Modell zur Sicherung der Datenqualität für die institutionenübergreifende Forschung schafft, welches die Gründlichkeit der lokalen Validierung effektiv mit der skalierbaren, ökosystemweiten Mustererkennung kollektiver Aufsicht in Einklang bringt.

Ursprüngliche Autoren: Hogenboom, J., Perez, N., Filori, Q., Sans, A., Lobo Gomes, A., Dekker, A., van der Graaf, W., Husson, O., Crochet, H., Wee, L., Gouthamchand, V.

Veröffentlicht 2026-09-17
📖 4 Min. Lesezeit☕ Kaffeepausen-Lektüre

Ursprüngliche Autoren: Hogenboom, J., Perez, N., Filori, Q., Sans, A., Lobo Gomes, A., Dekker, A., van der Graaf, W., Husson, O., Crochet, H., Wee, L., Gouthamchand, V.

Originalarbeit lizenziert unter CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). ⚕️ Dies ist eine KI-generierte Erklärung eines Preprints, das nicht peer-reviewed wurde. Dies ist kein medizinischer Rat. Treffen Sie keine Gesundheitsentscheidungen auf Grundlage dieses Inhalts. Vollständigen Haftungsausschluss lesen

In der Welt der medizinischen Forschung betreffen einige der wichtigsten Fragen seltene Krankheiten. Da diese Zustände nur sehr wenige Menschen betreffen, sieht ein einzelnes Krankenhaus selten genügend Fälle, um eine klare Antwort zu finden. Um dies zu lösen, müssen Wissenschaftler die Aufzeichnungen vieler verschiedener Krankenhäuser auf der ganzen Welt kombinieren. Doch eine strikte Barriere steht im Weg: der Schutz der Privatsphäre der Patienten. Gesetze und ethische Regeln verbieten es Krankenhäusern, detaillierte persönliche Gesundheitsakten an einen zentralen Ort zu senden, da dies sensible Informationen offenlegen könnte. Um dies zu umgehen, haben Forscher eine Methode namens Federated Learning entwickelt. Anstatt die Daten zu bewegen, schicken sie das Computerprogramm zu den Daten. Das Programm besucht jedes Krankenhaus, lernt aus den lokalen Aufzeichnungen und bringt nur die mathematischen Lektionen zurück, während die privaten Dateien zurückbleiben. Dieser Ansatz ermöglicht eine leistungsstarke Zusammenarbeit, ohne die Privatsphäre zu verletzen, schafft aber ein neues Problem. Wenn man die Rohdateien nicht einsehen kann, woher weiß man dann, ob die Daten darin korrekt sind? Ein Programm kann nicht korrekt lernen, wenn die Zahlen, mit denen es gefüttert wird, falsch sind, doch die Überprüfung auf Fehler erfordert normalerweise das Einsehen der einzelnen Datensätze, die das System eigentlich verbergen soll.

Ein Forscherteam setzte sich zum Ziel, genau dieses Dilemma innerhalb eines großen, sich entwickelnden Netzwerks namens STRONG-AYA zu lösen, das Krebs bei Jugendlichen und jungen Erwachsenen untersucht. Sie entwickelten zwei verschiedene Werkzeuge oder Dashboards, um die Qualität der Daten zu überprüfen. Ein Werkzeug war für den Einsatz innerhalb eines einzelnen Krankenhauses konzipiert, wo die Forscher jeden einzelnen Datensatz sehen konnten. Das andere Werkzeug wurde für das föderierte Netzwerk gebaut, wo es nur Zusammenfassungen und Statistiken sehen konnte, die von den anderen Krankenhäusern zurückgesendet wurden. Um zu testen, wie gut diese Werkzeuge funktionierten, nahmen die Forscher einen echten Datensatz von Brustkrebs-Aufzeichnungen aus einem Krebszentrum in Lyon, Frankreich, und erstellten zwei Kopien davon. Dann führten sie absichtlich Fehler in die Daten ein, wie etwa die Aufzeichnung des Alters eines Patienten als jünger als sein Diagnosedatum oder die Zuweisung eines Tumortyps, der für ein bestimmtes Geschlecht nicht existiert. Sie simulierten auch ein Szenario, in dem zwei verschiedene Krankenhäuser unterschiedliche Kodierungssysteme zur Beschreibung derselben Krankheit verwendeten – ein in der realen Zusammenarbeit häufig auftretendes Problem.

Die Ergebnisse zeigten, dass die beiden Werkzeuge sehr unterschiedliche, aber notwendige Ansichten derselben Situation boten. Das interne Dashboard, das vollen Zugriff auf die Rohdatensätze hatte, fungierte wie ein Mikroskop. Es konnte genau bestimmen, welcher Patient einen Fehler hatte, wie etwa einen berechneten Body-Mass-Index, der physisch unmöglich war, und dem Krankenhauspersonal präzise mitteilen, welcher Datensatz korrigiert werden musste. Es fand heraus, dass 9,2 Prozent der Datenpunkte für eine bestimmte Krebsstadien-Metrik fehlten, und konnte jeden dieser fehlenden Punkte einer bestimmten Person zuordnen. Im Gegensatz dazu fungierte das föderierte Dashboard wie ein Weitwinkelobjektiv. Da es keine Namen oder individuellen Datensätze sehen konnte, konnte es nicht auf einen bestimmten Patienten hinweisen. Stattdessen betrachtete es die Muster über das gesamte Netzwerk hinweg. Es erkannte erfolgreich, dass ein Krankenhaus ein anderes Kodierungssystem verwendete als das andere – eine Diskrepanz, die unsichtbar geblieben wäre, wenn man nur einen Standort betrachtet hätte. Es stellte auch fest, dass die Verteilung bestimmter Datenpunkte zwischen den beiden simulierten Zentren unterschiedlich war, was einen systematischen Unterschied in der Art und Weise aufzeigte, wie die Daten erfasst wurden.

Die Studie ergab, dass keines der Werkzeuge allein perfekt war und dass das Vertrauen auf nur eines davon Lücken in der Forschung hinterlassen würde. Das interne Werkzeug bot die nötige Tiefe, um die Daten zu bereinigen, konnte aber nicht das Gesamtbild davon sehen, wie die verschiedenen Krankenhäuser untereinander verglichen wurden. Das föderierte Werkzeug konnte die breiten Trends und Unterschiede zwischen Institutionen erkennen, verfügte jedoch nicht über die Detailtiefe, um spezifische Fehler zu beheben. Die Forscher kamen zu dem Schluss, dass der beste Ansatz darin besteht, beide gemeinsam zu nutzen. Das föderierte System kann das Netzwerk auf weit verbreitete Probleme oder Inkonsistenzen zwischen Standorten aufmerksam machen, während das interne System es jedem Krankenhaus ermöglicht, tief in die Materie einzutauchen und die spezifischen Fehler zu korrigieren. Diese kombinierte Strategie erlaubt es den Forschern, die Privatsphäre ihrer Patienten zu wahren und gleichzeitig sicherzustellen, dass die Daten, die sie für lebensrettende Entdeckungen nutzen, so genau und zuverlässig wie möglich sind.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →