← Nieuwste papers
📄 health informatics

Data Auditing and Quality Assurance in a Federated Learning Consortium; Getting the Best of Both Worlds from Cross-Institutional and In-House Data Quality Inspection

Dit artikel toont aan dat het combineren van in-house en federated learning-dashboards een optimaal model voor kwaliteitsborging van gegevens creëert voor cross-institutioneel onderzoek, waarbij de grondigheid van lokale validatie effectief wordt gebalanceerd met de schaalbare, ecosysteembrede patroondetectie van gezamenlijk toezicht.

Oorspronkelijke auteurs: Hogenboom, J., Perez, N., Filori, Q., Sans, A., Lobo Gomes, A., Dekker, A., van der Graaf, W., Husson, O., Crochet, H., Wee, L., Gouthamchand, V.

Gepubliceerd 2026-09-17
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Hogenboom, J., Perez, N., Filori, Q., Sans, A., Lobo Gomes, A., Dekker, A., van der Graaf, W., Husson, O., Crochet, H., Wee, L., Gouthamchand, V.

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). ⚕️ Dit is een AI-gegenereerde uitleg van een preprint die niet peer-reviewed is. Dit is geen medisch advies. Neem geen gezondheidsbeslissingen op basis van deze inhoud. Lees de volledige disclaimer

In de wereld van medisch onderzoek gaan sommige van de belangrijkste vragen over zeldzame ziekten. Omdat deze aandoeningen slechts een klein aantal mensen treffen, ziet een enkel ziekenhuis zelden genoeg gevallen om een duidelijk antwoord te vinden. Om dit op te lossen, moeten wetenschappers gegevens uit veel verschillende ziekenhuizen over de hele wereld combineren. Echter, een strikte barrière staat in de weg: de privacy van de patiënt. Wetten en ethische regels verbieden ziekenhuizen om gedetailleerde persoonlijke medische dossiers naar een centrale locatie te sturen, omdat dit gevoelige informatie zou kunnen blootstellen. Om dit te omzeilen, hebben onderzoekers een methode ontwikkeld die federated learning wordt genoemd. In plaats van de gegevens te verplaatsen, sturen ze het computerprogramma naar de gegevens. Het programma bezoekt elk ziekenhuis, leert van de lokale dossiers en neemt alleen de wiskundige lessen mee terug, terwijl de privébestanden achterblijven. Deze aanpak maakt krachtige samenwerking mogelijk zonder de privacy te schenden, maar het creëert een nieuw probleem. Als je niet naar de ruwe bestanden kunt kijken, hoe weet je dan of de gegevens in die bestanden accuraat zijn? Een programma kan niet correct leren als de cijfers die het gevoerd krijgt fout zijn, maar het controleren op fouten vereist meestal het inzien van de individuele dossiers die het systeem juist probeert te verbergen.

Een team van onderzoekers ging aan de slag om dit specifieke dilemma op te lossen binnen een groot, evoluerend netwerk genaamd STRONG-AYA, dat kanker bij adolescenten en jongvolwassenen onderzoekt. Ze bouwden twee verschillende hulpmiddelen, of dashboards, om de kwaliteit van de gegevens te inspecteren. Het ene hulpmiddel was ontworpen voor gebruik binnen een enkel ziekenhuis, waar de onderzoekers elk individueel dossier konden inzien. Het andere hulpmiddel werd gebouwd voor het federated netwerk, waar het alleen samenvattingen en statistieken kon zien die van de andere ziekenhuizen werden teruggestuurd. Om te testen hoe goed deze hulpmiddelen werkten, namen de onderzoekers een echte dataset van borstkankergegevens van een kankercentrum in Lyon, Frankrijk, en maakten daar twee kopieën van. Vervolgens voegden ze doelbewust fouten toe aan de gegevens, zoals het registreren van de leeftijd van een patiënt als jonger dan de datum van de diagnose, of het toewijzen van een tumortype dat niet bestaat voor een specifiek geslacht. Ze simuleerden ook een scenario waarin twee verschillende ziekenhuizen verschillende codingsystemen gebruikten om dezelfde ziekte te beschrijven, een veelvoorkomend probleem bij echte samenwerking.

De resultaten toonden aan dat de twee hulpmiddelen zeer verschillende, maar noodzakelijke perspectieven boden op dezelfde situatie. Het in-house dashboard, dat volledige toegang had tot de ruwe gegevens, fungeerde als een microscoop. Het kon precies aanwijzen welke patiënt een fout had, zoals een berekende lichaammasse-index die fysiek onmogelijk was, en kon het ziekenhuispersoneel precies vertellen welk dossier gerepareerd moest worden. Het ontdekte dat 9,2 procent van de gegevenspunten voor een specifieke kankerstadia-metriek ontbrak, en het kon elk van die ontbrekende punten herleiden naar een specifiek persoon. In contrast hiermee fungeerde het federated dashboard als een groothoeklens. Omdat het geen individuele namen of dossiers kon zien, kon het niet naar een specifieke patiënt wijzen. In plaats daarvan keek het naar de patronen in het gehele netwerk. Het detecteerde succesvol dat één ziekenhuis een ander codingsysteem gebruikte dan de andere, een discrepantie die onzichtbaar zou zijn geweest als men slechts naar één locatie keek. Het merkte ook op dat de verdeling van bepaalde gegevenspunten tussen de twee gesimuleerde centra verschilde, wat een systematisch verschil in de manier waarop de gegevens werden geregistreerd onthulde.

De studie concludeerde dat geen van beide hulpmiddelen op zichzelf perfect was, en dat het vertrouwen op slechts één van beide gaten in het onderzoek zou laten. Het in-house hulpmiddel bood de diepgang die nodig was om de gegevens te opschonen, maar kon het grote plaatje niet zien van hoe verschillende ziekenhuizen met elkaar vergeleken. Het federated hulpmiddel kon de brede trends en verschillen tussen instellingen zien, maar miste de details om specifieke fouten te herstellen. De onderzoekers concludeerden dat de beste aanpak is om beide samen te gebruiken. Het federated systeem kan het netwerk waarschuwen voor wijdverspreide problemen of inconsistenties tussen locaties, terwijl het in-house systeem elk ziekenhuis in staat stelt diep in te zoomen en de specifieke fouten te corrigeren. Deze gecombineerde strategie stelt onderzoekers in staat de privacy van hun patiënten te waarborgen en tegelijkertijd ervoor te zorgen dat de gegevens die zij gebruiken voor levensreddende ontdekkingen zo accuraat en betrouwbaar mogelijk zijn.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →