Data Auditing and Quality Assurance in a Federated Learning Consortium; Getting the Best of Both Worlds from Cross-Institutional and In-House Data Quality Inspection
本文表明,将内部仪表板与联邦学习仪表板相结合,能够为跨机构研究构建一种最优的数据质量保证模型,有效地在局部验证的彻底性与协作监督的生态系统级模式检测之间实现了平衡。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明
在医学研究领域,一些最重要的课题都与罕见病有关。由于这些疾病影响的人数极少,单一医院很难看到足够的病例来找到明确的答案。为了解决这个问题,科学家需要整合来自全球多家不同医院的记录。然而,一道严格的障碍挡住了去路:患者隐私。法律和伦理规则禁止医院将详细的个人健康档案发送到中央位置,因为这样做可能会泄露敏感信息。为了绕过这一限制,研究人员开发了一种称为“联邦学习”的方法。他们不是移动数据,而是将计算机程序发送给数据。程序访问每家医院,从当地记录中学习,并只带回数学上的教训,将私密文件留在原地。这种方法允许进行强大的协作而不破坏隐私,但也产生了一个新问题。如果你无法查看原始文件,你如何知道其中的数据是否准确?如果输入程序的数字是错误的,程序就无法正确学习,然而,检查错误通常需要查看那些系统旨在隐藏的个人记录。
一个研究小组致力于解决这个特定困境,该困境存在于一个名为 STRONG-AYA 的大型、不断发展的网络中,该网络专门研究青少年及年轻成年人的癌症。他们构建了两个不同的工具,或称之为仪表板,用于检查数据的质量。其中一个工具旨在供单家医院内部使用,在那里研究人员可以看到每一条个人记录。另一个工具则是为联邦网络构建的,它只能看到从其他医院传回的摘要和统计数据。为了测试这些工具的效果如何,研究人员提取了一组来自法国里昂一家癌症中心的真实乳腺癌记录数据集,并创建了两个副本。然后,他们故意在数据中引入了错误,例如将患者的年龄记录为比诊断日期还要小,或者为特定性别分配不存在的肿瘤类型。他们还模拟了一个场景,即两家不同的医院使用不同的编码系统来描述同一种疾病,这是现实世界协作中的常见问题。
结果显示,这两个工具提供了对同一情况截然不同但又同样必要的观察视角。拥有完整原始记录访问权限的院内仪表板就像是一个显微镜。它可以精准地指出哪位患者出现了错误,例如计算出的身体质量指数在物理上是不可能的,并能告诉医院工作人员具体哪条记录需要修正。它发现特定癌症分期指标的数据点中有 9.2% 缺失,并且能够将每一个缺失点追踪到特定的个人。相比之下,联邦仪表板则像是一个广角镜头。因为它无法看到个人的姓名或记录,所以它无法指向特定的患者。相反,它观察整个网络的模式。它成功检测到一家医院正在使用与另一家不同的编码系统,这种差异如果只看单一站点将会是不可见的。它还发现两个模拟中心之间某些数据点的分布存在差异,揭示了记录数据时存在的系统性差异。
研究发现,没有任何一个工具是单独完美的,仅依赖其中之一都会留下研究空白。院内工具提供了清洗数据所需的深度,但它无法看到不同医院之间对比的大局观。联邦工具可以观察机构之间的广泛趋势和差异,但缺乏修正具体错误的细节。研究人员得出结论,最好的方法是将两者结合使用。联邦系统可以提醒网络注意广泛的问题或站点间的不一致性,而院内系统则允许每家医院深入挖掘并纠正具体的错误。这种结合策略使研究人员能够在维护患者隐私的同时,依然确保用于做出救命发现的数据尽可能准确可靠。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。