Metadata-based Methods to Generate Synthetic Health Data: A Scoping Review
本范围综述识别了现有的基于元数据的生成合成健康数据的方法,并强调了其在标准化评估、伦理指导以及在联邦分析背景下对代码开发的特定适用性方面存在的关键空白。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你是一名试图破解谜团的侦探,但警察已经封锁了犯罪现场。你不能接触真实的证据,因为其中包含了真实人物的隐私信息,而且规则规定你不能把它们带回家。这正是研究健康数据的研究人员所面临的情况。他们需要测试他们的计算机脚本和理论,而这些理论是基于“电子健康记录”(EHR)——即患者就诊、诊断和用药的数字文件——但如果不违反隐私法,他们就无法使用真实的档案。因此,他们需要一个替身。他们需要“合成数据”:看起来和表现起来都与真实记录极其相似,但却不属于任何人的虚假患者记录。
通常,为了制作这些虚假记录,科学家们尝试将真实数据“复制粘贴”到一个复杂的机器学习机器人中。但这个机器人是一个“黑箱”:它在秘密运行,如果它不小心泄露了一个真实人物的秘密,那将是一场灾难。此外,在许多现代研究设置(称为“联邦分析”)中,真实数据被锁定在不同的医院中,这些医院从不共享文件。如果机器人看不见数据,它就无法工作。这就是另一种方法发挥作用的地方:“基于元数据”(metadata-based)的方法。这些方法不是观察单个患者杂乱且私密的细节,而是使用一种“配方”或“蓝图”。它们查看汇总统计数据(例如“50% 的患者年龄在 50 岁以上”)和公共知识,从而从零开始构建虚假的患者,而无需接触真实的、私密的档案。
这篇论文是一项范围综述(scoping review),就像是一次巨大的地图绘制远征。作者们——来自乌得勒支的一组研究人员——想要了解目前存在哪些用于构建这种“仅基于蓝图”的虚假健康记录的工具。他们不仅看了这些工具,还看了“规则手册”。他们问道:我们如何知道这些虚假数据是否好用?是否有规则来确保它们是安全的?最重要的是,我们能否利用这些虚假记录在接触真实数据之前先测试我们的代码?
团队搜寻了科学文献,发现了 23 篇文章。其中 12 篇描述了生成数据的具体方法,另外 11 篇是讨论如何评判数据以及相关法律规则的综述。以下是他们的发现:
工具:用蓝图进行构建
研究人员发现了六种生成这种“蓝图”数据的主要方式。
- Synthea: 这是最著名的工具。它就像一个视频游戏中的角色创建器。它从基于公共人口普查数据(如美国人口普查)的人口开始。然后,它模拟一个患者的一生。它使用“蒙特卡洛”方法(一种高级说法,即根据概率进行数字掷骰子)来决定患者是否会感染耳疾、患病时的年龄以及接受什么药物。它根据公共知识和用户设置构建患者的整个医疗史,从未需要真实的患者档案。
- OSIM: 该工具旨在使用“OMOP 通用数据模型”的语言进行交流,这是一种健康数据的标准格式。它获取汇总表(例如“有多少人患有糖尿病”),并构建一个符合该标准的虚假数据集。
- SASC: 一个专门针对 COVID-19 数据的基于 Web 的应用程序。它获取汇总表并生成带有实验室结果和结局的虚假患者记录。
- Davis 等人的方法: 这种方法很独特,因为它模拟了“学习”。它设想医生随着时间的推移在治疗患者方面变得更加专业。它构建的虚假数据包含了这种进步曲线,这对于测试新疗法在现实世界中的表现非常有用。
- ODM 生成器: 这个工具有点不同。它并不试图让数据在统计上看起来真实,它只是确保数据遵循临床试验正确的“语法”(syntax)。它就像是数据结构的拼写检查器。
- Barr 等人的方法: 一种使用大语言模型(如 GPT-4o)的新方法。研究人员给 AI 一组统计数据(例如“平均年龄为 45 岁”),并要求它编写一张虚假患者表。这是一种非常新颖、实验性的方法。
问题:我们有工具,但没有规则手册
这里是故事的转折点。虽然作者们找到了这些工具,但他们发现我们在如何检查它们是否有效方面存在巨大的差距。
- “保真度”陷阱: 每当这些方法被测试时,研究人员几乎只检查“保真度”(fidelity)。这意味着他们询问:“虚假数据看起来像真实数据吗?”他们比较平均值和图表。但他们很少检查“效用”(utility)。效用是在问:“这些虚假数据是否真的能帮我写出更好的代码或解决问题?”
- 缺失的环节: 论文明确指出,没有人真正测试过这些基于元数据的方法是否适用于它们的特定用例:在联邦分析中的代码开发。我们不知道这些虚假数据是否“足够好”,以便用来测试一个稍后将在受限的医院数据上运行的脚本。
- 评估的混乱: 作者查看了另外 11 篇关于如何评判合成数据的综述。他们发现了一堆不同的定义。有些人称之为“保真度”,有些人称之为“相似性”或“相似度”。有些人包含了“公平性”(确保虚假数据不会对少数群体产生偏见),而有些人则忽略了这一点。目前还没有统一的、公认的规则手册。
- 法律灰色地带: 这篇综述发现关于法律和伦理方面的讨论非常少。虽然我们对真实数据有规则,但对于这种“虚假”数据的规则仍然模糊不清。作者指出,像 FDA 和 EMA 这样的主要监管机构尚未给出明确的指导。
结论
论文得出结论,我们拥有一个充满有趣方式的工具箱,可以用这些方式在不接触真实患者的情况下构建虚假健康数据。然而,我们是在盲目飞行。我们还没有标准化如何测试这些工具,也还没有弄清楚如何使用它们来测试安全、联邦环境中的计算机代码。
作者建议,未来的研究应该停止仅仅询问“它看起来真实吗?”,而应该开始询问“它能否胜任这项工作?”他们呼吁建立一个新的标准化框架,将生成方法与预期用途相匹配。在此之前,使用这些工具为现实世界的健康研究构建代码,就像是在不知道机翼是否能在真实的风洞中承受住风力的情况下建造一架模型飞机。潜力是巨大的,但安全检查的规则仍在编写之中。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。