← 最新论文
🤖 AI

A Pipeline for Generating Longitudinal Synthetic Clinical Notes Using Large Language Models

本文介绍了一种模块化流水线以及一个包含 70 份合成纵向患者记录(每份记录包含 20–50 篇临床笔记)的相应数据集,这些记录是利用大语言模型生成的,旨在支持开发和评估保护隐私的临床人工智能工具,同时确保内部一致性和现实的变异性。

原作者: William Poulett

发布于 2026-06-26
📖 1 分钟阅读☕ 轻松阅读

原作者: William Poulett

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教一个机器人如何成为一名医生。为此,你需要向它展示成千上万个真实的患者故事。但问题在于,真实的患者故事就像是“顶级机密日记”。它们充满了私人信息,法律规定你不能就这样把它们交给机器人去研究。

这篇论文提出了一个解决方案:建立一个制造虚假患者故事的工厂。这些故事看起来、感觉起来都与真实的完全一致,但其中并不包含任何真实的人。

以下是他们如何建造这个工厂的,用简单的语言解释如下:

1. 蓝图:构建患者

首先,团队需要为他们的故事创建“角色”。他们并没有随机编造,而是使用了一个叫做 Synthea 的工具(可以把它想象成一个数字人口模拟器)来创建 70 名虚假患者。

  • 转折点: 由于原始工具是美国的,他们对其进行了调整以适应英国,确保这些虚假患者拥有英国的名字、地址和人口统计特征。
  • 细节处理: 随后,他们要求一个超级聪明的 AI(GPT-4o)来填补空白,比如患者的下一顺位亲属是谁,或者他们有哪些过敏史。他们甚至确保 AI 不会给每个人都分配青霉素过敏(这是一个常见的 AI 错误),而是通过手动输入真实的现实世界过敏统计数据来确保准确性。

2. 情节:医院之旅

一旦患者存在了,工厂就会模拟他们在医院的整个停留过程。

  • 设定: 患者入院(无论是计划内的还是急诊)。
  • 故事弧线: AI 会写出一个旅程的“骨架”:患者到达 -> 医生检查 -> 手术进行 -> 患者好转 -> 患者回家。
  • 检查机制: 如果 AI 写到一半累了并停止了写作,系统的另一部分会注意到并说:“嘿,把故事写完!”它还会检查故事是否合乎逻辑(例如,你不能在到达之前进行手术)。

3. 剧本:撰写病历记录

这是最复杂的部分。在真实的医院里,不同的医生有不同的书写风格。有些人写得简短且潦草;有些人则写得冗长且详细。

  • 演员: 工厂为每一位工作人员分配了一个“人格”。一位医生可能是要点型书写者(快速、高效);而另一位则是故事讲述者(辞藻华丽、详细)。还有一位可能是速记专家,会使用大量的医学缩写。
  • 表演: AI 会为旅程中的每一个事件撰写一份特定的临床记录,并采用那位“书写”医生的特定风格。
  • 真实感润色: 为了让它感觉更真实,工厂加入了拼写错误(比如按错了键)和缩写(比如用“SOB”代表呼吸短促)。他们甚至确保有些医生比其他人表现得更凌乱,就像现实生活中一样。

4. 编辑:质量控制

在记录发布之前,它们要经过严格的编辑流程。

  • 事实核查员: 另一个 AI 充当编辑。它阅读记录并将其与“骨架”故事进行对比。它会问:“这位医生提到手术了吗?他提到过过敏吗?他是不是凭空捏造了一个症状?”
  • 循环机制: 如果记录缺失了某些内容或出现了“幻觉”(编造了事实),编辑会将它发回给作者进行修改。这个过程会不断循环,直到记录完美为止。

最终产品

其结果是一套包含 70 名虚假患者 的数据集,每位患者都有 20 到 50 份虚假的医疗记录,涵盖了他们在医院的整个停留过程。

  • “白银级(Silver)”版本: 这是他们发布的版本。它质量很高,由 AI 生成并由 AI 检查,但尚未经过人类医生的阅读。
  • “黄金级(Gold)”版本(未来计划): 他们计划稍后发布一个经过真实人类医生双重检查的版本。

为什么要这样做?

论文解释说,这些虚假数据是一个安全的游乐场。开发者可以使用它来构建和测试 AI 工具——例如用于总结患者记录的工具、用于进行医疗编码的工具,或者用于预测患者住院时长的工具——而无需承担任何泄露真实患者隐私的风险。

该论文并未声称:

  • 它并不认为这些虚假记录在所有情况下都能完美替代真实数据。
  • 它承认真实的医院生活是混乱且复杂的,虽然他们的工厂做得很好,但可能会错过一些“边缘案例”(即现实生活中发生的那些奇怪、罕见或混乱的情况)。
  • 它警告说,AI 偶尔仍可能出现“幻觉”(编造事实),这也是为什么他们设有如此严格的编辑循环。

简而言之,他们构建了一个医疗文书模拟器。它不是真实的东西,但它是安全的、可扩展的,并且足够详细,足以训练下一代医疗 AI 工具。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →