← 最新论文
🤖 machine learning

KMGen: A Skill-based Approach for Synthetic Individual Patient Data Generation

KMGen 是一个开源的端到端框架,它通过将智能体代码生成与一种能够保留边际生存分布和人口统计学相关性的机制采样方法相结合,实现了从已发表的图表中全自动提取 Kaplan-Meier 曲线,并生成包含不良事件轨迹在内的合成个体患者数据。

原作者: Jalen Jiang, Chufan Gao, Ethan Rasmussen, Stephen Z. Xie, Jimeng Sun

发布于 2026-08-25
📖 1 分钟阅读☕ 轻松阅读

原作者: Jalen Jiang, Chufan Gao, Ethan Rasmussen, Stephen Z. Xie, Jimeng Sun

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在医学研究领域,最宝贵的资源往往是患者参与临床试验过程中的原始个体记录。这些记录包含了治疗开始的精确时间、副作用出现的时间,以及患者生存的具体时长。科学家们称之为个体患者数据(individual patient data),它是理解一种新疗法疗效的金标准。然而,出于隐私和法律保护的原因,这些详细记录几乎从未向公众发布。相反,研究人员通常只能得到最终的总结:一张显示随时间推移的生存百分比的图表,以及一份关于多少人经历了特定副作用的列表。这种总结虽然有用,但就像是通过只读最后一章来试图理解一个复杂的故事一样;故事展开时的细微差别都丢失了。由于缺乏完整的数据,很难构建更好的计算机模型来预测结果,或严格测试新的安全性监测系统。

一个研究团队开发了一种名为 KMGen 的新工具来弥补这一差距。他们的工作解决了医疗数据共享中一个长期存在的局限性。以往的方法有时可以从发布的图片中重建生存曲线,但无法创造缺失的一半患者故事:副作用的时间线。KMGen 是第一个旨在同时实现这两者的系统。它获取发布的生存曲线图和公开的临床试验注册条目,并自动生成一套完整的、合成的个体患者记录,这些记录看起来并表现得像真实数据一样。这使得科学家们可以在不接触实际患者的私密、受保护记录的情况下,在模拟真实试验的数据上测试他们的模型和安全算法。

该过程始于一个充当数字分析师的计算机程序。它的首要任务是观察一张发布的生存曲线图像——这是一种显示不同时间点仍有多少患者存活的折线图——并将那张图片转化为数字。这是一项艰巨的任务,因为这些图表通常存在线条重叠、颜色不同或干扰性的网格标记,这些都会让计算机感到困惑。该系统使用一个智能软件代理来检查图像,决定针对该特定图像的最佳技术,然后编写代码以实现像素级的精确提取。研究人员在三十两种不同类型的图表上测试了这个提取工具,范围从简洁、简单的图像到旨在欺骗软件的杂乱、扭曲的图像。该工具在几乎所有案例中都取得了成功,生成的曲线数字版本与原图几乎完全一致,误差极小,几乎难以察觉。

一旦生存曲线被数字化,系统就会进入第二个更具创造性的阶段:生成个体患者记录。该系统并非通过猜测或随机编造患者病史,而是遵循一个严格的逻辑配方。首先,一个软件代理会阅读公开的试验注册信息,以了解研究的基本事实:患者人数、平均年龄、性别以及报告的副作用类型。它将这些信息组织成一个结构化的计划。然后,一个确定性采样器(一个遵循固定数学规则的计算机程序)利用该计划创建数千名虚拟患者。

这种生成方式的设计初衷是既要真实又要可靠。系统根据风险因素(如年龄、性别和整体健康状况)创建不同的“原型”患者。然后,它为每位虚拟患者分配一个生存时间,使其符合提取自图表的曲线,从而确保整体生存模式得到精确保留。对于副作用,系统根据临床试验的典型节奏进行调度,即患者会在定期间隔进行检查。它确保那些身体较差或年龄较大的患者更有可能出现副作用,正如他们在真实试验中那样,并且确保这些事件发生的时间遵循治疗周期的自然模式。至关重要的是,这一过程的每一步都是透明且基于明确规则的,而非基于隐藏的猜测,这意味着科学家可以追踪特定患者记录是如何被创建出来的。

研究人员在涉及数百名患者的三项真实癌症临床试验中测试了整个流程。他们使用该系统生成合成数据,并将其与这些试验中真实的、隐藏的数据进行对比。结果非常接近。合成的生存曲线以极高的准确度匹配了真实的曲线,且虚拟数据中的副作用分布也高度镜像了真实数据。例如,在四种情况中的三种情况下,系统正确识别了最常见的副作用,并重现了这些副作用发生的时间,平均误差小于一个月。甚至连人口统计学细节(如年龄和性别的构成)也与真实试验几乎无法区分。

这项工作并不声称要取代真实的临床试验,也不声称能生成用于对新药做出监管决策的数据。合成记录并非真实的人类,也无法捕捉人类生物学的全部复杂性。然而,这项研究证明了,为了测试和改进科学家用于分析健康的工具这一特定目的,创造高质量、真实的模拟数据是可能的。通过提供一种从公开摘要生成个体患者数据的方法,KMGen 为研究人员提供了一种新资源,使他们能够在真实数据不可用的环境下验证其方法并探索安全性问题。该系统目前已作为开源软件发布,允许更广泛的科学界使用并完善这一方法以用于未来的研究。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →