← 最新论文
📊 epidemiology

Feasibility of using automatically extracted routine clinical data in a respiratory cohort study: The SPHN-SPAC demonstrator project.

SPHN-SPAC 演示项目表明,自动提取的常规临床数据可以通过提高数据的完整性和捕捉更多事件,有效地补充儿科呼吸系统队列研究中的人工抽象,尽管其更广泛的应用目前受到异质性文档实践以及数据协调所需大量精力的限制。

原作者: Romero, F., Sasaki, M., Mallet, M. C., Pedersen, E. S. L., Leuenberger, L. M., Makhoul, R., Bovermann, X., Hartung, A., Latzin, P., Kissling, S., Moeller, A., Treis, A., Regamey, N., Belle, F. N., Kue
发布于 2026-07-16
📖 1 分钟阅读☕ 轻松阅读

原作者: Romero, F., Sasaki, M., Mallet, M. C., Pedersen, E. S. L., Leuenberger, L. M., Makhoul, R., Bovermann, X., Hartung, A., Latzin, P., Kissling, S., Moeller, A., Treis, A., Regamey, N., Belle, F. N., Kuehni, C. E.

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 ⚕️ 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明

想象一下,你正在试图解开一个巨大的拼图,但拼图碎片散落在成千上万个不同的盒子中。这就是医学研究的世界,科学家们试图了解疾病如何随着时间的推移影响人类。为了做到这一点,他们通常需要建立一个“队列”(cohort),这只是一个高级词汇,指的是他们密切追踪的一组人群。传统上,研究人员必须扮演“人工抄写员”的角色,坐在医院里,手动将患者档案中的笔记复制到他们自己的数据库中。这既缓慢又昂贵,有点像试图用一把小勺子去填满一个游泳池。

近年来,出现了一个新想法:如果我们能直接要求医院的计算机为我们自动提取出正确的碎片,会怎样呢?这就是“常规临床数据”(routine clinical data)发挥作用的地方。这些是医生和护士在治疗患者时每天创建的数字记录——比如血液检测结果、就诊日期和诊断结果。人们希望,如果我们能教会计算机自动抓取这些数据,我们就能更快、更便宜地研究庞大的人群。然而,这里有一个陷阱。仅仅因为数据存在于计算机中,并不意味着它已经准备好可以被使用了。它可能以一种“秘密代码”的形式编写,或者以混乱的格式存储,亦或是隐藏在系统的不同部分。研究人员提出的核心问题是:我们真的可以信任这些自动化的数字抓取工具能提供与细心的真人抄写员一样优质的信息吗?还是说,计算机只会递给我们一堆破碎的拼图碎片?

这篇论文讲述了一个瑞士团队的故事,他们决定利用一群患有呼吸系统问题的儿童来测试这个想法。他们建立了一个“演示项目”,旨在看看能否利用一个名为瑞士个性化健康网络(SPHN)的自动化系统来取代或至少辅助他们的真人抄写员。

研究人员观察了 1,075 名参与“瑞士儿科气道队列”(SPAC)研究的儿童。多年来,一直有一组人类研究人员在手动复制这些儿童医疗记录中的数据。对于这个新项目,团队要求医院计算机使用 SPHN 系统自动提取相同的信息。他们想了解三件事:获取数据需要多长时间、他们实际能获取多少数据,以及计算机的数据与人类的数据匹配程度如何。

结果喜忧参半。首先,这个自动化系统是一个“数据饥渴型怪物”,而且是好的一方面。它发现的就诊次数远比人类发现的多。例如,在一家医院,计算机找到了 1,963 次门诊就诊,而人类只记录了 1,049 次;在另一家医院,计算机找到了 2,343 次,而人类仅有 1,010 次。计算机还成功找到了那些父母甚至没有填写随访问卷的儿童的就诊记录,起到了一个“安全网”的作用,捕捉到了人类遗漏的信息。

然而,获取这些数据并不像按下“下载”按钮那么简单。团队花了大约 24 个月——整整两年时间!——才让数据准备就绪。他们必须在不同的医院计算机系统组成的迷宫中穿梭,每个系统都说着自己的语言。数据是以 RDF(资源描述框架)这种格式输出的,这是一种计算机非常喜欢、但人类觉得难以理解的高度结构化且抽象的信息组织方式。团队不得不投入大量的时间和资金(预先支付了约 24.2 万瑞士法郎)将其转化为他们研究中可以实际使用的格式。

当他们终于对比两套数据集时,发现对于计算机能够找到的内容,其准确性令人惊讶。对于身高、体重和肺功能测试(肺功能测定)等结构化数字,计算机与人类几乎完全一致。这些数字匹配得如此紧密,以至于在这些特定项目上,计算机数据的可靠性与人类数据不相上下。但计算机并非完美无缺。它漏掉了一些人类能轻松发现的信息,比如门诊期间开具的药物详情,或者是过敏皮肤点刺试验的结果。此外,它在处理那些写在自由文本笔记中而非输入特定框内的信息时也显得力不从心。

团队还检查了计算机数据与家长关于急诊室就诊情况的调查报告之间的匹配程度。计算机和家长在“是否发生过就诊”这一点上基本达成了一致(高“阴性一致性”),但当就诊确实发生时,他们在具体时间或细节上并不总是一致。这可能是因为家长可能记得去了另一家医院,而计算机并未监测到该医院,或者是因为他们可能会忘记一些轻微的就诊。

最后,论文指出,自动数据提取是一个强大的工具,它可以为研究人员提供更多的信息,并捕捉到人类可能遗漏的东西,但它目前还不能完全取代“人工触感”。计算机擅长抓取那些简单的、结构化的数字,但在理解患者故事中那些凌乱、手写或自由文本的部分时,仍然需要大量的帮助。研究人员总结道,虽然这项技术前景广阔,但我们需要改进医院记录笔记的方式,并开发更好的工具来翻译计算机的语言,这样我们才能充分依赖它来完成所有工作。它是一个非常有用的助手,但目前来看,它仍然需要一名人类监督员来确保拼图碎片能够正确地拼合在一起。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →