← 最新论文
📄 cardiovascular medicine

Automated Identification of Complex Percutaneous Coronary Intervention from Cardiac Catheterization Reports Using Large Language Models

本研究表明,高容量开源大语言模型(特别是 Llama 3.3 70B)能够准确且自动地识别复杂的经皮冠状动脉介入治疗程序,并从自由文本形式的心脏导管检查报告中提取关键变量,为心血管研究中劳动密集型的人工数据提取提供了一种可扩展的替代方案。

原作者: Bhatt, N., Warner, F., Miao, J., Thakker, R., Joodi, G., Cantero-Schaffer, P., Huang, C., Krumholz, H., Murugiah, K.

发布于 2026-09-16
📖 1 分钟阅读☕ 轻松阅读

原作者: Bhatt, N., Warner, F., Miao, J., Thakker, R., Joodi, G., Cantero-Schaffer, P., Huang, C., Krumholz, H., Murugiah, K.

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 ⚕️ 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明

医院每天都会产生海量的非结构化文本。在这些文档中,最关键的便是心导管术(一种医生通过将细管穿过动脉来检查心脏血管的程序)后的叙述性报告。这些报告包含了关于患者心脏解剖结构和用于修复阻塞的具体技术的丰富细节,但它们是以自由流动的段落形式编写的,而非整齐的勾选框字段。对于研究人员和质量改进团队而言,这造成了一个显著的瓶颈。为了研究这些手术的效果或追踪整个医疗系统中病例的复杂程度,人类专家必须手动阅读成千上万份此类报告并提取特定的数据点。这一过程缓慢、昂贵且难以规模化,往往限制了重要医学研究的规模和速度。

大型语言模型(一种能够理解并生成类人文本的人工智能)的兴起为解决这一问题提供了潜在的方案。这些系统可以经过训练来阅读复杂的文档并提取特定事实,就像一个非常快速、不知疲倦的研究助手。然而,目前尚不清楚这些工具是否能够处理心脏手术记录中那种微妙且专业的语言,特别是在被要求识别涉及多个阻塞或复杂技术的“复杂”病例时。一组研究人员决定使用大量的真实世界心脏导管报告来测试这个问题。

研究人员收集了来自耶鲁纽黑文医疗系统中三家不同医院的 1,412 份去标识化的手术记录。这些文档涵盖了 2011 年至 2017 年间进行的手术,包括诊断性检查以及医生放置支架或使用球囊打开阻塞动脉的实际干预措施。为了建立一个可靠的标准进行比较,一组心脏专家手动阅读了每一份记录。他们首先确定一份报告是否描述了实际使用支架或球囊治疗冠状动脉的手术。对于那些属于此类情况的报告,他们随后提取了定义“复杂”手术的六个特定细节:治疗的血管数量、修复的不同阻塞点的数量、放置的支架总数、是否使用了针对分支血管的特定双支架技术、所有支架的总长度,以及是否治疗了慢性完全闭塞(一种长期的完全阻塞)。

有了这个人类验证的“金标准”后,该团队测试了三种不同的人工智能模型,以观察它们能否复制专家的工作。他们选择的是开源模型,这意味着其代码和权重是公开可用的,这使得研究人员能够在安全的本地计算机上运行它们,以保护患者隐私。其中一个模型是一个拥有 700 亿参数(衡量其规模和推理能力的一个指标)的大型通用系统。另外两个是较小的、专门在医学文献上进行过预训练的模型,每个拥有 70 亿参数,旨在理解临床术语。研究人员向所有三个模型输入相同的文本提示和报告,要求它们识别是否发生了手术,并提取六个特定变量。

结果显示出能力的明显差异。大型通用模型的表现显著优于两个较小的医学专用模型。当仅被要求识别一份报告是否描述了心脏手术时,该大型模型实现了完美的敏感性,这意味着它没有遗漏任何实际的手术,并且能高准确度地识别非手术记录。相比之下,较小的模型表现挣扎,其中一个经常将非手术记录误认为手术记录,而另一个则几乎无法识别出实际的手术。

当任务需要提取六个复杂细节时,差距进一步扩大。大型模型成功识别了支架数量和支架总长度,准确率非常高,通常超过 90%。它在识别治疗的血管数量方面也表现良好。然而,在需要更多解释的任务上,例如计算精确的不同阻塞点数量或判断是否使用了针对分支血管的特定双支架技术时,它的表现有所下降。在这些情况下,该模型有时会遗漏细节或误解上下文,尽管其表现仍远好于较小的模型。尽管具有专门训练,较小的医学模型仍无法一致地提取这些细节,其产生的结果往往过于不可靠,无法用于研究。

研究还考察了模型在三个医院站点的表现是否存在差异。虽然大型模型在所有三个地点都保持了高准确度,但在不同地点之间存在明显的表现差异,这可能是由于各医院医生书写记录的方式不同所致。较小的模型表现出更大的不一致性,其性能随地点变化而剧烈波动。这表明,虽然大型模型具有鲁棒性,但信息的记录方式仍然会影响结果。

研究人员分析了表现最好的模型的错误,以了解其难点所在。他们发现,当文档存在歧义或碎片化时,错误往往会发生。例如,模型有时会将诊断性测试与治疗混淆,或者难以区分是成功放置的支架还是尝试放置但未部署的支架。当报告提到一个并未实际治疗的阻塞点,或者当慢性完全闭塞的描述是隐含而非明确说明时,模型也会遇到困难。这些错误凸显了尽管这项技术很强大,但在应对人类医学写作中混乱、不一致的现实情况时,它尚未达到完美。

最终,这项研究证明,大型开源人工智能模型可以准确地从非结构化的心脏手术报告中提取复杂数据,而这项任务传统上需要耗费大量的人力劳动。研究结果表明,对于许多像支架数量这样有明确陈述的变量,这些工具可以达到适合研究的准确水平。然而,对于需要深度上下文解释的变量,该技术仍面临挑战。这项工作表明,未来可扩展的心血管研究可能在于利用这些强大的模型来处理大部分的数据提取工作,并可能结合人类监督来处理最困难的情况,而不是仅仅依赖于较小的专门模型或人工审查。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →