Hierarchical temporal transformer for cancer grade prediction and cross cancer transfer learning from pathology reports
本文介绍了分层时间变换器(Hierarchical Temporal Transformer, HTT),这是一种利用纵向病理报告和癌症类型嵌入的双层架构,旨在实现最先进的癌症分级预测,并展示了在不损失性能的情况下向未见癌症类型的有效零样本迁移学习能力。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明
医院产生着源源不断的书面记录。当患者就诊时,医生会写下他们所观察到的现象、他们的怀疑以及患者病情自上次就诊以来的变化。几十年来,计算机一直难以通过阅读这些笔记来辅助医生做出决策。大多数分析医学文本的计算机程序将每份笔记视为一个单一、孤立的事件。它们阅读一份报告,做出一个猜测,然后便转向下一份,完全遗忘了之前的叙述过程。这种方法忽略了人类体验中至关重要的一部分:时间。患者的健康是一段旅程,而非一张快照。如果两年前的扫描结果显示稳定,而今天的扫描显示有微小变化,这与上周才显示出快速增长的扫描结果相比,其意义截然不同。此外,大多数计算机模型仅被训练去理解一种特定类型的癌症。一个专门用于阅读肺癌报告的程序在处理甲状腺癌报告时往往会失效,这迫使医院必须建立并维护数十个独立的、昂贵的系统。
一组研究人员致力于同时解决这两个问题。他们开发了一种新的计算机系统,旨在阅读患者整个就诊历史,并密切关注就诊日期和月份之间的实际间隔。他们还希望测试该系统是否能如此深入地学习癌症严重程度的通用语言,以至于能够理解它从未见过的癌症类型。为了测试这一点,他们设计了一个分为两部分的实验。首先,他们构建了一个可以精确控制叙事逻辑的模拟医学报告世界,以确保计算机必须利用时间线才能得出正确答案。其次,他们将数千份来自公共数据库的真实病理报告输入该系统,要求它判断那些在训练过程中完全被隐藏起来的癌症类型的肿瘤严重程度。
他们构建的系统有两个截然不同的阶段,非常类似于人类阅读文件的过程。第一阶段阅读每份单独的报告,并将文字转化为关于该次就诊具体意义的密集摘要。第二阶段则观察单个患者的一系列摘要。它不仅观察报告的顺序,还会测量两次报告之间实际经过的时间。如果患者在手术三周后进行了一次扫描,六个月后又进行了一次,系统就会理解第二次事件比如果两次扫描仅间隔一周要遥远且重要得多。这使得计算机能够权衡疾病的历史,而不只是看最近的一份笔记。为了处理不同类型的癌症,该系统为每种疾病家族使用了一个特殊的标记,教导它虽然词汇可能会改变,但“侵略性”或“轻微”的底层概念在不同器官之间是相似的。
当研究人员在模拟数据上测试该系统时,结果非常明确。那个能够阅读完整时间线及就诊间隔的计算机,在预测疾病进展方面明显优于仅观察最新报告的计算机。在一个特定的测试中,系统必须预测一种它从未见过的癌症类型的预后,而时间感知型系统表现得更为准确。它成功地利用从其他癌症中学到的生长模式来理解这种新癌症。这表明,追踪时间和历史的能力是一种真正的优势,而不仅仅是一个功能特性。
研究的第二部分从模拟转向现实,使用了来自十四种不同癌症类型患者的数千份真实病理报告。研究人员在其中十一种类型上对系统进行了训练,然后完全封锁了另外三种类型的报告,包括甲状腺癌、肉瘤和一种特定类型的肺癌。他们要求系统预测这些未见癌症类型的肿瘤分级(即衡量癌症侵略性的指标)。结果令人瞩目。该系统在处理未见癌症时的表现与其在受训癌症上的表现不相上下。它在甲状腺癌上取得了完美的分数,并在其他癌症上取得了极高的分数。这证明了该系统并非仅仅死记硬背针对特定癌症的特定词汇,而是学习到了一种更深层的、通用的癌症严重程度语言,这种语言适用于不同的疾病家族。
研究人员随后调查了这种知识是如何转移的。他们发现,理解新癌症类型的能力主要来自于系统最初对海量医学文本的训练,这让它掌握了诸如“侵略性”或“分化不良”等词汇的通用含义。而负责追踪时间和历史的部分,虽然对于理解患者的就医历程非常强大,但并不是实现这种跨癌症成功的核心驱动力。在现实世界的测试中,由于每个患者只有一份报告,时间追踪组件由于没有可分析的历史记录而无法发挥作用,但系统依然取得了成功。这表明,识别癌症严重程度的核心智能已经存在于基础语言模型中,并等待着被应用于新的情境。
这些发现为医学人工智能指明了一条新路径。医院最终可能不再需要为每一种癌症类型都构建一个单独的专业计算机,而是可以使用一个统一的系统。只要疾病严重程度在文本中有体现,这个单一系统就可以从常见癌症中学习,并立即将该知识应用于罕见或困难的癌症。尽管该系统仍需仔细调优以避免误报,但这项研究证明,计算机可以学会跨越不同的身体和不同的时间框架来阅读疾病的故事,从而让我们离实现“单一种类工具即可协助医生理解癌症全貌复杂性”的未来更近一步。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。