Learning from Lost Provenance: Multiple Instance Learning for Cancer Registry Tumor Group Classification
本文提出了一种基于注意力机制的多实例学习(ABMIL)框架,该框架利用常规的患者级癌症登记标签来恢复丢失的报告级溯源信息,从而提炼出一个高质量的训练数据集,使深度学习模型无需额外的手动标注即可实现高性能的肿瘤分组分类。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下你是一名试图破解谜团的侦探,但你面对的是一大堆线索(病理报告),而整个案件只有一个最终判决(肿瘤分组)。问题在于?你不知道究竟是哪一个具体的线索导致了那个判决。在癌症登记系统中,医生(被称为肿瘤数据专家)会阅读一名患者的数十份报告,然后为整个患者分配一个标签。但计算机并不知道哪一份报告才是那个“关键证据”,哪些只是干扰项。
长期以来,研究人员试图通过两种方式来解决这个问题:要么丢弃大部分线索(只保留只有一份报告的患者),要么假设每一条线索都是关键证据。这篇论文指出,第二种想法是一个陷阱。如果你告诉计算机,一个患者的所有报告都是诊断的原因,你实际上是在用噪声训练它。这就像告诉一名学生,教科书中的每一页都在解释答案,甚至包括那些关于无关主题的页面一样。论文明确排除了这种“标签传播”方法,因为它会误导系统,尤其是在处理罕见癌症类型时。
相反,作者提出了一种聪明的新型学习方法,称为基于注意力的多实例学习(ABMIL)。你可以把它想象成一位聪明的侦探,它会同时观察整堆线索。该模型并不会试图仅从一份报告中猜出答案。相反,它会观察患者的整个“报告包”,并询问:“这些报告中哪些才是真正重要的?”它会为每份报告分配一个重要性评分。
这就是其中的魔力所在:模型学会了忽略那些无聊、无关紧要的报告,转而专注于那些真正能解释诊断结果的报告。一旦它弄清楚了哪些报告是“主角”,它就可以做两件很酷的事情:
- 直接侦探工作: 它可以利用这种“线索包”的方法直接进行分类,而无需知道具体哪份报告对应哪份结论。
- 伟大的过滤器: 它可以充当一个筛子。它接收巨大的报告堆,扔掉它认为无关紧要的报告,只保留那些高分报告。然后,它获取患者的标签,并将其贴在这些少数、高质量的报告上。突然之间,你就拥有了一个干净、完美的数据库,其中每一份报告都有正确的标签,而无需人类逐一阅读和标注它们。
研究人员在不列颠哥伦比亚癌症登记处的数据上测试了这一方法。他们查看了 82,855 名独特的患者和 359,714 份病理报告。他们对这些数据进行了拆分,将 90% 用于训练,10% 用于检查工作。他们还使用了一批由专家手动检查过的全新报告(即“ODS 标注数据集”)来测试他们的最终系统。
结果令人鼓舞。使用这种过滤技巧的模型(称为 ABMIL-DISTIL)在新的测试数据上取得了 0.83 的得分(宏 F1 分数)。这优于那些单纯假设每份报告都重要的旧方法。论文表明,这种方法是将杂乱的、现实世界的医院记录转化为高质量训练数据的实用途径,而无需需要大量的专业人员来标注一切,也不需要处理所有事物的超级计算机。
需要注意的是,虽然结果很强劲,但论文将此视为针对特定数据的有成效的成功,而非解决所有问题的万能药。作者指出,由于其测试数据使用的标注系统与训练数据略有不同,这给最终得分增加了一点点“噪声”,这意味着现实世界的表现可能会略有波动。但总体而言,他们认为这是一个非常易于实现且有效的途径,可以实现癌症登记工作的自动化,将一座无组织的文书大山转化为一个精准、专注的工具。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。