Accelerating Machine Learning in Healthcare: Addressing the Labelling Bottleneck
本研究表明,一种利用专家标注种子集和主动学习的分阶段、自举式标注流水线,能够将罕见儿科交界处折返性心动过速病例的获取量提高约15倍(相比于随机采样),从而显著优化了医疗保健领域机器学习中稀缺临床标注资源的使用。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在儿科重症监护室(PICU)这种高风险的环境中,孩子们正在从复杂的心脏手术中恢复,而时间是最关键的资源。心脏的节奏可能会突然发生变化,一旦发生,后果可能非常严重。医生依靠连续监测来及早发现这些危险的变化,但床旁监护仪产生的海量数据令人应接不暇。几十年来,研究人员一直试图教会计算机自动识别这些异常心跳,希望能为临床医生提供一双永不眨动的“第二双眼睛”。然而,一个主要的障碍一直阻碍着这一进程:要教计算机学习,你必须首先向它展示范例,而寻找这些范例却极其困难。大多数现有的计算机程序都是基于成年人的数据进行训练的,这并不符合儿童独特的心脏节奏,而且它们依赖于复杂的十二导联心电图记录,而这种记录在对患病儿童进行连续、实时监测时很少被使用。最危险的心律失常也是最罕见的,这意味着如果医生随机扫描数千小时的心脏监护记录,他们可能需要花费数天时间才能找到那仅有的几分钟需要研究的具体问题。
来自多伦多病童医院的一支研究团队,与来自西雅图、密歇根和以色列的同事们合作,致力于解决这个“大海捞针”的问题。他们不仅仅是收集了更多的数据,而是构建了一种更聪明的方法来寻找他们需要研究的特定心律。他们从一个包含超过160万小时、来自9000多名儿童的心脏监护记录的海量数字档案开始。这个被称为 AtriumDB 的档案包含了一座信息宝库,但其中几乎所有的内容都是未标记的,这意味着还没有人告诉计算机每一次心跳代表什么。研究人员面临着一个选择:他们可以要求忙碌的医生随机扫描这些数据,这是一个缓慢且低效的过程;或者他们可以创建一个系统,帮助医生更快地找到那些罕见且危险的心律。他们选择了后者,开发了一个循序渐进的过程,该过程始于人类专家,并逐渐引入一个计算机助手来引导搜索。
这一过程始于最传统的方法:回顾旧的医疗记录。团队找到了一些孩子在医院实验室进行了正式的十二导联心脏测试的案例,这些测试提供了确定的诊断。他们将这些已知的诊断结果与同一时间的连续心脏监护记录进行匹配。这为他们提供了一组小规模且可靠的初始范例。然而,这种方法存在一个缺陷:医院记录往往以正常的、健康的心跳为主,且实验室测试与连续监护之间的时间间隔并不总是完美的,这迫使医生花费大量时间进行核实或纠正标签。为了改进这一点,团队增加了第二步,即重症监护室内的医生和护士可以在观察到心律问题发生时实时报告。这提供了新鲜、相关的范例,但仍受限于医生偶然注意到并报告问题的次数。
一旦团队通过前两步积累了足够的范例来训练一个基础计算机模型,他们就引入了第三步和第四步,这两步依靠计算机来承担繁重的工作。他们教会计算机观察未标记的数据,并识别出它不确定的部分。这被称为不确定性采样(uncertainty sampling)。计算机并没有盲目猜测,而是标记出那些让它感到困惑的心跳,并将这些特定的片段发送给医生进行审核。这比随机搜索要高效得多,因为计算机本质上是在说:“我不知道这是什么,请告诉我。”随着医生对这些困惑的范例进行标注,计算机变得越来越聪明。最后,团队使用了一种称为嵌入搜索(embedding search)的技术。这使得计算机能够寻找在形态上与它已经学到的那些罕见、危险心律相似的心跳,即使这些心跳来自不同的儿童。这就像是要求计算机去寻找所有看起来“像”它刚刚被教授过的那些危险心跳的样本,从而在整个档案中搜索同类问题的各种变体。
这一阶段性方法的成果令人瞩目。当研究人员测试通过简单地从档案中随机抽取片段能找到多少种罕见的危险心跳时,他们发现每200个片段中仅有两个病例,比例仅为1%。相比之下,他们的新型多步骤流程在标注的总时长中找到了14.7%的罕见心跳,在所审查的独特患者数量中找到了24.7%。这意味着,与随机搜索相比,该流程在按小时计算的罕见心跳查找效率上提高了约15倍,在按患者数量计算的效率上提高了25倍。其效率随着每个步骤的推进而增长。最初的手动步骤提供了基础,而计算机引导的步骤——特别是最后一步对相似心跳的搜索——产生了最高的收益。在最后阶段,当计算机搜索与罕见心律相似的心跳时,一旦医生进行审核,被选中的片段中有超过60%被证实为目标心律。
这项研究并未声称该计算机模型已经准备好独立为患者进行诊断;那是另一个挑战。相反,这项工作证明了,一种智能的协作工作流可以克服数据标注的瓶颈。通过让计算机引导医生去寻找数据中最有趣、最罕见的部分,该团队建立了一个包含近190小时专家标注心律的高质量数据集,涵盖了1,447名儿童。这个数据集现在富含那些对于训练未来医疗工具至关重要的罕见且危险的心律。研究人员发现,这种方法使他们能够建立一个涵盖从新生儿到青少年所有年龄段儿童的多样化心跳集合,而无需占用忙碌医护人员过多的时间。该方法表明,在医学人工智能领域,进步的关键不仅在于拥有更多的数据,更在于拥有一种在数据中寻找正确数据的更好方法。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。