Chest2Vec: A multipurpose text encoder conditioned by instructions for chest radiograph and computed tomography reports
该论文介绍了 Chest2Vec,这是一种多用途、基于指令条件的文本编码器,提供 0.6B 和 4B 参数规模的版本,能够有效地处理胸部 X 光片和 CT 报告,用于检索、分类和图文监督等任务,并证明了其在 CT 报告上的表现优于现有模型。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在医学影像领域,一张图片往往胜过千言万语,但对于辅助医生解读这些图片的计算机而言,文字同样至关重要。当放射科医生检查胸部 X 光片或 CT 扫描时,他们会撰写一份报告来描述所见内容:肺部是否清晰、心脏周围是否有积液,或者骨头是否折断。这些报告是影像所示内容的初步记录,也成为了构建能够辅助诊断的人工智能系统的基础。为了教会计算机理解这些图像,工程师需要先教它理解报告中的语言。这需要一个“文本编码器”(text encoder),即一种专门的计算机程序,能将人类的句子转化为机器可以处理的数学格式。多年来,这些程序一直接受通用语言或专门针对胸部 X 光片的训练,但在处理胸部 CT 扫描生成的更复杂、更详细的报告时却显得力不从从心,因为 CT 扫描展现了人体内部更广泛的视野。
现在,一个研究团队开发了一种名为 Chest2Vec 的新工具来填补这一空白。该系统旨在理解来自胸部 X 光片和胸部 CT 扫描的文本,充当这两类不同医学影像之间的通用翻译器。研究人员构建了该工具的两个版本,一个较小,一个较大,并将其与现有程序进行对比测试,以观察哪一个能更好地掌握医学报告的含义。他们发现,他们的新系统,尤其是较大的版本,在理解 CT 扫描报告的细微差别方面,显著优于任何其他可用工具。它能够准确地将报告中的特定发现与医生的最终结论相匹配,发现文本中的细微错误,甚至只需遵循一个简单的指令,就能将注意力集中在身体的特定部分,如肺部或心脏。这项工作表明,通过专门针对胸部影像的语言进行训练,而不是仅仅通过扩大规模或使用通用语言技能,我们可以创造出更可靠、更有用的诊断工具。
研究人员面临的挑战在于,胸部 CT 报告中使用的语言与胸部 X 光片不同。虽然两者描述的是相同的器官,但 CT 报告通常更长,并且包含 X 光片无法看到的区域细节,例如上腹部或颈部的血管。现有的计算机程序要么过于通用,无法捕捉到这些医学细节,要么仅针对较简单的 X 光片语言进行了训练。研究人员假设,如果他们专门针对这两类胸部报告的文本训练计算机模型,那么该模型在表示词义方面将比接受通用语言或仅接受单一类型扫描训练的模型更准确。他们从一个强大的基础模型开始,然后利用数千份真实的医学报告对其进行教学,将文本与告诉计算机执行特定任务(如“寻找错误”或“总结发现”)的指令配对。
为了测试他们的创造物,团队使用来自医院且计算机从未见过的数据,对 Chest2Vec 进行了一系列严格的挑战。在一项测试中,他们要求系统仅根据详细的发现列表找到患者状况的正确最终总结。在胸部 CT 报告中,新系统成功找到正确总结的概率接近 69%,而排名第二的竞争对手(一个专门针对 X 光片的程序)的成功率不足 58%。在另一项测试中,研究人员要求计算机识别一份报告是否被微妙地篡改以包含医学错误,例如将阴性发现改为阳性发现。新系统正确识别未被篡改的正确报告的比例超过 87%,表现远超其他工具。这些结果表明,性能的提升源于对胸部影像文本的专门训练,而非仅仅依靠计算机模型的规模。
研究人员还发现,无需重新训练,就可以引导该系统专注于身体的特定部分。通过简单地改变给出的指令,他们可以让计算机优先考虑有关肺部、心脏或骨骼的信息,从而有效地调整其注意力到感兴趣的区域。这种灵活性非常有价值,因为它允许单个计算机模型服务于多种用途,从检查特定疾病到帮助医生寻找类似的既往病例。此外,团队还展示了该文本编码器可以提升基于图像的 AI 的性能。当他们使用这个新的文本工具来辅助教导计算机如何“看”CT 扫描时,由此产生的图像识别系统比使用旧的、专业化程度较低的文本工具训练出的系统更准确。
尽管取得了这些成功,研究人员也指出了若干局限性。CT 扫描的训练数据来自单一公共来源,这意味着该系统可能无法完美适应每家医院或每个国家的报告风格。此外,该系统是在英语报告上进行的测试,其在其他语言或不同医疗环境下的表现仍有待观察。团队还指出,用于测试的错误是由计算机生成的,而非在现实世界的报告中自然发生的,这意味着该系统捕捉现实生活错误的能力可能会有所不同。尽管如此,这项研究提供了强有力的证据,证明专门的、指令引导的方法在理解胸部影像报告方面比通用方法更有效。通过发布他们的工具和创建的结构化数据,研究人员希望能够使其他科学家构建出更先进的系统,以协助解读医学影像这一复杂且至关重要的工作。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。