DRRG: A Discrete Diffusion Framework for Radiology Report Generation
本文介绍了 DRRG,一种用于放射学报告生成的离散扩散框架,该框架通过临床实体感知掩码和概念调节实现迭代式、双向的细化,克服了自回归模型的局限性,并在 MIMIC-CXR 和 CheXpert Plus 数据集上取得了卓越的性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
每天,世界各地的放射科医生都会检查成千上万幅医学影像,将他们所见的内容转化为书面报告,以指导患者的治疗。这些文档不仅仅是描述性的;它们是关乎生命安全的记录,因为一个微小的细节遗漏或一个矛盾的陈述都可能导致误诊或不当治疗。由于医学影像的数量增长速度超过了能够解读它们的专家数量,科学家们长期以来一直试图构建能够自动编写这些报告的计算机。多年来,标准的方法是教机器像人类一样写作:一次写一个词,从左到右。一旦计算机写下一个词,它就会将其固定下来并转向下一个词,绝不会回头改变主意。虽然这种方法在许多任务中表现良好,但在医学报告这种复杂且高风险的任务面前却显得力不从心,因为早期的错误可能会引发一连串计算机无法修复的连锁反应。
来自悉尼大学以及中国和澳大利亚合作者的研究团队提出了一种不同的前进方式。他们没有强迫计算机进行单次、不可更改的生成,而是开发了一个模仿人类放射科医生实际工作方式的系统:即起草、审查和完善。他们创建了一个名为 DRRG 的新框架,将报告生成视为一个迭代改进的过程。想象一下,计算机从一张白纸和一组来自 X 光图像的线索开始,然后逐渐填补文本,检查自己的工作,并在过程中纠正错误,而不是被迫在写下每个词的瞬间就做出决定。这种被称为“离散扩散”(discrete diffusion)的方法允许系统同时观察整份报告,理解开头、中间和结尾是如何相互衔接的,并能在后续发现与前文不符时修改前面的部分。
研究人员在两个大型公开的胸部 X 光片及其对应报告的集合上测试了这一新系统。他们发现,这种使用相对较小语言模型的系统,能够产生比许多使用更大规模模型的现有系统更准确、临床一致性更高的报告。在测试中,该新系统在衡量文本质量的标准指标 BLEU-4 上达到了 0.210 分,超越了几种先进的方法。更重要的是,在评估报告捕捉特定医学事实和观察结果的能力时,该系统的得分高于其竞争对手。例如,在一项测量计算机识别肺炎或肺部积液等特定病症能力的测试中,它获得了 0.549 分,超过了次优的方法。
成功的关键在于系统如何被训练去关注报告中最重要的部分。研究人员设计了一种训练方法,迫使计算机高度关注描述患者状况的特定医学术语,确保这些关键细节在写作过程中不会丢失或被扭曲。他们还构建了一种机制,允许系统将源自 X 光图像的特定医学概念直接注入到写作过程中,起到引导作用,使报告始终基于视觉证据。通过将这些专注的训练技术与迭代修改文本的能力相结合,该系统学会了生成不仅流畅,而且逻辑严密且在医学上可靠的报告。
研究还探讨了系统在给予更多思考时间时的表现。他们发现,随着计算机进行的完善轮次增加,报告的质量也会随之提高,在经过 72 轮检查和修正后效果最佳。虽然这比传统的单次生成法稍慢,但这种权衡带来了显著的准确度提升。研究人员证明,这种方法可以纠正在标准系统中会成为永久错误的错误。在一个例子中,传统的计算机模型写道患者患有一种特定类型的肺部感染,由于该模型无法回头修改,这个错误一直持续存在。然而,新系统最初也写了同样的错误短语,但通过其迭代过程,它识别出了错误,删除了错误的陈述,并用正确的观察结果——即感染并不存在——进行了替换。
这项工作表明,这种僵化的、从左到右的文本生成方式可能并不适合医学报告这种复杂且关乎安全的任务。通过允许计算机逐步完善其工作,观察全局并自我纠正,研究人员展示了一条通往更可靠自动化医学文档记录的充满希望的路径。结果表明,这种方法可以使用比现有一些大型模型更少的计算能力来生成高质量的报告,使其成为未来一个潜在的高效工具。这些发现并非声称已经完全解决了自动化报告的问题,但它们提供了强有力的证据,证明从传统的单向生成过程转向迭代过程,可以带来更安全、更准确且在临床上更有用的结果。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。