Multi-Agent AI System for Radiology Report Structuring and Quality Assurance with Independent Radiologist Evaluation
本研究表明,一套本地部署的多智能体AI系统能够有效地将放射科报告结构化为标准化的解剖章节,并执行质量保证检查,且经由独立放射科医生评估验证,其性能表现良好。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在医学影像领域,放射科医生的报告是影像扫描与患者护理之间至关重要的桥梁。当医生开具胸部、腹部或盆腔的 CT 扫描指令时,必须由专家将图像转化为描述所见情况的书面叙述。这些报告至关重要,但它们通常以自由流动的文本形式呈现,导致一位医生可能按身体部位列出发现,而另一位医生则可能按他们注意到发现的顺序进行分组。这种缺乏标准结构的情况可能导致其他医生难以快速找到特定细节,从而可能导致信息遗漏或浪费寻找答案的时间。此外,由于这些报告是通过语音转文本系统录入的,因此可能会包含细微的错误,例如将肺部的发现描述为肝部,或者一个关键的警告从未明确传达给治疗团队。随着医院每天生成数以千计的此类报告,确保其既一致又无误已成为传统人工审核难以应对的重大挑战。
为了解决这个问题,佛罗里达州坦帕市莫菲特癌症中心(Moffitt Cancer Center)的研究小组开发了一种新型人工智能系统,旨在组织并检查这些报告,而不改变医生实际书写的文字。该系统并非通过重写报告或将其总结为简短列表,而是像一位细心的图书管理员,将混乱的手写笔记中的每一句话都归档到正确的抽屉里,同时扫描整个文档以查找矛盾之处。研究小组构建了一个“多智能体”系统,这意味着他们创建了一组协同工作的专门计算机程序。系统的其中一部分使用严格的预设规则将句子分类到如“肺部”或“肝脏”等解剖类别中。当规则不足以决定一个句子属于哪里时,一个更高级的推理程序会介入,理解上下文并做出判断。整个过程完全在医院自己的安全计算机上运行,从而保护患者数据的隐私。
研究人员在 2023 年和 2024 年进行的 CT 扫描生成的 638 份真实放射科报告上测试了该系统。这些报告由 15 位具有各自独特写作风格的执业放射科医生创建。系统成功地将所有报告中非结构化的“发现”(Findings)部分(共包含 22,270 个句子)进行了重新排列并转化为标准化格式。例如,一段原本埋在关于肺部段落中间的心脏问题描述被移动到了“心脏”部分,而关于肝脏病变的句子被放置在了“肝脏”项下。至关重要的是,系统没有删除、总结或虚构任何文本;它只是将原始句子移动到了适当的位置。整个过程平均每份报告耗时约 56 秒,其中最耗时的部分是处理复杂句子的推理步骤。
除了组织文本外,该系统还充当了质量控制检查员的角色。它扫描报告以查找特定类型的错误,例如当“发现”部分描述了一个问题,但报告末尾的“印象”(Impression)部分未能提及该问题,或者发现描述与患者性别相矛盾的情况。在这 638 份报告中,系统标记了 90 份(约 14%)作为存在潜在不一致性的报告。最常见的问题是描述内容与结尾处的总结之间存在不匹配。它还捕捉到了罕见的实例,即某个发现虽然关键但未被清晰传达,或者某个句子似乎描述的器官与患者的解剖结构不符。
为了验证该系统是否真正有效,两名独立的放射科医生对经过 AI 处理的 45 份报告样本进行了审查。他们查看了句子是否被移动到了正确的章节,以及错误标记是否准确。医生们一致认为,在 69% 的案例中,AI 正确地重构了报告。仅在 4% 的案例中,他们发现了明显的错误,即句子被放错了位置。在剩余的案例中,两位医生在句子应归属于哪一类上产生了分歧,这表明某些医学发现可以合理地属于多个类别。重要的是,两位评审员均确认系统从未遗漏任何重要的医学信息,也从未捏造原报告中不存在的事实。在被问及错误检查的质量时,医生们在 84% 的受审报告中将系统的表现评为“优秀”或“良好”。
这项研究表明,将基于规则的分拣器与基于推理的检查器相结合,可以创建一个可靠的工作流程来使医学报告标准化。虽然该系统并未使报告变得完美,且医生们指出重构后的版本有时与原版一样好而非显著更好,但该系统证明了它能够在不丢失任何内容的前提下,处理 15 位不同医生的多样化写作风格。研究人员发现,该系统在捕捉报告不同部分之间的不匹配方面表现尤为出色,而这是一项人类在每天审查数百份报告时难以始终如一完成的任务。尽管该研究局限于特定的 CT 扫描和用于最终审查的相对较小的医生群体,但结果表明,此类系统可以为放射科医生提供支持,在保留医疗专业人员口述报告的原有声音和细节的同时,提供一致的结构并为常见的报告错误提供安全保障。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。