Boot-and-Feedback Framework for Generalist-Expert Model Collaboration in Breast Ultrasound Diagnosis
该论文提出了“引导与反馈”(Boot-and-Feedback, BooF)框架,该框架通过词汇引导的引导阶段(bootstrapping stage)和基于注意力的反馈融合阶段(attention-based feedback fusion stage),将多模态大语言模型与视觉专家模型协同结合,旨在显著提高乳腺超声分析的诊断准确性与可解释性,同时减轻幻觉现象。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
乳腺癌仍然是全球范围内影响女性最常见的恶性肿瘤,这使得早期且准确的检测成为关乎生死的重大事项。几十年来,医生一直依赖乳腺超声波——一种安全且易于获取的成像技术——来发现可疑的肿块。然而,解读这些图像是一项因人而异的技术;放射科医生眼中的一个无害囊肿,在另一位医生眼中可能被标记为潜在的肿瘤。为了弥补这一差距,科学家们长期以来一直试图构建能够以人类专家的连贯性来读取这些扫描图像的计算机系统。虽然现代人工智能在识别模式方面取得了长足进步,但一个新的挑战也随之而来:强大的语言模型的兴起,它们能够用人类的语言描述图像。这些模型擅长处理通用任务,但在处理严格的医学规则时往往表现挣扎,有时会凭空捏造并不存在的细节或误解所见内容。这造成了一个危险的情况:计算机可能会自信地将良性肿块描述为恶性,从而导致不必要的恐慌,甚至更糟——漏诊。
来自蒙纳士大学、中国人民大学和兰卡斯特大学的研究团队开发了一种解决此问题的新方法,创建了一个让两种不同类型的人工智能不再只是单向传递信息,而是通过循环进行协作的系统。他们将这种方法称为“引导与反馈”(Boot-and-Feedback)框架,将诊断视为一场通用专家与专业专家之间的对话,而非单一的步骤。通用专家是一个能够生成详细描述的大型语言模型,而专业专家则是专门针对超声扫描中癌症模式进行训练的视觉专家。研究人员发现,仅仅让语言模型描述图像然后将该描述交给专家往往会失败;语言模型的错误会干扰专家,从而降低整体准确性。因此,他们设计了一个流程:由专家首先给出初步意见给语言模型,随后语言模型利用这一提示写出一份更加准确、符合医学逻辑的描述。这份描述随后被反馈给专家,由专家据此做出最终且高度可靠的诊断。
该过程始于“引导”(boot)阶段,即系统让语言模型开始像医生一样思考。研究人员意识到,要求通用人工智能去猜测肿瘤是否为癌症会导致荒谬的臆测。为了解决这个问题,他们强制要求模型只能使用医生使用的标准语言,即 BI-RADS 系统。该系统将乳腺病灶分解为五个特定的、可观察的特征:形状、方向、边缘清晰度、内部纹理以及声波在后方的表现。通过限制语言模型仅描述这五个特征,系统防止了它编造诊断。但研究人员更进一步:他们还给了语言模型一个来自视觉专家的“提示”——关于肿块是良性还是恶性的初步判断。语言模型被指示将此提示作为参考点,但要保持独立性;如果图像内容明显与提示相矛盾,模型被告知要描述它实际看到的现象。这种两部分引导确保了语言模型生成的描述既符合医学标准,又与视觉证据保持一致,有效地阻止了它产生幻觉细节。
一旦语言模型生成了这种高质量、结构化的描述,系统便进入“反馈”阶段。在此阶段,该描述与原始超声图像结合,并输入到最终的专家模型中。研究人员设计了一种特殊的机制,充当过滤器,允许专家权衡文本的重要性与图像的关系。如果文本描述的特征与视觉数据不符,系统会学习忽略该部分文本并信任图像。这防止了最终诊断被描述中残留的错误所误导。其结果是,该系统既受益于语言模型表达复杂医学概念的能力,也受益于视觉模型观察原始数据的能力,每一步都在纠正对方的弱点。
当团队在两个大型公开乳腺超声图像数据集上测试该框架时,结果非常明确。新系统的准确性和识别癌症肿瘤的能力都显著优于现有方法。在一个数据集中,该系统的准确率达到了 93.4%,较之前的尖端模型有了显著提升。更重要的是,该系统不仅给出了正确答案,还提供了一个清晰的、分步骤的解释,说明了它是如何得出结论的,并使用了医生赖以生存的标准医学术语。这种高精度与清晰推理的结合表明,此类框架可以成为放射科医生的宝贵工具,提供一种既可靠又易于理解的“第二意见”。这项研究表明,通过利用结构化医学知识来引导人工智能,并允许它从合作伙伴的错误中学习,我们可以构建出不仅更聪明、而且在临床应用中更安全的系统。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。