Transformer Architectures for Respiratory Sound Analysis and Multimodal Diagnosis
本文提出了一种利用音频频谱图转换器(Audio Spectrogram Transformers)和视觉语言模型来分析呼吸音及患者元数据的多模态诊断框架,证明了在哮喘诊断和远程监测方面,该框架与传统的医生听诊及以往基于卷积神经网络(CNN)的方法相比,具有更高的准确性和可解释性。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
聆听患者的呼吸是医生工具箱中最古老的工具之一。几个世纪以来,医生们一直将耳朵或听诊器贴在胸部,以探测液体流动的细微咔哒声、因气道变窄而产生的尖锐哨鸣音,或是健康肺部平滑的静默声。这种被称为“听诊”的实践完全依赖于人类的耳朵和倾听者的经验。虽然这种方法弥足珍贵,但它也是主观的;两位医生可能会在同一声呼吸中听到不同的内容,且诊断结果很大程度上取决于医师的实践经验。随着哮喘等呼吸系统疾病影响着全球数百万人的健康,医学界长期以来一直在寻求一种方法,使这一聆听过程更加客观、一致且易于普及,特别是对于那些专家匮乏的年幼儿童或偏远地区人群。
近年来,科学家们开始转向利用计算机来辅助聆听。通过将呼吸声转化为一种被称为“频谱图”的视觉图谱——其中时间沿底部延伸,音高沿侧边上升——研究人员可以将一次呼吸视为一张图像。这使得他们能够使用最初设计用于识别照片中猫或汽车的强大计算机程序,来识别疾病的模式。然而,这些早期的尝试通常依赖于较旧的计算机模型,这些模型仅关注声音本身,忽略了患者的其他背景信息,例如年龄或性别。此外,由于不同的计算机程序往往是在不同的数据集上进行测试的,导致很难比较不同程序之间的优劣,从而难以确定哪一个真正有效。
来自以色列本-盖里恩大学和俄罗斯许可州医科大学的研究团队致力于解决这些问题,他们通过在同一个共享的患者数据集中测试最新一代的计算机模型来进行研究。他们希望看到现代人工智能是否不仅能聆听呼吸声,还能理解患者的背景信息,从而模拟人类医生将所听到的声音与已知的个人信息相结合的过程。他们的工作重点是区分哮喘患者与非哮喘患者,这项任务对于管理一种影响着多国高达29%人口的疾病至关重要。
研究人员收集了来自1,300多名参与者的庞大录音集,涵盖了从婴儿到成年的各种人群。这些录音捕捉了从四个不同部位发出的安静呼吸声:口腔、气管、胸部和背部。每段录音都配有结构化的患者信息,包括其年龄、性别以及采集声音的位置。团队随后将这些数据输入到三种不同类型的计算机模型中,以观察哪种模型对哮喘的诊断最为准确。
他们测试的第一种模型是一种被称为“卷积神经网络”的成熟计算机程序类型,具体为名为DenseNet201的版本。该模型在他们之前的研究中已被使用过,可作为可靠的基准。它仅观察声音的视觉图谱,忽略了患者的个人细节。第二种模型是一种名为“音频频谱转换器”(Audio Spectrogram Transformer)的前沿系统。该模型专为理解声音模式而设计,并在被应用于这项医学任务之前,已经在庞大的音频库中进行了训练。第三种模型是一种名为“Moondream2”的多模态视觉语言系统。这是最宏大的尝试;它旨在观察声音图谱的同时,同步读取关于患者年龄、性别和记录位置的文本描述,希望通过结合这两股信息流来获得更好的诊断结果。
结果显示了一个明显的胜出者。这种专门的声音模型——音频频谱转换器,以卓越的精度超越了所有其他模型。它在准确率、敏感度、特异度和F1分数方面均达到了98.7%的成功率,约登指数(Youden Index)为0.974。这一表现显著高于较旧的DenseNet模型,后者的准确率约为87%。多模态模型Moondream2的表现与旧模型相似,准确率约为86.5%。有趣的是,研究人员发现多模态模型严重依赖于它所获得的文本信息。当他们从输入中移除患者的年龄和性别时,该模型的哮喘诊断能力便彻底崩溃,在每一个哮喘病例中都产生了错误。这表明,虽然该模型可以利用文本做出决策,但在独立学习声音模式方面,其效果不如专门为音频构建的模型那样有效。
研究还探讨了这些计算机模型是如何做出决策的,这是赢得医生信任的关键步骤。对于较旧的模型,研究人员可以使用一种技术来突出显示触发诊断的特定声音图谱部分,就像展示相机聚焦位置的热图一样。对于新的声音模型,他们分析了内部的注意力机制,以观察计算机正在关注声音的哪些部分。他们发现,两种模型都聚焦在相同的频率范围,即大约8ों 800到1800赫兹之间,特别是在呼吸的第三个周期。这种一致性表明,计算机并非在随机猜测,而是确实在检测与医生所听到的相同的物理声学特征。
研究人员得出结论,虽然将患者细节与声音分析相结合是一个逻辑性的步骤,但目前试图兼顾两者的通用型模型可能不如专门为声音设计的模型有效。专门的音频模型证明了它仅凭声音就能学习呼吸疾病的细微差别,其表现超越了医学文献中报道的人类听诊水平。研究结果表明,计算机辅助诊断的未来可能在于使用针对特定任务的高度专业化工具,而不是试图构建一个包罗万象的单一系统。这些模型为患者的持续远程监测提供了一条充满前景的路径,有望实现对哮喘发作的早期检测,并为世界各地的人们提供更一致的护理,无论他们是否能够接触到专家。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。