AI- Enhanced Stethoscope in Remote Diagnostics for Cardiopulmonary Diseases
本文提出了一种高性价比的 AI 增强型听诊器系统,该系统利用结合 MFCC 特征提取的混合 CNN-GRU 模型,在低成本嵌入式设备上实现对六种肺部疾病和五种心血管疾病的实时并发诊断,从而解决了偏远及资源匮乏地区的诊断难题。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象这样一个世界:医生最信赖的工具——听诊器,获得了一次“超能力”升级。近两百年来,医生一直使用听诊器来聆听人体的“音乐”——心脏有节奏的跳动和肺部气流的声音。然而,聆听这些声音颇具挑战性;它需要多年的训练,而在偏远村庄或贫困地区,根本缺乏足够多的受过训练的医生来为每个人听诊。
本文介绍了一种解决方案:一种智能、低成本的听诊器,它像一名“数字侦探”一样,由人工智能(AI)驱动,可同时诊断心脏和肺部疾病。
以下是该系统的运作方式,分解为简单步骤:
1. 硬件:简单的升级
将硬件想象为在普通听诊器上附加了一只“魔法耳朵”。
- 设置:他们取一只普通听诊器,并在其上连接一个简单的麦克风。
- 连接:该麦克风通过标准耳机插孔连接到任何设备(如笔记本电脑或手机)。
- 目标:不再是医生用自己的耳朵聆听,而是设备捕捉声音并将其发送至计算机进行分析。论文强调,这种设置成本低廉,使其非常适合那些缺乏昂贵医疗设备的地区。
2. 问题:噪音太多,专家太少
作者指出了当前方法存在的两个主要问题:
- 人为错误:即使是熟练的医生也可能误判复杂的心脏或肺部声音。
- “单轨”问题:大多数现有的人工智能工具就像只懂得听要么心脏要么肺部的专家。它们无法同时处理两者。此外,许多现有的数字听诊器对于最需要它们的人群来说过于昂贵。
3. 解决方案:“混合大脑”
为了解决这个问题,团队构建了一个新的人工智能模型,它像一个二合一的侦探。它不仅查看声音,还理解声音随时间变化的模式。
他们使用了一种结合两种人工智能类型的“混合模型”:
- CNN(摄影师):想象一台为声音拍摄快照的相机。它将声音视为图像(称为梅尔频谱图)来识别视觉模式,例如哮鸣音或杂音的形状。
- GRU(讲故事的人):想象一位叙述者,它聆听声音随时间变化的故事。它理解声音如何从心跳或呼吸的开始变化到结束。
通过结合“摄影师”和“讲故事的人”,该系统获得了关于体内发生情况的完整图景。
4. 训练:从海量图书馆中学习
为了训练这个人工智能,研究人员向其输入了一个海量的声音录音库:
- 肺部:他们使用了 6 种不同病症(如肺炎、慢性阻塞性肺病和支气管炎)的数据,外加健康肺部数据。
- 心脏:他们使用了 5 种不同心脏病症(如瓣膜问题)的数据,外加正常心脏数据。
挑战:库中某些疾病样本很少(例如某种类型的肺部感染仅有 13 个样本),而其他疾病则很常见。为了解决这个问题,人工智能使用了一种称为数据增强的技术。想象这就像一台复印机,它拿一张稀有照片,稍微改变光线或速度,然后创建新的“假”副本,以便人工智能有足够的练习材料来学习,而不会感到困惑。
5. 结果:新的冠军
团队将他们的“混合大脑”与单独的“摄影师”和单独的“讲故事的人”进行了测试。
- 独立模型:“摄影师”(CNN)在肺部诊断上的准确率约为 74%,在心脏诊断上为 81%。“讲故事的人”(GRU)表现稍好,但仍有困难。
- 混合赢家:当将它们结合时,准确率跃升至94%。
这意味着,与之前的模型相比,该组合模型在区分健康呼吸与患病呼吸,或正常心跳与故障瓣膜方面,表现显著更优。
6. 用户体验:简单的应用程序
最后,他们构建了一个网络应用程序(可在手机或电脑上使用的网站),使任何人都能轻松使用。
- 流程:用户插入设备,录制声音,然后点击“分析”。
- 输出:应用程序立即告诉用户该声音匹配 11 种病症(5 种心脏 + 6 种肺部)中的哪一种。
- 远程医疗:如果用户身处偏远村庄,他们可以直接将报告通过电子邮件发送给医生以获取第二意见,从而弥合患者与专家之间的差距。
总结
简而言之,本文提出了一种廉价、智能的听诊器,它利用组合式人工智能大脑同时聆听心脏和肺部。它将复杂的音频转化为简单的诊断,准确率达到94%,旨在将高质量的医疗筛查带到医生和昂贵机器稀缺的地区。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。