← 最新论文
📄 medicine

AI Benefits and Machine Learning Errors - Neurology, Psychiatry and Neurosurgery

这项针对79项研究(2018–2026年)的系统综述强调,尽管人工智能通过提高诊断水平和手术精准度显著增强了神经病学、精神病学和神经外科领域,但它也引入了误诊和偏见的重大风险——尤其是在代表性不足的人群和边缘病例中——因此必须通过严格的错误追踪、公平性审计和人类监督,以确保临床应用的安全性。

原作者: Saif M. Hassan

发布于 2026-06-26
📖 1 分钟阅读☕ 轻松阅读

原作者: Saif M. Hassan

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

将人工智能(AI)在医学中的应用想象成一个拥有超能力、速度极快的医生学徒。这个学徒读遍了现存所有的医学教科书,并且能比人类更快地识别脑部扫描、脑电图(EEG)和患者记录中的模式。然而,就像任何学徒一样,它也有一些会产生困惑的“盲点”,如果我们不小心,这些错误会伤害到患者。

这篇由 Saif M. Hassan 撰写的论文是一篇系统性综述(一份巨大的成绩单),它回顾了 2018 年至 2026 年间的 79 项不同研究。它检查了这个“学徒”在医学的三个特定领域中的表现:神经病学(大脑和神经疾病)、精神病学(心理健康)和神经外科(大脑和脊柱手术)。

以下是该论文的研究结果,使用了简单的类比。

1. 超能力(益处)

论文承认,这个 AI 学徒在许多方面确实非常有帮助。它就像是医生的高速涡轮增压器

  • 在神经病学领域(大脑与神经):

    • 速度达人: 当患者发生中风时,时间就是大脑。AI 能在 2 分钟内从扫描图中识别出阻塞的血管,而人类放射科医生则需要 15 分钟。这节省了大约 33% 的手术前等待时间,让患者更快获得救治。
    • 模式猎手: 对于癫痫,AI 可以监听脑波(EEG)并以 91% 的准确率识别癫痫发作,其速度远超人类专家,且表现相当。
    • 时间节省者: 对于多发性硬化症(MS),AI 可以在 2 分钟内绘制出大脑受损区域,而这项工作人类需要 20 分钟。
  • 在精神病学领域(心理健康):

    • 预测者: AI 比医生的直觉更能准确预测抑郁症患者对特定药物的反应。它预测自杀风险的能力也优于标准的临床访谈。
    • 鉴别者: 它能比单纯依靠标准访谈更准确地分辨精神分裂症和双相情感障碍。
  • 在神经外科领域(手术):

    • 精密工具: 在外科医生切除脑肿瘤时,AI 能帮助他们更好地看清边缘,从而实现更彻底的肿瘤切除(成功率为 79%,而没有 AI 时为 62%)。
    • 导航员: 在进行脊柱螺钉植入时,AI 充当 GPS 的角色,将螺钉放置位置错误的比例从 9% 降低到了 4%。

2. 故障(错误)

问题在于:在所审查的 44% 的研究中,发现 AI 犯了错误。 这些不仅仅是微小的计算错误,而是真实的现实世界中的失败,甚至会对人造成伤害。论文将这些错误比作一辆在晴朗高速公路上行驶完美,但遇到雨天或坑洼时就会失控的汽车。

当 AI 遇到其“培训学校”中未曾见过的场景时,最容易出错。

  • 对儿童的“盲点”: 在小儿癫痫研究中,AI 漏掉了 22% 的儿童脑部病变(相比之下,人类仅漏掉 8%)。因此,三名儿童因为 AI 告诉医生其扫描结果“正常”,导致不得不多等待了一年才接受必要的治疗。
  • “偏见”问题:
    • 种族: 一个用于诊断帕金森病的 AI 对白人患者效果很好,但对黑人患者却完全失效(在某些情况下,特异性降至零)。
    • 族裔: 一个基于欧洲患者训练的抑郁症模型在测试南亚患者时失败了。它错误地将 14% 的低风险南亚患者标记为高风险,导致 7 人被开具了不必要的抗抑郁药物,从而导致身体不适。
  • “硬件”混乱: 如果一个 AI 是在旧款 MRI 机(1.5T)上训练的,却被用于新款、更强的机器(3T)上,其准确率可能会降至接近零。这就像教一个人开轿车,然后期望他能在没经过培训的情况下驾驶卡车。
  • “骨骼”失效: 在脊柱手术中,AI 在面对骨质疏松症(骨骼脆弱)患者时表现挣扎。它在 9% 的病例中误判了螺钉路径,导致 两名患者需要进行二次修正手术来修复神经损伤。
  • “年龄”差距: 一种自杀预测工具对成年人有效,但在青少年身上表现糟糕,导致许多女孩被错误地标记为需要危机干预。

3. 为什么会发生这种情况?

论文解释说,这些错误之所以发生,是因为 AI 是基于狭窄且“干净”的数据进行训练的。

  • “教室”类比: 想象一个学生只通过一本特定的教科书来准备考试。他们会考出高分。但如果你给他们一本不同书里的题目,或者关于教科书跳过的课题(如罕见病或特定族裔群体)的题目,他们就会失败。
  • 这些 AI 模型大多是在特定的医院、特定的扫描仪和特定的群体数据上进行训练的。它们还没有学会如何处理现实世界中复杂多样且混乱的情况。

4. 结论与建议

论文得出结论:AI 是一个强大的工具,但我们不能盲目信任它。 益处是真实的,但风险同样真实且有据可查。

“人在回路”(Human-in-the-Loop)原则:
论文认为,AI 应该是助手,而不是老板。

  • 对医生而言: 你需要明确知道你的 AI 在哪里薄弱。如果你正在治疗一名患有癫痫的儿童、一名患有抑郁症的南亚患者或一名患有骨质疏松症的老年患者,你必须复核 AI 的工作。
  • 对研究人员而言: 不要只报告“胜利”。你也必须公布“失败”和错误,特别是针对不同人群的错误。
  • 对监管机构而言: 在批准这些工具之前,需要对多样化的群体进行测试,而不仅仅是针对“平均水平”的患者。

简而言之: AI 是一个聪明的、快速的学徒,可以通过加速诊断和指导手术来拯救生命。但如果我们不教它如何处理“边缘案例”(如儿童、不同种族、罕见病症),并且如果不让医生在背后监督它,它可能会犯下危险的错误,从而导致治疗延误或造成不必要的伤害。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →