← 最新论文
🤖 AI

Hallucination in Medical Imaging AI: A Cross-Modality Analytical Framework for Taxonomy, Detection, and Mitigation under Regulatory Constraints

本文提出了一个统一幻觉分类学的跨模态分析框架,揭示了由于过拟合,医学专业基础模型可能比通用基础模型产生更多的幻觉,并提出了与 FDA 生命周期监督相一致的组合缓解策略,以应对医学影像中临床关键性的 AI 失效问题。

原作者: Omar Alshahrani, Muzammil Behzad

发布于 2026-06-12
📖 1 分钟阅读☕ 轻松阅读

原作者: Omar Alshahrani, Muzammil Behzad

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你雇佣了一名才华横溢、积极进取的医学生来帮助医生阅读 X 光片、核磁共振(MRI)和 CT 扫描。这个学生速度极快,而且掌握大量的医学术语。然而,他们有一个危险的习惯:他们有时会编造事实。

这篇论文讨论的正是一个特定的问题,作者称之为**“幻觉”(Hallucion)**。在这种语境下,它并不意味着 AI 在“看到幽灵”——而是指 AI 正言之凿凿地描述一些实际上并不存在的东西——比如凭空捏造一个骨折、编造一个肿瘤,或者把身体的左侧和右侧搞混。如果医生信任了这种编造的内容,患者可能会接受错误的治疗或手术。

以下是该论文研究结果的详细拆解,使用了简单的类比:

1. 错误的“三层蛋糕”

作者研究了我们目前如何对这些 AI 错误进行分类。他们发现我们有三本不同的规则手册,但没有一本能单独覆盖整个蛋糕:

  • 规则手册 A(“为什么”): 它询问:“AI 撒谎是因为训练数据不好,还是因为它自己瞎编的?”
  • 规则手册 B(“物理学”): 这专门针对核医学(如 PET 扫描)。它询问:“AI 是否凭空创造了一个本不该存在的放射性光亮?”
  • 规则手册 C(“严重程度”): 它询问:“这个谎言有多严重?是一个微小的错误,还是会导致患者死亡?”

核心结论: 你不能只使用一本规则手册。要抓住所有的谎言,你需要将这三者叠加在一起。如果你只检查“为什么”,你可能会忽略谎言的危险程度;如果你只检查“严重程度”,你可能无法找到解决根源的方法。

2. “专家 vs 通才”的意外发现

你可能会认为,一个仅在医学数据上进行训练的 AI(专家)会比一个在各种数据上进行训练的 AI(通才)更不容易撒谎。

  • 论文的发现: 情况其实是相反的
  • 类比: 想象一位只擅长做意大利菜的厨师(专家)。如果你请他做一道法国菜,他可能会自信满满地发明一个听起来很像意大利菜但实际上毫无意义的食谱。现在,想象一位做过全世界各种菜系的厨师(通才)。他更加灵活,当他不确定时,不太容易强行给出一个错误的答案。
  • 结果: 在测试中,“通才型”AI 编造虚假事实的情况较少(准确率为 76.6%),而“医学专家型”AI 的准确率仅为 51.3%。专家型 AI 因为过于专注于狭窄的训练领域,导致它们变得僵化,并在数据稍有模糊时就开始“虚构”(confabulating)。

3. 如何抓捕骗子(检测)

论文测试了在 AI 伤害患者之前拦截它的不同方法。可以将这些视为不同的安检手段:

  • “信心计” (不确定性量化): 询问 AI:“你有多确定?”如果它表现得犹豫不决,就标记出来。优点: 快速且自动化。缺点: 有时 AI 会表现得非常自信但实际上是错的,所以这并不总是奏效。
  • “高亮显示器” (注意力分析): 查看 AI 正在盯着图像的哪个部分。如果它盯着一面白墙却声称看到了肿瘤,这就是一个红旗(警示信号)。优点: 人类易于理解。缺点: 仅适用于某些类型的 AI。
  • “双重检查” (跨模态验证): 将 X 光片与血液检查或 MRI 进行对比。如果 AI 在 X 光片上说“腿骨折了”,但血液检查显示“没有受伤”,那么问题就出在 AI 身上。优点: 非常可靠。缺点: 需要在同一时间拥有所有这些其他测试的数据。

核心结论: 没有一种单一的安全检查能抓住所有问题。你需要多种手段结合使用。

4. 如何阻止谎言(缓解)

我们如何修复 AI?论文提出了四层防御,就像一座带有不同城门的城堡:

  • 第一道门(架构): 在构建 AI 时,将其“物理规则”植入大脑。例如,告诉 AI:“你不能发明一个违反物理定律的骨头。”这是最强的修复手段,但你必须在 AI 完成之前完成这项工作,无法事后添加。
  • 第二道门(提示词工程): 给 AI 一个“思考剧本”。与其只问“出了什么问题?”,不如告诉它:“第一,观察图像。第二,列出你看到的东西。第三,检查它是否合理。最后,给出你的答案。”这种“思维链”将谎言减少了高达 86.4%
  • 第三道门(人类参与): 最重要的一道门。真正的医生必须查看 AI 的答案。论文发现,AI 提出的“警报”(警告)中有 99% 实际上是需要人类纠正的误报。AI 是助手,而不是老板。
  • 第四道门(监管规则): FDA(政府监管机构)规定,你不能在发布 AI 之后再进行“修复”。如果你改变了 AI 的思考方式,必须先获得许可。这意味着你必须在开始销售产品之前,就规划好你的安全检查方案。

大局观

论文的结论是:我们走得太快了。我们在还没完全理解 AI 如何失败之前,就已经在部署这些 AI 工具了。

  • 不要迷信“专家”标签: 医学 AI 并不一定比通用型 AI 更安全。
  • 不要依赖单一的修复手段: 你需要结合更好的 AI 设计、更好的提示词以及人类医生的审核。
  • 安全是一个过程,而非一份清单: 你不能仅仅在发布前测试一次 AI。你必须像飞行员监控飞机一样持续观察它,因为规则要求你在产品的整个生命周期内都要管理这些“幻觉”。

简而言之:AI 是一个强大的助手,但如果不加严密监督,它就是一个惯犯骗子。我们需要建立更好的测谎仪,教 AI 循序渐进地思考,并始终让人类医生掌握驾驶权。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →