Vision-language models for chest radiography do not always need the image
本文表明,许多用于胸部 X 光摄影的视觉-语言模型通过依赖基于文本的先验知识而非实际分析图像来获得高准确率,并据此认为,为了确保临床部署的安全,进行接地审计(grounding audits)而非仅仅关注准确率得分是至关重要的。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在雇佣一支侦探团队来通过一张犯罪现场照片破解谜团。你想知道:他们是真的在看照片,还是仅仅根据听到的新闻在瞎猜?
这篇论文是对九种不同的 AI 侦探(视觉语言模型)进行的“因果审计”,这些 AI 被要求阅读胸部 X 光片。作者想要查明,这些 AI 究竟是在“看”X 光片,还是仅仅在使用它们的“语言先验知识”——本质上,就是根据某些疾病在医学报告中出现的频率进行猜测,而从未真正观察图像。
以下是他们调查过程的拆解,使用了简单的类比:
1. 问题所在:“聪明猜题”陷阱
作者认为,仅仅因为一个 AI 在测试中获得了高分(准确率),并不意味着它真的在做功课。
- 类比: 想象一个学生在参加数学考试。如果这个学生记住了“第五题通常是‘42’”,那么他可能在完全不懂数学的情况下也能拿到满分。
- 现实情况: 许多医疗 AI 就属于这种学生。它们知道“心力衰竭”经常出现在报告中,所以当被问到“是否存在心力衰竭?”时,它们会回答“是”,是因为这个词很常见,而不是因为它们看到了 X 光片上巨大的心脏。
2. 测试方法:“魔术橡皮擦”与“照片替换”
为了证明 AI 是否真的在观察图像,研究人员不仅向它们提问,还改变了证据并观察结果。他们使用了三种特定的技巧:
- 魔术橡皮擦(遮挡法): 他们遮住了 X 光片中疾病可能出现的特定部分(比如用一个黑框盖住断裂的骨头)。
- 如果 AI 是真正的侦探: 它应该说,“我看不见骨头了,所以我不知道”,或者改变它的答案。
- 如果 AI 是个猜题者: 它仍会说“是的,有骨折”,因为它只是根据统计数据在瞎猜。
- 照片替换: 他们用另一名具有相同诊断结果的患者的 X 光片替换了原有的患者 X 光片。
- 如果 AI 是真正的侦探: 它应该感到困惑或改变答案,因为图片变了。
- 如果 AI 是个猜题者: 它会给出完全相同的答案,因为它根本不在乎图片。
- 红鲱鱼(干扰项): 他们遮住了 X 光片中一个无关紧要的部分(比如桌子的边缘)。
- 如果 AI 是真正的侦探: 它不应该在意;答案保持不变。
- 如果 AI 不稳定: 它可能会仅仅因为某些东西被遮住了就改变答案,这表明它很困惑。
3. 结果:三种类型的侦探
在测试了九种不同的 AI 系统后,作者发现它们可以分为三个截然不同的类别:
“盲目”猜题者(忽略图像):
- 对象: 其中三个系统(包括一些纯文本模型和一个多模态模型)。
- 行为: 它们答对了,但如果你抹除疾病部位或更换照片,它们的答案从未改变。它们本质上是在阅读问题,并根据语言模式进行猜测。
- 令人震惊的事实: 其中一个“盲目”模型(一个从未看过 X 光片的纯文本 AI)在统计学上与表现最好的“视觉型”模型一样准确。这就像是一个侦探在从未去过犯罪现场的情况下,仅通过阅读警察报告就破获了案件。
“不稳定”的侦探:
- 对象: 一个大型模型(Mistral-Small-4-119B)。
- 行为: 即使你遮住了图像中无关紧要的部分,它也会改变答案。它对噪声过于敏感,无法让人信任它是否真的知道自己给出答案的原因。
“选择性”侦探(使用图像):
- 对象: 五个系统。
- 行为: 这些模型确实观察了图像,但仅在某些时候如此。
- 症结所在: 它们只针对特定的疾病(如肺炎或肺部积液)使用图像,而对其他疾病(如肺塌陷)则忽略图像。它们就像是一个侦探,只有当嫌疑人戴着红帽子时才会看照片,如果嫌疑人戴着蓝帽子,就会忽略照片。
4. “信心”陷阱
研究人员还检查了 AI 是否能识别自己何时在猜测。
- 发现: 那些真正观察图像的模型有时能分辨出自己是在“接地”(观察照片)还是在瞎猜。当它们只是在瞎猜时,会给出较低的置信度分数。
- 警告: 然而,“盲目”模型却是过度自信的。即使它们只是根据文本进行猜测,也会给出高置信度分数。这是非常危险的,因为医生可能会信任一个“高置信度”的答案,而那个答案其实只是一个幸运的猜测。
5. 人类对比
研究人员将这些 AI 与真正的放射科医生进行了对比。
- 结果: 一个“盲目”的纯文本模型在准确率(得出正确的“是/否”答案)方面,在统计学上与真正的放射科医生是无法区分的。
- 区别在于: 放射科医生实际上是在观察 X 光片(具备接地能力),而 AI 则没有。AI 用错误的原因得到了正确的答案。
核心结论
论文得出结论:准确率是不够的。 你不能仅仅因为一个医疗 AI 在测试中获得了高分就信任它。
- 隐喻: 如果你正在雇佣一名飞行员,你不仅希望飞机能安全着陆(准确率);你还希望知道飞行员是否真的在向窗外观察,还是仅仅在遵循一套恰好奏效的预设程序。
- 建议: 在让这些 AI 进入医院之前,我们需要进行这些“因果审计”,以确保它们确实在观察患者的 X 光片,而不是仅仅在背诵剧本。论文指出,接地性(证明 AI 观察了图像)对于临床安全而言,比单纯的准确率更为重要。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。