← 最新论文
💬 NLP

Medical Context Distorts Decisions in Clinical Vision Language Models

本文揭示,临床视觉 - 语言模型在现实场景中往往因过度依赖文本信息、被无关临床病史误导以及对提示词变化高度敏感而失效,从而凸显了在将其部署于医疗实践之前进行严格压力测试和设置安全措施的迫切需求。

原作者: David Restrepo, Ira Ktena, Maria Vakalopoulou, Stergios Christodoulidis, Enzo Ferrante

发布于 2026-05-19
📖 1 分钟阅读☕ 轻松阅读

原作者: David Restrepo, Ira Ktena, Maria Vakalopoulou, Stergios Christodoulidis, Enzo Ferrante

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一支由高度智能的医疗助手(即 AI 模型)组成的团队,他们的工作是查看胸部 X 光片,并判断患者是患病还是健康。他们拥有两个信息来源:X 光片的图像,以及描述患者病史的医生书面笔记

论文《医疗语境扭曲临床视觉语言模型的决策》就像是对这些助手进行的一次压力测试。研究人员希望了解,当书面笔记与图像内容相矛盾时,这些 AI“医生”是否真的能信任 X 光片图像,还是会盲目地跟随文本。

以下是他们的发现,通过简单的类比进行解释:

1. “文本压倒图像”问题(响亮的声音)

类比: 想象你正在看一张阳光明媚的海滩照片。然而,有人递给你一张纸条,上面写着:“这张照片是在暴风雪期间拍摄的。”尽管你的眼睛清楚地看到了阳光和沙滩,但本研究中的 AI 助手大多忽略了照片,而相信了那张纸条。

发现: 研究人员发现,这些 AI 模型过度依赖文本。当 X 光图像与书面报告不一致时,AI 几乎总是站在文本一边,即使文本是错误的。

  • 如果 AI 原本能根据图像做出正确的诊断,但研究人员替换了一份令人困惑或矛盾的书面报告,AI 会突然改变主意并得出错误结论。
  • 令人惊讶的是,如果研究人员将图像替换为另一张不同的图像,但保留原始文本,AI 几乎察觉不到。这就像图像是耳语,而文本是呐喊。

2. “无关病史”陷阱(杂乱的办公桌)

类比: 想象一名侦探正在厨房调查一起犯罪案件。但有人不断将关于发生在另一个城市的犯罪,或是关于不同类型犯罪(例如骨折而非盗窃)的笔记滑到他的办公桌上。侦探被搞糊涂了,因为过多的干扰噪音,开始错误地指责某人。

发现: 在真实医院中,AI 系统通常会调取患者的完整病史,包括与当前胸部 X 光片无关的关于膝盖、大脑或胃部的旧报告。

  • 研究表明,当 AI 被输入这些无关的过往报告时,其性能会下降。它被“噪音”搞糊涂了。
  • 虽然最先进的“前沿”模型更擅长忽略这些杂乱信息,但许多开源模型在接收到越来越多无关病史时,表现会显著变差。它们无法区分“重要语境”和“无用背景噪音”。

3. “提示词敏感性”问题(魔法措辞)

类比: 想象你问朋友:“天空是蓝色的吗?”他们回答:“是。”然后你问:“你能确认天空的颜色吗?”他们回答:“否。”问题是一样的,但提问的方式改变了他们的回答。

发现: 研究人员使用四种不同的写作风格(例如:随意的问题、正式的医生指令、清单)提出了相同的医疗问题。

  • 对于较弱的 AI 模型,改变提示词的措辞会导致它们翻转答案。同一个问题的一个版本可能回答“患病”,而该问题的另一个略微不同的版本可能回答“健康”。
  • 这意味着 AI 的决策并非基于医疗事实,而是基于请求的具体措辞。这是危险的,因为不同的医生会以不同的风格书写笔记;如果 AI 仅仅因为风格改变而改变主意,那它就是不可靠的。

全局视角

该论文得出结论:尽管这些 AI 模型在标准测试中得分很高,但在现实世界场景中它们是脆弱的。

  • 它们更信任文字而非图像。
  • 它们会被无关的病史搞糊涂。
  • 它们会根据你提问的方式改变主意。

作者认为,在我们让这些 AI 系统协助做出真实的医疗决策之前,我们需要对其进行更严格的“压力测试”,以确保它们不会被文本、杂乱信息或措辞所分散注意力。它们需要学会首先查看 X 光片,而不仅仅是阅读笔记。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →