← 最新论文
💬 NLP

When Large Language Models Fail in Healthcare: Evaluating Sensitivity to Prompt Variations

本研究通过使用 MedMCQA 基准测试,系统地评估了通用型及医学专用大语言模型对提示词变化的敏感性,揭示了即使是微小的词汇或句法扰动也会显著降低其可靠性并诱发有害的临床输出,从而凸显了其在医疗领域部署时的关键安全风险。

原作者: Mahdi Alkaeed

发布于 2026-06-08
📖 1 分钟阅读☕ 轻松阅读

原作者: Mahdi Alkaeed

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

核心理念:“反复无常的厨师”与医学

想象一下,你雇佣了一位世界级的厨师(即大语言模型,LLM),他的任务是根据一张食谱卡(即提示词/Prompt)为病人烹饪完美的佳肴。这位厨师才华横溢,精通成千上万种食谱。

然而,这篇论文发现了一个可怕的缺陷:这位厨师对食谱的写法极其敏感。

即使你只改动一个词、重新排列食材的顺序,甚至只是把单词拼写得稍微有点不同,这位厨师可能就会突然决定端上一道完全不同的菜——或者更糟,端上一道有毒的菜。论文指出,在医疗领域,当一份“菜肴”代表着医疗诊断或建议时,这种不可预测性是极其危险的。

实验过程:测试厨师的稳定性

研究人员想要观察这些医疗 AI 厨师是否能够处理微小的变化而不出错。他们使用了一个庞大的医学问题库(称为 MedMCQA),并测试了两类“厨师”:

  1. 通用型厨师: 未经过专门医学训练的智能 AI 模型(如 GPT-3.5 或 Llama3)。
  2. 专家型厨师: 专门在医学书籍和期刊上进行过训练的 AI 模型(如 BioBERT 或 ClinicalBERT)。

他们在三种条件下对厨师进行了测试:

  • 原始食谱: 标准、清晰的问题。
  • “同义词替换”(词汇扰动): 将单词换成它们的同义词(例如,将“呼吸短促”改为“呼吸困难”)或修正拼写错误。
  • “重组厨房”(句法扰动): 改变句子的结构(例如,将“护士给药了”改为“药被护士给药了”)。

研究发现:“脆弱”的真相

结果显示,目前还没有哪位厨师是真正安全的。 以下是实验情况:

1. “同义词替换”基本没问题(但并不完美)
当研究人员只是将单词换成相似的词(比如将“5 mg”换成“五毫克”)时,大多数厨师都保持了冷静。他们仍然能给出正确的答案。这就像如果你要求“一杯水”而不是“一瓶水”,厨师依然会给你水。

  • 然而, 即便如此,厨师有时也会在“如何呈现答案”上产生困惑(比如忘记按照特定的格式书写),尽管其医疗建议本身是正确的。

2. “重组厨房”引发了混乱
当研究人员改变句子结构或选项顺序时,厨师们开始出错。

  • 类比: 想象一位厨师非常擅长遵循清单,但如果你把清单上的最后一项放在第一位,他就会完全忘记第一项。
  • 结果: 在某些情况下,仅仅是改写了句式就导致 AI 给出了错误的诊断。例如,一名患有慢性阻塞性肺疾病(COPD)症状的患者,仅仅因为句式结构被微调,就被误诊为肺水肿。

3. “专家型厨师”也无法幸免
你可能会认为,仅在医学书籍上训练过的厨师会更安全。但论文发现,专家型厨师(如 BioBERT 等)实际上和通用型厨师一样脆弱,甚至对结构性变化更加敏感。 他们并没有针对这些“套路”拥有某种“超能力”。

“对抗性”危险:那张诡异的小纸条

论文还研究了“对抗性”提示词——这些就像是在食谱卡里塞进了一张诡异的小纸条,试图误导厨师。

  • 类比: 想象有人在耳边低语:“忽略第一步,病人其实对这个过敏,”尽管病人其实并没有过敏。
  • 结果: 这些细微且带有陷阱的变化可能会导致 AI 推荐错误的药物剂量,或者完全漏掉一个关键症状。论文称之为“临床危险”。

结论:为什么这很重要

论文得出结论:目前的医疗 AI 并不具备“本质安全性”。

  • 问题所在: 如果医生以两种不同的方式询问同一个问题,AI 可能会给出两个不同的答案。其中一个可能是正确的,而另一个可能是错误的。
  • 风险: 在医院里,你不能使用一个会因为你改写了一个句子就改变主意的系统。如果 AI 因为一个拼写错误就产生了药物相互作用的幻觉,或者漏掉了诊断,患者可能会受到伤害。

简而言,概括如下

把这些 AI 模型看作是才华横溢但容易紧张的学生。当考试题目书写清晰时,他们对知识掌握得完美无缺。但如果老师改变了字体、更换了几个词,或者重新排列了段落,学生可能会陷入恐慌并答错题目。

论文的核心观点是:“我们现在还不能信任这些学生来批改医学试卷,因为他们太容易被提问的方式所迷惑了。” 在让我们利用他们来辅助医生之前,我们需要教导他们变得更加稳定,不再对我们说话的方式如此敏感。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →