Possible or Definite? A Benchmark for Evaluating Diagnostic Uncertainty Preservation in Clinical Text
本文引入了一个包含 1,200 份临床文档的基准测试,旨在评估大语言模型在保留诊断不确定性方面的表现,结果显示当前模型经常无法维持这些关键的细微差别,从而为安全的临床部署带来了风险。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
核心理念:“也许”与“肯定”之争
想象一下,你是一名正在编写病历报告的医生。你并不百分之百确定患者是否患有肺炎,所以你写道:“疑似肺炎(Possible pneumonia)。”
在医学界,“疑似”这个词是一个安全阀。它是在告诉下一位医生:“我们需要继续观察;先不要开始重症治疗。”如果你把它改成直接写成**“肺炎(Pneumonia)”**,意思就完全变了。现在,接诊医生可能会认为:“好吧,已经确诊了,”从而开始不必要的治疗,或者跳过重要的检查。
这篇论文提出了一个简单但令人担忧的问题:如果我们要求一个聪明的 AI(大语言模型)来重写或总结这些医疗笔记,它能否保留住那个“也许”,还是会不小心把“也许”变成了“肯定”?
实验过程:为 AI 构建一场“压力测试”
研究人员并没有仅仅靠猜测,而是构建了一个大规模的“压力测试”,以观察 AI 的行为表现。
- 训练场: 他们从医院和癌症数据库中收集了 1,200 份真实的医疗文件(如出院小结和实验室报告)。
- 地图: 他们在这些文本中标记了超过 9,000 个特定的位置,这些地方体现了医生表达的不确定性。他们创建了一个 5 级的量表,范围涵盖:
- 第 1 级(确定不存在): “不,患者绝对没有这个情况。”
- 第 2 级(可能/很可能): “很有可能,但不是 100%。”
- 第 3 级(疑似/可能): “可能是,但我们不确定。”
- 第 4 级(不确定/不明): “我们没有足够的信息来判断。”
- 第 5 级(未提及/非断言): “我们需要稍后检查这一点。”
- 测试: 他们将这些文件输入到三个流行的 AI 模型(来自 OpenAI、Google 和 Anthropic)中,并要求它们完成两件事:
- 总结(Summarize): 为其他医生编写一个简短版本。
- 重写(Rewrite): 将专业术语转化为面向患者的通俗易懂的语言。
他们通过两种方式测试 AI:
- “常规”方式: 直接要求进行总结或重写。
- “谨慎”方式: 给它一个严格的规则:“不要改变确定性的程度。如果原文说的是‘也许’,请务必保持为‘也许’。”
结果:AI 是一个“自信过度”的编辑
结果显示,AI 有一种表现得过于自信的严重习惯。
1. “自信陷阱”
当 AI 重写文本时,它经常会完全删掉那些表示“也许”的词汇。
- 类比: 想象一位天气预报员说:“有可能会下雨。”如果你要求 AI 为一位野餐策划者进行总结,它可能会说:“会下雨。”它并没有对“下雨”这件事撒谎,但它去掉了不确定性,让天气预报听起来像是一个保证。
- 数据统计: 即使 AI 保留了医学事实(例如“肺炎”),它保留正确不确定性程度的次数也不足 50%。
- 最严重的错误: 大约有 40% 的情况下,AI 会将一个“疑似”的诊断变成一个“确诊”的诊断。这是最危险的一种错误,因为它听起来权威,但实际上只是个猜测。
2. “患者”与“医生”之间的差距
AI 在为患者重写文本时,表现得比为医生重写时更差。
- 类比: 在与医生交流时,AI 表现得像一个谨慎的编辑,保留了细微的差别。但在与患者交流时,它表现得像一个试图简化情节的故事讲述者,为了让故事流畅,往往会删掉那些“剧情漏洞”(即不确定性)。
- 结果: 当尝试编写“患者友好型”文本时,AI 丢弃了更多的医学事实,也改变了更多的确定性。
3. “神奇提示词”并没奏效
研究人员尝试通过给 AI 一个严格的指令来解决这个问题:“请保留不确定性!”
- 结果: 这确实有一点帮助(将准确度提高了约 10–20%),但并没有解决根本问题。AI 仍然会过于频繁地把“疑似”变成“肯定”。这就像是告诉一名学生,“考试时不要瞎猜”,但他们还是照猜不误。
4. “排序”测试
在第二个测试中,他们要求 AI 查看一系列句子,并按“最确定”到“最不确定”进行排序。
- 结果: AI 在区分“绝对没有”和“绝对有”方面表现尚可。但在试图区分“很可能”和“疑似”时,它变得非常困惑。它很难看清那些极其相似的怀疑程度之间的细微界限。
总结
论文的结论是,虽然这些 AI 模型在听起来流畅且语法完美方面做得很好,但它们目前并不擅长保留医学语言中的“灰色地带”。
它们倾向于把“也许”变成“是的”。在医院里,这不仅仅是一个拼写错误;这是一个改变了医学含义的行为,可能会导致错误的检查或治疗。作者警告说,在我们能够教会 AI 像尊重“确定”一词一样尊重“可能”一词之前,我们不能仅仅依赖这些 AI 工具来总结医疗笔记。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。