← 最新论文
💻 computer science

Active Evidence-Seeking and Diagnostic Reasoning in Large Language Models for Clinical Decision Support

本文引入了一个受客观结构化临床考试(OSCE)启发的主动诊断询问基准,揭示出大语言模型在多轮证据寻求过程中,相较于静态全上下文评估,其准确性和证据质量均出现显著下降,这主要归因于过早的诊断闭合和无效的提问。

原作者: Chen Zhan, Xihe Qiu, Xiaoyu Tan, Xibing Zhuang, Gengchen Ma, Yue Zhang, Shuo Li, Peifeng Liu, Xiaoxiao Ge, Liang Liu, Lu Gan

发布于 2026-05-22
📖 1 分钟阅读☕ 轻松阅读

原作者: Chen Zhan, Xihe Qiu, Xiaoyu Tan, Xibing Zhuang, Gengchen Ma, Yue Zhang, Shuo Li, Peifeng Liu, Xiaoxiao Ge, Liang Liu, Lu Gan

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是用通俗易懂的语言和富有创意的类比对该论文的解读。

核心理念:“全知者”与“侦探”之别

想象你正在参加一场医学考试。

场景 A(旧模式): 你拿到一个厚厚的文件夹,里面装着患者的完整人生故事、所有曾经出现过的症状、每一次血液检测结果以及每一张 X 光片。你通读全文,然后写下诊断。这就是目前大多数人工智能模型接受测试的方式。它们非常擅长这种“文件夹式”的考试。

场景 B(现实世界): 你走进一个房间,面对一位患者。你只知道他们“胸痛”。你还没有那个文件夹。你必须提问:“呼吸时会痛吗?”“你有吸烟史吗?”你必须逐一开具特定的检查单。你必须根据你所问的问题,亲手将文件夹一块块拼凑完整。

论文的发现: 研究人员构建了一项名为 ROUNDS-Bench 的新测试,旨在考察人工智能如何处理场景 B。他们发现了一个惊人的差距:在场景 A 中表现天才的 AI 模型,在场景 B 中往往惨败。

当被迫扮演必须主动索取线索的侦探角色时,AI 的准确率下降了约 13%,其收集证据的质量更是下降了近 25%


实验:一位“标准化患者”模拟器

为了公平地测试这一点,研究人员创建了一个数字化的“标准化患者”(就像戏剧中的方法派演员)。

  • 演员: 这位 AI 患者知晓完整的医疗故事,但被设定为:只有被问到正确的问题时,才会透露信息。
  • 规则: 如果医生(AI 模型)问:“告诉我一切”,患者会回答:“我做不到。”医生必须提出具体问题,例如:“你能描述一下你的疼痛吗?”或者“让我们检查一下你的心率。”
  • 目标: AI 必须像真正的医生一样,通过按正确顺序提出正确的问题来推断疾病。

他们在 468 个不同的医疗案例(涵盖从心脏问题到感染等各种情况)上,测试了 15 种不同的 AI 模型(包括 GPT-4o、Gemini 和 Qwen 等知名模型)。

他们的发现

1. 性能的“崩盘”

当 AI 被给予完整的文件夹(场景 A)时,它得分很高。但当它必须主动索取线索(场景 B)时,其表现急剧下滑。

  • 类比: 想象一个学生在选择题考试中得了"A",因为他能通读整本教科书。但如果你把他关在一个充满谜团的房间里,告诉他只能问三个问题来解开谜题,他可能会完全猜错答案。
  • 结果: AI 不仅仅是“稍微少对了一点”;它往往从 100% 正确 直接变成 完全错误。它不再谨慎,而是基于极少的信息开始胡乱猜测。

2. 幻觉推理的“魔术”

这是最危险的发现。有时,AI 会猜出 正确 的疾病,但它无法根据它实际找到的线索解释 为什么 它是正确的。

  • 类比: 想象一位侦探破解了一起谋杀谜案。他说:“是管家干的!”(正确)。但当被要求提供证据时,他说:“因为我看到了一个影子”,尽管案卷中从未提及过这个影子。他们只是出于错误的原因猜对了答案。
  • 风险: 在真实的医院里,如果医生信任一个声称“就是这个病”却无法指出证明该结论的具体检测结果的 AI,那将构成安全隐患。论文将这种现象称为 “幻觉推理”

3. 规模并不总是救星

你可能会认为更大、更聪明的 AI 模型会是更好的侦探。

  • 现实: 虽然大模型的表现略优于小模型,但即使是最大、最昂贵的模型仍然举步维艰。它们擅长阅读整个文件,却不擅长在手中没有文件时知道 下一步该问什么
  • “蒸馏”陷阱: 有些模型被训练为“逐步思考”(推理模型)。论文发现,虽然这些模型在桌上摆满所有拼图时擅长解谜,但当它们必须走出去 寻找 缺失的拼图时,它们就会陷入困惑。

4. 某些疾病更难“侦测”

AI 在处理心脏和肺部问题(通常具有清晰、标准的症状)时表现尚可。但在 神经系统(大脑/神经)和 代谢(血液生化)案例中,它却彻底崩溃。

  • 原因? 这些领域需要非常具体、细致的提问(例如“你左脚的反射是否微弱?”)或涉及实验室数值的复杂计算。AI 难以确切知道该问哪个具体问题才能得到正确答案。

结论

该论文认为,我们一直在称赞 AI 医生擅长 阅读 医疗文件,却未充分测试它们 执行 医生工作(提问和收集线索)的能力。

核心启示: 仅仅因为 AI 能通过书面医学考试,并不意味着它能安全地与患者交谈并找出病因。为了让 AI 能够安全地应用于真实医院,我们需要停止用“文件夹”来测试它们,转而将它们作为必须靠努力赢取答案的“侦探”来测试。

研究人员创建了这项新测试(ROUNDS-Bench),旨在帮助开发者修复这些“侦探技能”,以便未来的医疗 AI 不仅能猜对答案,还能真正明白 为什么 它是正确的。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →