Clinical Reasoning Graphs: Structured Evaluation of LLM Diagnostic Reasoning Reveals Competence Without Consistency
本文通过引入临床推理图来评估大型语言模型在《新英格兰医学杂志》(NEJM)病例上的表现,并发现尽管大型语言模型展现出了诊断能力,但它们在临床相似病例中缺乏一致的、模式层面的推理规律,这凸显了在最终答案准确率之外进行过程层面评估的必要性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明
想象一下,你正在试图弄清楚一个学生是真的掌握了某个学科,还是仅仅记住了特定测试题的答案。
这篇论文是对大语言模型(LLMs)——即我们今天使用的 AI 聊天机器人——进行的一次深度调查,旨在观察它们究竟是在像医生一样“思考”,还是仅仅在通过模式匹配来获得正确答案。
以下是他们发现的研究结果,通过简单的语言进行了拆解:
1. 设置: “医学谜题”测试
研究人员从《新英格兰医学杂志》中提取了 50 个真实的复杂医学案例(可以理解为高风险的医学谜题)。他们要求五种不同的顶级 AI 模型来解决这些案例。
他们不仅仅看最终答案(例如:“患者患有肺炎”),还观察了 AI 写下的整个思考过程。这被称为“推理轨迹”(reasoning trace)。
2. 问题:“黑盒”思维
通常情况下,AI 的推理只是一堆文本墙。很难比较两个不同的 AI 解释,以判断它们是否使用了相同的逻辑。
- 类比: 想象两个学生在写关于汽车为何故障的论文。一个说:“引擎很热,所以散热器失效了。”另一个说:“车很热,所以引擎失效了。”他们得出了相同的结论,但他们的逻辑是不同的。如果你只读这些文章,很难判断他们是否在使用相同的“思维蓝图”。
3. 解决方案:将想法转化为“地图”
为了解决这个问题,研究人员发明了临床推理图(Clinical Reasoning Graphs)。
- 隐喻: 他们将杂乱的文本转化为了流程图或路线图。
- 地图:
- 节点(Dots): 代表诸如“症状”、“可能的疾病”、“线索”和“证据”等内容。
- 边(Edges): 是连接关系,例如“该症状支持该疾病”或“该线索排除了那项疾病”。
他们建立了一套特定的规则(本体论/ontology),以确保每张 AI 地图都使用同一种语言进行绘制。他们成功地将 750 篇不同的 AI 文章转化成了 750 张结构化的地图。
4. 核心问题:AI 是否拥有“思维蓝图”?
在人类医生身上,专家会使用一种叫做**诊断图式(Diagnostic Schema)**的东西。
- 类比: 当人类医生看到一名患者出现胸痛并伴有特定的心律时,他们的大脑会立即调出预设好的“胸痛蓝图”。他们知道应该寻找哪些线索,以及如何排除其他可能性。如果他们看到另一位具有相同症状的患者,他们会使用同一个蓝图。
研究人员提出了疑问:AI 是否也这样做?
如果 AI 看到两个患有同种肾脏疾病的患者,它会画出两张非常相似的地图吗?还是说它会画出两张完全不同的地图,而这两张地图恰好导向了同一个答案?
5. 研究结果:有能力,但无一致性
结果令人惊讶,对于那些信任 AI “推理”的人来说,甚至有些令人不安。
- 结果: AI 模型在获得正确答案方面表现出色(能力/Competence)。但是,当观察这些地图时,模型并没有使用一致的蓝图。
- 隐喻: 想象两个学生在参加数学考试。两人都得到了正确的答案“42”。
- 学生 A 每次都使用标准的公式。
- 学生 B 对每一个题目都使用不同的、奇特的技巧,尽管题目本身是完全一样的。
- 这项研究: AI 模型就像学生 B。当面对相似的医学案例时,它们画出的地图完全不同。即便最终诊断相同,这些地图看起来也毫无相似之处。
关键结论: AI 足以“聪明”到得到正确答案,但它并不是以一种稳定、可重复的方式进行“思考”的。它本质上是在为每一个案例重新发明轮子。
6. “准确性陷阱”
论文发现,答对并不意味着你的思维具有一致性。
- 类比: 如果你连续 10 次猜对了考试题,你看上去很聪明。但如果你每次都使用不同的、随机的猜测策略,那么你并没有真正掌握知识。
- 研究表明,即使两个 AI 的诊断结果都是错误的,它们的推理地图看起来也和它们答正确时一样(或同样不相似)。这证明了它们的“思维结构”与它们是否真的正确是两回事。
7. “更努力地思考”是否有帮助?
研究人员尝试了一种叫做“结构化反思”(Structured Reflection)的技巧,即告诉 AI:“停下来,思考一下你的第一个答案,针对它进行辩论,然后再做决定。”
- 结果: 这让 AI 写出了更详细的地图,包含了更具体的线索。然而,这并未让地图在不同案例之间变得更具一致性。AI 在面对新患者时,仍然会使用不同的“蓝图”。
底层逻辑
论文得出结论:我们不能仅仅因为 AI 的推理看起来合乎逻辑,或者因为它得到了正确答案,就去信任它的“推理”。
- 警告: 仅仅因为 AI 的解释看起来像医生的思考过程,并不意味着它拥有稳定、可复用的思维方式。它可能只是一个非常擅长模式匹配的程序,并且恰好运气不错。
- 好消息: 通过将这些想法转化为“地图”(图结构),我们现在可以真正地“看到”并衡量这种不一致性。我们可以停止假设 AI 正在像人类一样思考,转而开始精确测量它究竟是如何思考的。
简而言之: AI 是一个天才的即兴表演者,它每次都能给出完美的结局,但它永远不会使用同一套剧本。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。