Uncertainty Reasoning with Large Language Models for Explainable Disease Diagnosis
本文提出了一种神经符号框架,将大语言模型与模糊逻辑及形式化规则相结合,通过将非结构化的临床叙事转化为可审计的推理链,从而实现可解释、可验证且与人类认知一致的疾病诊断。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在试图解开一个复杂的谜团,比如弄清楚汽车为什么无法启动。你拥有两种截然不同的工具来帮助你:
- 直觉侦探(大语言模型):这是一位超级聪明的侦探,他阅读过每一本汽车手册,也听过每一个关于故障汽车的故事。他可以看到诸如“天冷时偶尔会发出奇怪的咔哒声”这样混乱、模糊的描述,并立刻猜出:“啊,很可能是启动电机!”他们擅长理解混乱的语言并发现隐藏的线索。然而,他们有时会凭空捏造(产生幻觉),无法总是解释为什么会做出那样的猜测,而且他们的信心可能并不稳固。
- 严格法官(符号逻辑):这是一位遵循严格规则手册的法官。如果规则规定“如果启动电机损坏 且 电池良好,那么 汽车无法启动”,法官会完美地遵循它。他们从不凭空捏造,并且能向你展示他们所使用的规则手册的确切页码。但是,他们非常不擅长理解模糊的语言。如果你说“它发出某种咔哒声”,法官会感到困惑,因为他们的规则需要确切、清晰的事实。
问题:
现实生活中的医疗诊断就像那个汽车谜团,只不过主角换成了患者。患者用混乱、模糊的方式描述他们的症状(“我觉得有点累”,“我的胸口感觉像被皮带勒紧”)。医生需要结合侦探理解这种混乱语言的能力,以及法官遵循严格规则并解释其推理的能力。目前,人工智能系统通常只选择其中一种,导致它们要么过于模糊而不可信,要么过于僵化而无法理解。
解决方案:“神经符号”联手
本文提出了一种新系统,将直觉侦探和严格法官联手,创建一个医疗诊断助手。其工作原理如下,分步说明:
1. 翻译阶段(从侦探到法官)
首先,系统使用大语言模型(侦探)来阅读患者混乱的叙述。
- 魔法:侦探将“胸口像被皮带勒紧”或“断断续续的疼痛”等模糊短语翻译成结构化、逻辑化的事实。
- 转折:系统不是将这些转化为简单的“是/否”事实,而是将其转化为模糊事实。这就像调光开关而不是电灯开关。它不说“疼痛=是”,而是说“疼痛=80% 为真”。这捕捉到了“轻微”或“严重”的细微差别。
2. 推理阶段(法官的法庭)
一旦混乱的故事被翻译成这些模糊的、加权的事实,它们就会被传递给符号逻辑引擎(法官)。
- 过程:法官查阅医疗规则库(例如,“如果胸痛 + 运动 + 家族史 → 检查心绞痛”)。
- 计算:法官不只是说“有罪”或“无罪”。他们根据证据的强弱计算分数。如果疼痛是“轻微”的(权重 0.5),但家族史很强(权重 1.0),系统会计算出诊断的最终概率分数。
- 输出:它生成一个可能的疾病排名列表(例如,“稳定型心绞痛:72% 可能”,“心脏病发作:10% 可能”)。
3. “可解释”的超能力
这是最重要的部分。由于系统使用法官的严格规则,它可以为每个决策生成一份逐步明细单。
- 类比:如果普通人工智能说“你头痛”,这就像是一个魔术 8 球在给出答案。而这个系统会说:“你头痛是因为:(1) 你说你的头很痛(80% 置信度),(2) 你提到了压力(70% 置信度),以及 (3) 规则手册规定压力 + 头痛=紧张性头痛。”
- 审计轨迹:如果医生不同意,他们可以查看这份“明细单”,确切地看到触发了哪条规则,甚至可以调整权重(例如,“实际上,疼痛没那么严重,降低分数”)。系统会根据该反馈立即重新计算诊断。
4. 学习循环
系统不是静态的。它拥有一个“神经符号循环”:
- 人类反馈:如果医生纠正了系统,系统会更新其规则权重。
- 数据学习:如果系统发现特定症状(如“锐痛”)在数千个新病例中总是与特定疾病同时出现,它会自动调整规则以反映这种新模式。
论文发现(结果)
作者将这种“联手”系统与纯人工智能侦探(如 GPT-4)和纯逻辑法官进行了测试比较。
- 准确性:与顶级人工智能模型相比,混合系统在获得正确诊断方面同样出色,有时甚至更好。
- 信任度:与纯人工智能模型不同,该系统可以展示其工作过程。它为它的猜测提供了清晰的理由。
- 成本:有趣的是,虽然该系统运行时间稍长,但使用成本(“令牌”使用量)显著低于让一个庞大的人工智能模型独自完成所有工作。
- 鲁棒性:当数据混乱或模糊时,该系统通过利用“调光开关”(模糊逻辑)方法而不是卡在精确匹配上,很好地处理了这种情况。
总结:
本文提出了一种构建医疗人工智能的方法,使其表现得像创意翻译员与严格会计师之间的协作。它利用人工智能理解患者混乱的人类语言,将其转换为数学上精确的格式,然后利用严格的逻辑来诊断疾病。其结果是一个不仅聪明,而且诚实、透明,并能确切解释其如何得出结论的系统。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。