← 最新论文
🤖 AI

EviDx: Evidence-Aware Active Diagnosis with Scaffolded LLM Agents

本文介绍了 EviDx,这是一个证据感知型主动诊断框架,它利用支架式大语言模型智能体(scaffolded LLM agents)和运行时控制机制(runtime harness)来动态获取临床证据并管理诊断不确定性,从而与静态预测模型相比,提升了诊断性能和过程稳定性。

原作者: Lihang Zeng, Shaoting Zhang, Xiaofan Zhang

发布于 2026-08-26
📖 1 分钟阅读☕ 轻松阅读

原作者: Lihang Zeng, Shaoting Zhang, Xiaofan Zhang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在现实世界中,医生不会通过阅读一段文字就立刻猜出一个答案来诊断病人。诊断是一个寻找线索的缓慢且主动的过程。医生会倾听病人的陈述,然后开具血液检查单、查看 X 光片,或询问家族病史。随着每一项新信息的加入,医生都会更新其可能的病因清单,排除一些可能性,并缩小关注范围。他们必须不断决定何时已经收集了足够的证据来做出判断,以及何时需要继续寻找。这种寻求证据、权衡可能性并知道何时停止的过程,正是临床推理的核心。

多年来,研究人员一直试图教会计算机如何进行这项工作,使用的是大型语言模型——即那些能够像人类一样写作和聊天的强大人工智能系统。然而,这些系统大多被训练成将诊断视为一场静态的测验。它们被一次性交给一个完整的病例故事,并被要求立即吐出最终答案。这种方法忽略了医学运作的本质。它迫使计算机在有机会进行调查之前就去猜测解决方案,就像要求一名学生在不让使用计算器或草稿纸的情况下解决数学题一样。虽然这些模型可以回忆医学事实,但它们往往无法模拟那种防止错误的、细致且循序渐进的证据收集过程。

一项新研究介绍了一个名为 EviDx 的系统,旨在改变人工智能智能体处理医学诊断的方式。研究人员没有给计算机一个完整的病例档案,而是构建了一个虚拟环境,要求 AI 必须主动寻求信息。想象一个数字化的病房,病人的记录、化验结果和影像扫描件都被锁在不同的抽屉里。AI 智能体无法一次性看到所有内容;它必须请求特定的检查,等待结果,然后决定下一步要申请什么。该系统包含一套引导智能体行为的规则,确保它检查正确类型的信息,并且在完成必要的调查之前不会停止搜索。

研究人员还添加了一个安全监控器,即一个实时观察智能体进展的数字监督者。这个监控器检查两件事:智能体对诊断仍有多少困惑,以及它实际查看了多少可用证据。如果智能体试图在仍处于不确定状态或跳过了重要检查时过早宣布诊断,监控器就会阻止它并强制其继续调查。这防止了计算机基于不完整的信息做出自信的猜测。该系统在数百个真实的临床案例上进行了测试,涵盖了从复杂的急诊室场景到详细的期刊报告,并使用了多种不同的 AI 模型。

结果显示,这种主动寻求证据的方法比旧的静态猜测法效果显著更好。使用 EviDx 的 AI 智能体在识别正确诊断方面准确度更高,尤其是在需要从一系列选项中进行选择时。该系统通过引导它们找到正确的线索,帮助即使是规模较小、功能较弱的模型也表现得更好。然而,研究也发现了一个明显的局限:虽然该系统可以教会智能体如何收集证据并组织思路,但它无法修复基础医学知识的匮乏。如果 AI 模型本身并不了解某种特定疾病,以至于无法理解它发现的线索,那么它仍然难以得出正确的结论。

研究人员还发现,这些系统的最大障碍不仅在于医学知识,还在于遵循严格指令的能力。许多较小的 AI 模型经常在请求信息的方式上出错,例如请求格式不正确或未能正确使用工具。这些技术故障经常导致整个诊断过程崩溃。该研究表明,要使人工智能成为可靠的医疗伙伴,评估的标准不能仅限于它是否得到了最终答案,还要看它在调查过程中的表现。它是否寻找了正确的证据?它在获得足够信息后是否停止了?这一新框架证明,构建一个模仿人类诊断那种主动且谨慎特性的系统是可能的,但这需要精心的设计,以确保计算机始终行驶在正确的路径上。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →