← 最新论文
💻 computer science

Sparse Multi-Stage Expert-Agent Routing for Complex Clinical Reasoning

本文提出了一种稀疏多阶段专家代理路由(Sparse Multi-Stage Expert-Agent Routing)框架,该框架能够在不断演变的临床阶段中自适应地激活最小化的医学专家代理集合,以在显著降低资源消耗的同时实现高诊断准确率,并引入了一种与临床医生判断强相关的全新事实感知评估指标(ClinFEScore)。

原作者: Sike Xiang, Shuang Chen, Qian sun, Jia Cheng, Yusi Wei, Amir Atapour-Abarghouei

发布于 2026-08-25
📖 1 分钟阅读☕ 轻松阅读

原作者: Sike Xiang, Shuang Chen, Qian sun, Jia Cheng, Yusi Wei, Amir Atapour-Abarghouei

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

诊断复杂疾病很少是一个瞬间清晰的过程。它是一个缓慢展开的故事,患者的症状、血液检查、影像扫描和随访观察会一个接一个地到来,通常跨越数天或数周。随着新事实的出现,医生必须不断修正他们的思维,有时甚至需要引入不同领域的专家来帮助解读不断变化的图景。这种被称为“临床推理”的过程很难实现自动化,因为它需要一个能够随着新信息的到来而进行学习的系统,而不仅仅是根据静态的症状列表进行猜测。目前的人工智能工具往往在这方面表现不佳;它们要么根据看到的第一个信息片段做出单一猜测,要么调用一个固定的虚拟专家团队从头到尾讨论每一个病例,无论是否真的需要所有这些专家。这种方法效率低下,既浪费时间又浪费计算能力,而且未能模拟人类医生解决复杂医学难题时那种自然的、演进式的思维方式。

杜伦大学的研究人员开发了一种新方法,旨在教导人工智能如何像人类团队一样通过复杂的医疗病例进行推理。他们创建了一个名为“稀疏多阶段专家代理路由”(Sparse Multi-Stage Expert-Agent Routing)的系统。该系统并非要求一大组虚拟专家完整地审查每一个病例,而是将诊断过程分解为多个阶段,以匹配医疗证据实际呈现的方式。在每个阶段,系统都会查看患者病例的当前状态,并决定现在需要哪位特定的专家。它可能首先由一名全科医生评估初始症状,然后在 X 光片可用时才请放射科医生介入,如果特定的检测结果指向某个方向,随后可能还会请遗传学家参与。至关重要的是,该系统被设计为“稀疏”的,这意味着它仅激活当前真正必要的少数专家,而不是耗尽所有可能的资源。

为了测试这个想法,研究人员构建了一个框架,让人工智能维护一份病例的持续记录,并随着新证据的加入不断更新其理解。他们在重建的医疗病例上训练该系统,在这些病例中,信息是以序列形式呈现的,模拟了真实的医院调查过程。系统学会了为每个潜在的专家代理分配一个“激活分数”。如果分数足够高,该专家就会被邀请贡献其推理;如果分数不够,则保持沉默。这一决策过程由一个记忆系统支持,该系统允许专家记住他们之前的贡献,而无需进行不必要的重复咨询。团队还发明了一种衡量人工智能最终诊断质量的新方法。他们没有仅仅检查人工智能生成的文字是否与正确答案匹配,而是开发了一个名为 ClinFEScore 的工具,用于检查人工智能的结论是否得到了病例中实际呈现的医学事实的支持,从而确保其推理是严谨的,而非仅仅是运气好猜中了答案。

实验结果令人瞩目。与在每个阶段都调用所有可用专家的系统相比,这种新的稀疏路由方法将单个病例涉及的专家平均数量从 17 个减少到了仅 3 个。尽管使用的资源大幅减少,但诊断质量依然保持在高水平,系统在识别正确的医学事实方面保持了很高的准确性。在利用模拟数据进行的测试中,新方法在保持与成本高得多的“全员配备”方案相当的诊断质量的同时,显著降低了计算的预估能量成本。研究人员还在 200 个来自医院多学科团队的真实案例中测试了他们的系统。在这些现实场景中,该系统的诊断准确率达到了 91.5%,并得到了人类医生的验证。此外,他们创建的新评估工具 ClinFEScore 显示出与人类医生判断推理质量的高度一致性,这证实了该系统不仅是在生成看起来正确的文本,而且确实是在基于证据进行正确的推理。

这项研究表明,高效医疗人工智能的关键不在于拥有更多的专家或更多的计算能力,而在于拥有一种更聪明的协调方式。通过使专家的参与取决于每一步所获得的证据,该系统避免了重复提问或咨询对情况毫无贡献的专家的冗余行为。研究人员发现,这种方法在不同类型的底层人工智能模型上都表现良好,这表明改进来自于路由策略本身,而非特定的语言模型。虽然这项工作是一个重要的进步,但作者指出,未来的研究需要在该方法在更多样化的医院和医疗流程中进行测试,以确保其在多样化的现实环境中保持可靠。目前,这些发现为开发能够以专业医疗团队般的效率和适应性处理复杂医疗推理的人工智能系统提供了一条充满希望的路径。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →